如何撰写真正有效的 AI 视频提示词:五维框架

汉娜

AI 视频生成器可以将简短的描述转化为动态场景,但模糊的提示词往往会导致模糊的结果。主体可能在第一帧看起来正常,随后变形;镜头可能静止不动,或者多个动作混杂成令人困惑的混乱运动。

解决方法并不是在提示词中堆砌更多形容词。更好的方法是撰写一份紧凑的分镜头简报:明确画面中有什么、发生了什么变化、镜头如何观察它,以及哪些细节必须保持稳定。本指南将通过五维框架、真实视频案例、即拷即用的模板以及简易的修改工作流,详解如何撰写 AI 视频生成提示词。

什么是有效的 AI 视频提示词?

有效的 AI 视频提示词能够给模型提供清晰的视觉指令。它能够明确主体、描述一项可见的动作、将该动作置于特定环境中、执导镜头运动,并定义镜头的整体视觉风格。

较弱的提示词:

A beautiful woman walking in a cinematic city.

这留下了许多重要的未知项。这位女性长什么样?她是走向镜头还是远离镜头?镜头是静止的还是移动的?模型应该采用哪座城市、什么具体时间以及怎样的光影?

更有效的提示词:

A young woman with short dark hair, a black leather jacket, and dark trousers walks slowly through a rain-soaked Tokyo street, then turns toward the camera. Medium side-tracking shot with a gentle forward push. Wet pavement reflects blue and pink neon, with light mist in the air. Realistic 35mm film look, low-saturation colors, soft neon side light, 8 seconds.

如何撰写 AI 视频提示词.jpg

第二个版本为生成器提供了主体、动作、环境设定、镜头方向、视觉处理和时长。它虽不能保证结果绝对完美,但大幅减少了模型猜测的成分。

AI 视频提示词的五个维度

请使用以下顺序作为基础框架:

[Subject] + [Action] + [Setting] + [Camera] + [Style and Lighting]

AI 视频生成提示词.jpg

若要打造适用于实际制作的提示词,可在后方添加输出控制项:

[Duration] + [Aspect Ratio] + [Audio] + [Continuity Rules]

这五个维度构建了镜头的创意内容。时长、格式、音频和连贯性则是辅助约束条件,有助于让生成的结果更易于使用。

1. 主体:定义观众应该看到什么

从人物、产品、动物或主要物体切入。请使用对镜头至关重要的细节,而不是把你脑海中所能想到的一切都罗列出来。

对于人物,实用的细节包括:

  • 大致年龄;
  • 发型、服装和配饰;
  • 身体姿态或面部表情;
  • 需要保持一致的特征细节。

对于产品,请描述:

  • 形状与材质;
  • 颜色与表面工艺;
  • 标签或包装位置;
  • 应该展示的角度。

对比以下两种描述:

A woman
A short-haired woman in a charcoal wool coat, cream scarf, and brown leather gloves

第二个版本为模型提供了清晰的视觉特征,以便在后续镜头中复用。对于重复出现的角色,请在不同提示词中逐字复制关键描述,而不是每次都用新的同义词重新改写。

2. 动作:描述随时间推移的一个主要变化

视频需要动词。静态图像提示词可以只描述主体站在房间里,但视频提示词必须说明视频片段中发生了什么变化。

好的动作应当是具体且可见的物理动作:

  • 将咖啡倒入陶瓷杯中;
  • 慢慢转向窗户;
  • 将纸船放到水面上;
  • 打开笔记本电脑并按下一个按键;
  • 穿行在飘落的雪花中。

避免把一整个故事压缩到单个短片段中。“她打开门,跑过马路,坐上一辆车,然后开车离开”包含了多个镜头。如果工具支持较长的序列,应将其拆分为多个单独的提示词或使用带时间轴的分镜脚本。

你可以添加一个次要的微动作,让镜头更生动自然:

The woman walks slowly along the pier while her scarf moves gently in the wind.

主要动作是行走。围巾的摆动则作为辅助动态,既丰富了画面又不会分散注意力。

3. 场景设定:为动作提供一个可信的环境

“办公室”或“森林”往往过于宽泛。添加能够影响氛围和构图的细节:

  • 具体地点;
  • 时间段;
  • 天气;
  • 前景与背景元素;
  • 可见纹理;
  • 背景动态。

示例:

A quiet ceramic studio at dawn, with wooden shelves, pale clay bowls, a large north-facing window, and soft dust floating in the sunlight.

你不需要描述房间里的每一样物品。挑选那些有助于模型理解环境、且观众确实能看到的细节即可。

4. 镜头运镜:说明画面的拍摄方式

专业的镜头语言能将一个场景转化为由导演执导的镜头。在必要时明确景别、角度、运动方式和速度。

常见的景别术语:

  • 大特写;
  • 特写;
  • 中景;
  • 全景 / 远景;
  • 俯拍镜头;
  • 航拍镜头。

常见的运镜术语:

  • 固定机位镜头;
  • 缓慢推进;
  • 拉远镜头;
  • 从左至右摇镜;
  • 跟拍镜头;
  • 环绕镜头;
  • 摇臂升起;
  • 手持跟随拍摄。

每个短片段使用一种主要镜头运动。例如:

Macro close-up with a slow push-in toward condensation forming on the glass bottle.

这比“让产品镜头富有动态感”更具实操性。如果主体也在移动,请分别描述这两种运动:

The cyclist moves from left to right while the camera tracks alongside at a steady pace.

5. 风格与光影:定义视觉呈现效果

风格告诉模型画面的整体质感,而光影则告诉模型场景该如何被照亮。两者密切相关,但属于不同的指令。

实用的风格指引包括:

  • 真实纪录片画质;
  • 干净明快的产品商业广告;
  • 手工剪纸定格动画;
  • 低饱和 35mm 胶片质感;
  • 定格动画;
  • 赛璐珞风格动漫;
  • 手机拍摄的 UGC(用户生成内容)画面。

实用的光影指引包括:

  • 清晨温暖的窗边光;
  • 阴天偏冷的自然光;
  • 日落时的硬质逆光;
  • 柔和的侧向霓虹光;
  • 单顶置聚光灯;
  • 带有浓重阴影的烛光。

用可见的视觉特征替代抽象词汇。与其使用“高端电影感氛围”,不如尝试“柔和逆光、克制的镜头运动、浅景深以及低饱和暖色调”。

辅助控制:时长、格式、音频与连贯性

前述五个维度构建了镜头内容。以下控制项则有助于让镜头完美契合实际项目。

时长与画幅比例

在模型支持的情况下注明预期时长,并选择与发布平台匹配的画幅比例:

  • 16:9 适用于横屏视频和电影感风光;
  • 9:16 适用于竖屏社交媒体视频;
  • 1:1 适用于方形社交媒体帖子。

如果工具将时长和画幅比例作为独立控件提供,请优先使用这些控件,让提示词专注于创意方向。

音频与对白

如果模型支持原生音频生成,请描述你实际需要的声音:

Natural café ambience, soft cup and spoon sounds, distant conversation, no music.

对于对白,请用双引号写出确切的台词并标明说话者。保持台词简短,以契合片段时长。如果你不需要语音或字幕,仅在模型支持此类负面限制时注明即可。

连贯性规则

当同一个角色或产品出现在多个镜头中时,重复那些不可更改的细节:

Keep the same face, hairstyle, cream sweatshirt, product shape, label position, and warm color palette throughout the sequence.

对于图生视频,重点描述应该运动的部分和应该保持固定的部分。参考图已经提供了大部分构图信息,因此提示词通常不需要重复每个视觉细节。

文生视频与图生视频提示词的区别

文生视频要求模型通过文字从零构建场景。需包含主体、场景设定、动作、运镜、光影与风格。

图生视频则始于现有的视觉参考图。重点应放在运动方式、镜头行为与稳定性上:

Animate the supplied product image with a slow push-in. Add a subtle highlight moving across the glass and a shallow background parallax. Keep the bottle shape, label, color, and position unchanged. Avoid extra products, packaging distortion, and unreadable text.

图生视频与文生视频提示词撰写指南.jpg

“让这张图片动起来”这句话往往过于模糊。一定要告诉模型什么在变,什么保持不变。

真实 AI 视频案例及启示

以下案例选自 GoEnhance 精选提示词库。文中附带了生成视频,方便你将文字指令与最终的动态效果进行对比。实时来源页面和视频链接核对日期为 2026 年 8 月 26 日;来源页面可能随时间有所变动。

若需浏览更多特定模型的案例,可查看 Seedance 2.0 提示词Grok Imagine 提示词 以及更全面的视频提示词库。

案例 1:低保真乡村生活 Vlog

应用场景: 纪录片风格的生活方式视频。

Seedance 2.0 slice-of-life vlog, 15 seconds, 16:9. Preserve the same woman’s face, hairstyle, skin tone, and body proportions. She wears an oversized olive linen shirt, dusty burgundy wide-leg trousers, brown sandals, and small gold hoops. Set the video in an authentic Korean rural village with mossy walls, hanok roofs, ceramic jars, roosters, cooking smoke, and overgrown paths. Use a late-2000s flip-camera look: heavy handheld shake, imperfect reframing, autofocus hunting, exposure swings, rolling shutter, motion blur, faded muddy colors, digital noise, and compression artifacts. She walks, splashes water on her face, feeds a stray dog, sips from a tin cup, then waves as the recording cuts off. No posing, glamour, stabilization, music, or modern grading. Include birds, roosters, footsteps, wind, water, and village ambience.

该提示词对年代感、镜头瑕疵、服装、环境、动作序列和声音都做了极其明确的规定。这表明“真实感”并不总是意味着画面干净或精致;当瑕疵本身就是风格的一部分时,镜头语言中完全可以包含这些不完美之处。

案例 2:科幻探索发现镜头

应用场景: 电影感科幻故事叙事。

Create a cinematic sci-fi short with a lonely, contemplative tone that gradually shifts into quiet wonder. A damaged exploration robot moves through a desaturated alien landscape of dusty earth and grey rock under overcast daylight. Use one glowing blue accent in the robot’s chest. Begin with macro close-ups of scratched metal and slow mechanical movement, then track behind the robot as it discovers a tiny living plant inside a collapsed research station. Push in slowly while dust floats through the beam of light. Use 35mm cinematography, restrained camera movement, realistic surface texture, soft atmospheric haze, and a quiet electronic score. End on the robot reaching toward the plant. No comedy, no fast cuts, no extra characters, no flicker.

这里的重要启示在于情绪的递进。提示词不仅列出了物体,还阐释了镜头如何从孤独过渡到惊叹,并为模型提供了一个明确的收尾画面。

案例 3:美食商业广告

应用场景: 产品广告与美食内容创作。

Create a premium food commercial featuring a freshly grilled burger on a dark wooden table. Begin with a macro close-up of melted cheese and crisp lettuce, then slowly orbit around the burger as steam rises from the toasted bun. Warm side lighting creates soft highlights on the ingredients, with a shallow depth of field and a rich but natural color grade. Add subtle restaurant ambience and a gentle sizzle. End with a clean hero shot centered on the burger, leaving empty space on the right for a short CTA. Keep the burger shape and ingredient layers consistent. No extra burgers, distorted food, unreadable text, or sudden cuts.

该案例明确规定了最终的构图,而不是让片段随机停止。这在广告制作中至关重要,因为最后一帧往往需要在后期剪辑中预留出放置品牌标识、产品名称或行动号召(CTA)的空间。

案例 4:具有受控运镜的产品镜头

应用场景: 科技或生活方式类产品营销。

Create a sleek cyberpunk product commercial featuring matte black wireless earbuds in an open charging case on a reflective metal surface. Use a slow orbital camera move while thin blue and violet light strips pass across the case. Macro close-up, shallow depth of field, crisp material texture, controlled reflections, and a dark futuristic color palette. Add a quiet electronic pulse and a soft mechanical click as the case opens. End with the earbuds centered in a clean hero composition. Keep the case shape, earbud position, and branding consistent. Avoid extra products, warped reflections, and invented text.

产品始终是画面核心。流动的光线增添了活力,但提示词并没有要求产品同时进行旋转、开启、变形和飞行等过多动作。

即拷即用的 AI 视频提示词模板

可将这些模板作为创作起点。替换括号中的字段,并删除任何不适用于你镜头的指令。

模板 1:电影感人物场景

Create a [duration] [aspect ratio] [visual style] featuring [subject description]. The scene takes place in [location] during [time of day and weather]. [Subject] [one primary action]. Use a [shot type] with [camera movement and speed]. Add [lighting, color palette, and texture]. Include [sound or dialogue] if needed. End with [final image]. Keep [identity, outfit, and important props] consistent. Avoid [specific failure modes].

模板 2:产品商业广告

Create a [duration] commercial for [product]. Begin with [opening shot] that shows [material, texture, or feature]. Then [one product action or use case] with [camera movement]. Use [lighting, color, and visual style]. End with a clean hero composition of [product], leaving space for [logo or CTA]. Keep the product shape, color, label, and branding consistent. Avoid [extra objects, distorted packaging, or invented text].

模板 3:图生视频动态化

Animate the supplied image with [camera movement]. Make [specific subject or environmental element] move slowly and naturally. Add [secondary motion such as wind, light, steam, or water]. Keep [face, clothing, product shape, label, composition, and colors] unchanged. Use [style and lighting]. Duration: [duration]. Avoid [warping, flicker, extra objects, and unwanted text].

模板 4:社交平台 UGC 视频

Create a natural [duration] vertical UGC video featuring [creator] in [location]. 0–[x] seconds: [hook]. [x]–[y] seconds: [demonstration or transformation]. [y]–[end] seconds: [reaction and CTA]. Use phone-camera handheld movement, realistic lighting, natural speech, and authentic ambient sound. Keep [product, clothing, and creator identity] consistent. Avoid forced acting, studio polish, random subtitles, and label changes.

模板 5:动态转场变形

Create a [duration] [animation style] transformation. Begin with [starting object or scene]. Gradually transform it into [final object or scene] through [specific visible steps]. Keep the transformation centered and continuous. Use [camera movement], [texture], [lighting], and [sound]. End on [final pose, product, or logo]. Avoid abrupt cuts, random characters, flicker, and style changes.

常见的 AI 视频提示词错误及实用修正方法

错误 1:堆砌形容词而非执导镜头

“美丽”、“史诗感”和“高质量”等词汇无法告诉模型具体该让什么动起来。请用关于景别、运动、光影和纹理的明确指示来替代它们。

错误 2:要求多个不相关的动作

请将复杂动作拆分为多个镜头。对于一段 6 秒的片段,包含一个明确的节拍(例如“女人转向窗户”)比塞入一整个晨间日常流程要容易控制得多。

错误 3:忽略镜头运镜

如果运镜对画面效果很关键,请务必写明。固定机位可以是一种深思熟虑的构图选择,但对运镜闭口不谈,就只能任由模型随机决定。

错误 4:仅描述主体,未描述变化

“公园里的一只狗”描述的是一张静态图片。“一只金毛寻回犬在湿漉漉的草地上奔跑,镜头在一旁同步平移跟拍”描述的才是一段视频。

错误 5:使用模糊的负面提示

“不要做得很差”毫无用处。请指明你要避免的具体问题:“保持标签清晰可读,瓶身形状不变”。此外,某些模型对正面期望状态的响应更好,比如用“平滑稳定的运镜”代替“不要晃动”。请针对你所使用的模型测试不同的措辞。

错误 6:期望通过提示词文本控制所有技术参数

分辨率、时长、画幅比例、随机种子(Seed)和镜头控制功能通常都可以在工具的操作界面中找到。尽量直接使用界面设置,让书面提示词专注于视觉创意方向。

如何修改生成失败的视频

将第一次生成视为诊断测试。找出最主要的缺陷,然后只修改一个变量。

  1. 如果主体发生形变:重复其视觉特征描述,并删去无关细节。
  2. 如果动作模糊混乱:将片段精简为一个核心动词。
  3. 如果运镜平淡呆板:添加具体的运动方式与速度描述。
  4. 如果背景杂乱无章:剔除次要物体,简化环境设定。
  5. 如果产品变样走形:添加连贯性约束规则,并在支持时使用参考图片。
  6. 如果氛围偏差较大:调整光影和色彩描述,而无需重写整段提示词。
  7. 如果结尾无法使用:明确描述片尾构图。

每次只调整一个变量,能让你更清楚地了解模型能够可靠遵循哪些指令。将表现最好的版本保存为新的基础提示词,而不是每次尝试都推倒重来。

大多数 AI 视频提示词指南忽略的要点

公式固然好用,但一套可复用的工作流远比长篇累牍的关键词更有价值。若想获得更稳定的生成结果,请遵循以下做法:

  • 对比失败版本与修改版本,确保改动逻辑清晰可追溯。
  • 将主体运动、相机运镜和环境动态分离开来描述。
  • 将一个提示词对应一个镜头,然后在后期剪辑中将多个镜头拼接起来。
  • 在相关联的提示词中,保持角色、服装、产品和色调细节的一致性。
  • 使提示词契合制作目标:产品广告需要包装稳定不变,而低保真 Vlog 则可能需要刻意的手持瑕疵感。
  • 商业和社交视频片段应以可用的画面构图结尾,而不是意外截断。
  • 建立简短的提示词日志,记录所用模型、参数设置、有效措辞以及所修正的问题。

这些做法能让提示词更易于复核与复用,同时还能避免一个常见误区:当画面问题实质上是指令相互冲突时,盲目添加更多文字。

初学者的简易练习计划

你无需一开始就尝试复杂的故事。可以通过简短、易于评估的镜头来练习这一框架。

练习 1:主体与动作

使用相同结构编写 5 个提示词:

[Subject] performs [one visible action].

仅更改主体和动作。这有助于你观察模型是否能准确理解该动词。

练习 2:添加场景与运镜

保持动作不变,测试 3 种地点和 3 种运镜方式。对比哪些组合能产生最清晰流畅的动态效果。

练习 3:添加微动态与连贯性

添加一种环境微动态,例如风、蒸汽、水流或飘动的微尘。随后为面部、服装、产品或道具添加一条连贯性规则。

练习 4:修改单一变量

针对同一提示词生成两个版本。仅更改镜头运镜、光影或动作其中之一。记录哪些方面得到了改善,哪些方面稳定性有所下降。

生成前的最终检查清单

在消耗下一次渲染额度之前,请先自检以下问题:

  1. 主要主体是否足够具体、易于辨识?
  2. 提示词中是否包含一个明确的核心动作?
  3. 场景设定是否清晰具体、画面可见?
  4. 是否包含了明确的景别或镜头运镜指令?
  5. 光影和视觉风格是否具体而非泛泛而谈?
  6. 是否已在需要的地方设定了时长与画幅比例?
  7. 是否仅在必要时才添加音频或对白?
  8. 是否明确声明了哪些内容必须保持一致?
  9. 片尾最后一刻是否具有实用的构图?
  10. 如果生成失败,你是否清楚下一步应该调整哪一个单一变量?

常见问题解答

AI 视频提示词应该写多长?

长度以能清晰描述镜头为准,同时要足够简练以保持指令聚焦。一段紧凑的段落或结构清晰的几句话,通常比堆砌无关形容词的长篇大论更容易修改。

一个 AI 视频提示词应包含多少个动作?

对于短片段,请使用一个主要动作。如果主体必须完成多项重大动作,请将其拆分为多个镜头,或先制定带时间轴的分镜方案。

AI 视频提示词必须用英文写吗?

这取决于具体模型。许多工具支持多语言输入,但最核心的因素在于具体名词、可见动词、清晰运镜指令以及稳定的结构。请测试在所选工具中能为你带来最可预测结果的语言。

AI 视频生成需要负面提示词吗?

它们有助于规避特定的失败模式,但效果因模型而异。建议先清晰描述期望达到的效果,然后在工具支持该指令的情况下,添加具体的约束条件(如保持产品标签不变或避免多余物体)。

我可以在所有 AI 视频工具中使用相同的提示词吗?

五维框架通用性很强,但不同模型对镜头术语、音频指令、时长和负面约束的解析可能存在差异。跨平台使用时,请将其作为起点,并根据测试结果进行微调。

提示词越长越好吗?

并不是。只有当额外的细节能够澄清画面的可见元素或核心重点时,它才有意义。如果提示词一次性要求了太多主体、动作、风格和运镜,各项指令之间可能会相互冲突。

结语

撰写 AI 视频生成提示词最可靠的方法,就是像导演撰写分镜头简报一样思考。明确主体、一项清晰动作、场景环境、镜头运镜以及视觉处理方式。然后,仅添加项目实际需要的时长、格式、音频和连贯性规则。

从单个镜头开始,评估生成结果,每次只调整一个变量。清晰的视觉逻辑远胜过泛泛的关键词堆砌,随着一次次生成实践,你沉淀下来的经过验证的提示词库将变得愈发宝贵。