AI视频提示词怎么写?5个模板让可灵、即梦出片质量翻倍(2026最新)

在可灵和即梦上折腾了快两个月,我最大的感受是:工具之间的差距,远没有提示词写得好坏的差距大。同一个工具,有人生成的是"一眼假"的幻灯片,有人生成的是能直接发朋友圈的短片。差别就在那几句话上。

今天把我自己一直在用的 5 个提示词模板整理出来,照着套就行。结尾还附了翻车自救指南,建议先收藏。

先搞清楚:视频提示词和图片提示词不是一回事

写图,你描述的是一个静止画面;写视频,你描述的是"变化"——谁在动、怎么动、镜头动不动。

很多人翻车,就是把图片提示词直接搬过来用。画面有了,但里面没有任何运动,AI 只能硬编,结果就是各种扭曲变形。我现在的写法,是把一句话拆成四个部分:主体 + 动作 + 环境 + 镜头。少一个,出片质量就掉一截。

模板一:万能四件套,90% 的场景够用

公式长这样:

一个[什么样的]主体 + 正在做[具体动作] + 身处[什么环境] + 镜头[怎么动]

拿我上个月生成的一条来举例,可灵和即梦都能跑:

一个穿黄色雨衣的小女孩,撑伞走在雨后的石板路上,踩到水坑溅起水花,街道两侧是亮着灯的店铺招牌,镜头从背后缓慢跟拍,电影质感,自然光影

注意两个细节。动作要具体到"溅起水花",别只写"走路",AI 对抽象动词的理解很差。环境要给出光源和氛围,有光,画面才有层次。

模板二:加一个时间词,画面立刻有情绪

同一段街景,清晨、正午、黄昏、深夜,出来的完全是四种感觉。时间词是最便宜的"风格滤镜",我几乎每条提示词都会带一个。

清晨薄雾中的城市天际线,太阳正从楼宇间升起,一群飞鸟掠过,镜头缓慢上摇,柔和的逆光

对比一下:不加时间词,AI 默认给你一个"中午大平光",无聊且假。加了"清晨薄雾",光线的方向、空气的质感、整体的色调,全都被带出来了。

模板三:镜头语言要单独写,别指望 AI 猜

AI 默认喜欢中景固定机位,看多了很闷。镜头怎么动,你得明说。常用的就这几个词:

  • 推近:从全景慢慢靠近主体,适合强调情绪
  • 拉远:从主体拉开,交代环境,适合结尾
  • 环绕:围着主体转半圈,展示感强,产品展示最爱用
  • 跟拍:镜头跟着主体移动,运动感强
  • 俯拍/仰拍:换视角,俯拍显全貌,仰拍显气势

我的组合习惯是:画面动作写在前面,镜头语言放最后,用逗号隔开。比如"女孩在巷子里奔跑,镜头低角度跟拍,两侧墙壁快速掠过"。这样模型不容易把动作和镜头搅在一起。

模板四:图生视频,用参考图锁死人物长相

纯文字生成视频,人物长相最容易漂——前一秒还是这个人,下一秒就换脸了。可灵和即梦都支持图生视频,我的做法是:先给一张图,提示词里只描述动作,绝不重新描述长相

保持图中人物的外观不变,她转头看向窗外,嘴角轻轻上扬,镜头缓慢推近脸部,浅景深,窗外的光打在她脸上

这么写,人物一致性比纯文字高一大截。记住一个原则:参考图管"长什么样",提示词管"做什么事",两者别打架。

模板五:风格词 2-3 个就够,堆多了变四不像

"电影感、史诗感、赛博朋克、宫崎骏风格、写实纪录片"——我一开始也喜欢一口气堆五六个风格词,结果生成出来什么都不像。

现在的做法:1 个主风格 + 1 个光影描述,最多再加 1 个画质词,收工。比如"宫崎骏风格,通透的夏日光影,高清"。风格越少,模型越知道自己该干嘛。

翻车自救指南:几个我踩过的坑

  • 画面老崩:元素太多。砍掉次要物体,动作写简单点
  • 人物乱动:动作指令越短越不容易崩,"她站在那里,风吹动头发"比"她跳起来转圈挥手"稳得多
  • 变形模糊:提示词末尾加一句"画面清晰,无变形"
  • 可灵和即梦的提示词能通用吗:模板能通用,但两个模型对中文的理解有差异,同一段词两边都试,哪边效果好就用哪边

模板是死的,手感是试出来的。你先拿模板一跑通一条,再慢慢加时间词、换镜头语言,用不了几次就能摸到自己的套路。

如果你也常用 AI 生成视频,欢迎在评论区分享你压箱底的提示词,我最近正在攒素材,好用的话我会整理成第二期。

发表评论