拓冰建站拓冰建站
首页 / 资讯中心 / 正文

图生视频 Prompt 的分镜化写法与负向词配置

做电商视觉,图生图那套 Prompt 工程已经比较成熟:七个维度写全,出图基本可控。但把同一套写法迁移到图生视频模型上,失效得非常彻底——商品从第 2 秒开始形变、logo 漂移、画面闪烁跳变。问题不在模型能力,在 Prompt 的语义结构错了。这篇把图生视频的 Prompt 拆开讲:两类模型的结构差异、分镜参数配置、10 条可复用模板、负向词配置,以及拼接阶段的常量抽取。一、两类模型消费 Prompt 的方式不同图生图模型消费的是状态描述,图生视频模型消费的是状态变化。# 静态图 Prompt(状态描述) 主体:黑色不锈钢保温杯 场景:浅木色书桌,窗边 光线:自然窗光,左侧 45 度 材质:磨砂金属,轻微反光 构图:三分法,商品居右这段喂给视频模型,它拿不到任何动词,于是自行推断该动什么——绝大多数情况下会去动主体本身,表现为商品扭曲、比例漂移。视频 Prompt 的最小完整单元是三段式:一个运动主体 一个运动方式 一个幅度约束,再加一条锁定语。# 视频 Prompt(状态变化) 运动主体:杯口热气 运动方式:缓缓上升 镜头:固定不动 锁定:商品外形、颜色与 logo 保持不变四行缺一不可。缺运动主体,模型自己挑一个;缺幅度约束,模型倾向于放大动作;缺锁定,主体在生成过程中被重绘。二、为什么必须分镜:3-5 秒是硬约束当前主流图生视频模型单次生成的时长上限普遍在 3-5 秒。一条 15 秒带货视频,靠单条 Prompt 直出不现实。分镜不是妥协,是降维:5 段 × 3 秒,每段只让模型解一个动作,失败的代价从整条重来降到单段重跑。工程上这就是标准的可重试单元划分。标准五镜结构与参数配置:镜位时长职能首帧参数来源运镜允许的运动源镜 10-3s开场钩子微距特写固定或缓慢下移非主体元素(热气/水珠)镜 23-6s产品全貌详情页主图参数定机位或 ≤15° 平移主体自转 ≤30°镜 36-9s细节质感微距 侧光缓慢推近光线扫过镜 49-12s使用场景场景图参数固定人手入画镜 512-15s收尾定格大留白构图缓慢拉远光线色温变化关键约束:每段只允许一个运动源。镜 2 如果同时写商品自转 镜头环绕,两个运动叠加,模型维持不住主体一致性。首帧参数可以直接复用静态图的配置,不必重做——镜 2 的首帧就是详情页主图,镜 4 的首帧就是场景图。整条流程真正的质量瓶颈在首帧,不在视频 Prompt。三、10 条分镜 Prompt 模板每镜两条,一条动作驱动、一条运镜驱动,二选一。所有条目默认追加锁定语。# 镜 1 开场钩子 杯口热气缓缓上升,镜头固定不动 镜头从杯口缓慢下移至杯身中部,热气持续上升 # 镜 2 产品全貌 商品静止,镜头绕商品缓慢右移 15 度 商品缓慢自转 30 度,镜头与光线固定 # 镜 3 细节质感 镜头向杯盖螺纹缓慢推近,景深逐渐变浅 一道柔和光线从左向右缓慢扫过金属表面,镜头固定 # 镜 4 使用场景 一只手从画面右侧入画,自然缓慢地拿起保温杯 手持保温杯轻微晃动,窗外光线保持不变 # 镜 5 收尾定格 镜头缓慢拉远,商品停留在画面下三分之一处 画面构图静止,黄昏光线缓慢变暖 # 全局追加(拼在每条 Prompt 末尾) 商品外形、颜色与 logo 保持不变模板与模型无关,替换商品名词即可迁移到其他品类。数值不是随手写的:运镜写右移 15 度而不是缓慢环绕,是因为带具体数值的约束比形容词更容易被执行;同理景深逐渐变浅比有电影感可控得多。能量化就不要用形容词,这是视频 Prompt 和图像 Prompt 共通的一条。四、负向词配置图生图的负向词解决假,图生视频的负向词解决变,两套词表不通用。# 视频类基础配置 画面抖动, 商品形变, logo 变形, 闪烁, 突然跳变 # 有人物入画时追加(镜 4) 手指畸形, 多指, 手部粘连 # 画面含文字元素时追加 文字乱码, 字符扭曲第三组的正确解法其实是不让模型生成文字。价格、卖点、促销标注全部后期合成——当前模型生成中文字符的成功率低到没有工程价值,与其在负向词里对抗,不如从流程里去掉。五、拼接阶段的三个参数1. 常量抽取。五段分开生成,最大风险是拼出来色调断层。把光线与风格描述抽成常量,五段共用,只替换动作句:CONST_STYLE 自然窗光,冷调白平衡,轻微胶片颗粒,真实商业摄影质感 镜 N Prompt CONST_STYLE 动作句 锁定语2. 掐头去尾。生成片段的首尾各 2-3 帧常有跳变。拼接前每段裁掉前后各 0.3 秒(30fps 下约 9 帧),过渡立刻干净。5 段各裁 0.6 秒后总时长掉到 12 秒左右,所以生成时每段按 3.5-4 秒留余量。3. 节奏对齐。3 秒一切,正好对上多数 BGM 的 8 拍节点,后期几乎不用手动调。六、边界:三种情况不要用生成视频需要真人出镜口播建立信任的,生成视频替代不了。需要以真实使用效果作为证据的(去污对比、耐用性演示),用生成视频冒充实拍属于虚假宣传,平台抓到直接处罚。商品结构复杂且必须大幅旋转展示的,当前模型在大幅运镜下压不住形变,拍一条转台视频反而成本更低。分镜化写法的本质,是把让模型做一件复杂的事改成让模型做五件简单的事。这个思路在图像批量生成里同样成立。以上分镜模板连同另外 34 条电商图像 Prompt 已整理进开源仓库,带货视频分镜在第四类:github.com/pixgt-ai/ecommerce-ai-prompts
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门