拓冰建站拓冰建站
首页 / 资讯中心 / 正文

AI短剧提示词源码:一套流程做出稳定成片

简介这是一份面向AI短剧创作初学者与开发者的源码教程资源围绕AiPy工具演示如何一键生成短剧完整覆盖从主题与风格规划、剧本大纲生成到旁白撰写、分镜头视频制作再到音视频合成的全流程。压缩包共3个文件主要包含html格式操作指南、inscode云端运行配置以及gitignore工程规范文件整体仅7KB体量小巧但结构清晰。目前已有1084人学习适合希望快速上手AI内容创作、又不想从零搭建环境的用户。教程提供了详细的提示词示例与操作步骤即使没有专业编剧或影视制作背景也能按图索骥完成短剧创作。通过源码可以直观查看AiPy的提示词设计思路与调用逻辑结合示例可复现人物一致性控制、音画同步合成等效果同时为开发者提供了将AI能力集成到自有工具中的参考范式兼具实用性与学习价值。 最近总有朋友问我短视频平台上一眼就能看完的AI短剧到底是怎么做出来的为什么自己用AI生成的内容总是单张好看、连起来就垮掉。趁着这几天又跑完了一条60秒的样片我把整个创作链路和可以复用的提示词“源码”整理出来你们可以直接拿去改。AI短剧创作并不是什么玄学本质上是把编剧、分镜师、美术、剪辑的工作压缩成一条提示词流水线。核心关键词就两个AI和源码。AI负责生成素材源码负责让每一次生成都有确定性。这篇内容适合想批量做短剧账号的创作者、做AI视频工具的产品经理以及单纯想低成本试水短视频的个人玩家。1. 从灵感到成片AI短剧创作的完整链路1.1 一条片子走完哪些环节很多人以为AI短剧就是打开一个文生视频工具输入一句“给我生成一个古代侠客救人的故事”然后就能出片。真这么做十条里有九条是废片。实际走通的链路包含七个环节剧本创作、角色设定、分镜拆解、画面生成、镜头动态化、配音合成、后期剪辑。其中最容易翻车的是角色设定和分镜拆解。角色设定决定了全片人物长什么样如果这一步不锁死后面每一帧脸都可能不一样。分镜拆解决定了故事节奏AI一次性生成超过10秒的连贯叙事目前仍然不稳定必须要拆成“一个镜头一个镜头”来做。我的做法是先用大语言模型生成一个60秒以内的微短剧剧本然后手动把剧本拆成8到12个分镜每个分镜都要写明场景、人物、动作、景别、情绪。再把分镜逐个交给文生图模型生成关键帧最后把关键帧交给图生视频模型做镜头运动。整套流程看起来步骤多但熟练之后单条片子从创意到成片可以压到两小时以内。1.2 为什么这套链路能跑通这套链路能跑通的核心原因是它把“不可控的长叙事”拆解成了“可控的短单元”。当前主流AI视频生成工具对单次生成时长的支持普遍在5到10秒之间你让它在10秒内完成起承转合效果必然打折扣。但如果你只让它做一个3秒的镜头比如角色转头、镜头推近、雨滴落下输出质量会稳定很多。另一个原因是提示词的可复用性。我在项目里把所有提示词模板化剧中人物的外貌描述、场景风格、镜头语言都写成可替换变量的源码式结构。换一个故事时只需要替换角色名字和核心冲突关键词其余参数保持不变。这样批量生产时风格一致性就不会崩。2. 提示词即源码四类核心模板与参数心法2.1 剧本生成提示词模板写剧本时我用的不是“帮我写个短剧”这种开放式提示词而是给定结构、给定字数、给定时长的约束式提示词。这里给出一套可以直接复制的模板你是一位短剧编剧。请写一部60秒以内的微短剧题材为[古风复仇]。 要求 1. 包含三幕结构开端15秒交代背景、冲突30秒制造转折、结局15秒情绪释放。 2. 角色限定为2人主角[沈青梧]反派[赵无咎]。 3. 每个场景需描述时间、地点、天气、人物状态。 4. 输出格式场景编号 场景描述 人物对白 情绪注解。 5. 台词单句不超过20字总台词不超过6句。这里有个关键点限定时长和总台词量是为了防止大模型写出小说式的长篇对白。短剧的信息密度靠画面传达台词只是点缀。把输出格式限定为“场景编号 描述 对白”能够直接对接到下一步的分镜拆解省去二次整理的时间。另外建议在剧本生成后加一轮“冲突强化”提示词比如“当前剧本的高潮冲突是否足够强烈请给出两个升级方案”。这一轮微调能把平淡的故事线拉出情绪曲线成本几乎为零但成片效果差距很大。2.2 分镜脚本与画面提示词模板剧本完成后要转成分镜。我采用如下表格结构来拆分镜号景别画面内容人物状态运镜方式时长01远景山巅孤亭雨幕垂落沈青梧负手而立缓慢推近4s02中景赵无咎踏水而来面色阴鸷跟拍平移3s03特写剑出鞘雨水沿剑锋滑落眼神冰冷环绕3s把这张表交给大模型让它按每一行生成文生图提示词。这里我给出一个我实测稳定的中文提示词结构[画质词] [主体描述] [场景描述] [镜头语言] [氛围词] [风格统一后缀]实际例子8k分辨率电影级光影一位身披玄色斗篷的年轻女子站在山巅孤亭中雨水沿亭檐滴落远景镜头缓慢推近冷灰色调古风武侠电影质感人物正面朝镜头构图居中高细节注意六个要素缺一不可。画质词决定图像清晰度主体描述决定画面内容场景描述决定环境信息镜头语言决定构图方式氛围词决定色彩倾向风格统一后缀是全项目都用的一个短语用来确保不同镜头的画风一致。我的风格统一后缀是“古风武侠电影质感冷灰色调”只要所有镜头都带着这串字符整体色调就不会乱跳。2.3 角色一致性控制策略角色一致性是AI短剧最大的坑。同一个角色在这个镜头里是瓜子脸下一个镜头变成圆脸观众立刻出戏。要解决这个问题我试过三种方案。第一种是固定seed值。部分工具支持设置随机种子固定种子后同一描述生成的图像构图和人物会更接近但换镜头语言后仍有漂移风险。第二种是角色参考图。使用支持图生文的工具先为每个角色生成一张标准定妆照后续所有镜头都用这张图作为参考把角色描述叠加到每个分镜提示词里。这个方案目前最实用。第三种是训练角色LoRA。如果你要做的短剧集数很多比如几十集以上建议用开源框架训练一个角色的LoRA模型训练素材50张左右多角度定妆照即可。虽然训练要花些时间但换来的稳定性是目前最高的。对于新手我建议直接从第二种方案开始成本低、见效快。具体操作时角色参考图要选择正面、无遮挡、光线均匀的半身像这样模型提取特征的准确度最高。切忌用侧面、低头或戴帽子遮住半张脸的照片做参考图否则后续生成的角色脸部会越偏越远。3. 实操演示一套提示词做出60秒完整短剧3.1 完整提示词示例这里以我的古风复仇微短剧为例。角色设定如下沈青梧28岁面容清冷左眼角有一颗泪痣玄色斗篷手中持一柄黑色长剑发髻高束身形高挑。 赵无咎45岁眼窝深陷留着短须穿深紫色锦袍右手戴一枚玉扳指身形微胖神态阴鸷。整体风格后缀古风武侠电影质感水墨色调剧场级布光8k分辨率以分镜01为例生成关键帧的完整提示词为8k分辨率电影级光影远山、孤亭、密布的阴云雨丝密集一位身披玄色斗篷、面容清冷、左眼角有泪痣的年轻女子在亭中负手而立长剑斜背身后。远景镜头缓慢推近面部表情平静但眼神坚毅水墨色调古风武侠电影质感剧场级布光。这一条提示词送到文生图模型后生成4张候选图挑选面部最清晰、构图最满意的一张作为关键帧。注意每次生成多张候选时不要只选造型最好看的要选人物脸型和参考图最接近的这一步决定了视频的连贯性。3.2 生成、筛选与拼接的实操记录关键帧全部生成后进入图生视频环节。这一步的操作逻辑是把关键帧丢给视频生成模型用一小段提示词控制镜头运动。建议的提示词写法是镜头缓慢推近雨丝持续下落角色的斗篷边缘被风轻轻吹起周围环境保持静止人物表情微动。这里我只描述“镜头怎么动、什么元素在动、什么元素不动”。AI视频模型对运动描述很敏感如果你写“镜头推近”它可能动得太快写“雨丝下落”它可能让整个画面都在摇晃。所以控制变量很重要明确指定静止和不动的元素画面才会稳定。单镜头生成后把所有视频片段按分镜顺序拖入剪辑软件。60秒的短剧我通常用8个镜头每个镜头5到7秒。剪辑时注意两个衔接细节一是镜头切换尽量卡在动作点上比如第3个镜头是拔剑出鞘第4个镜头就要接雨水顺着剑锋滑落这样观众视觉上有连续性二是不同镜头之间色彩倾向要一致如果某个镜头偏暖其余镜头偏冷拼接后会异常突兀需要通过调色插件统一色温。配音环节我使用的是TTS工具选一个沉稳的女声叙说旁白台词则用另一个清澈的声音呈现对白。音效方面不要忽略环境音雨声、风声、剑刃出鞘的金属声这些细节决定了观感质感。最后用剪辑软件导出时我习惯统一输出为1080p、30帧每秒在短视频平台压缩后画质损失最小。3.3 首尾帧控制与时长衔接技巧在实际制作中图生视频模型经常出现“开头是对的结尾跑偏了”的情况。这里有一个技巧能支持首尾帧的工具尽量给上首帧和尾帧两张图。首帧用当前关键帧尾帧用下一镜头的关键帧中间的运动由模型自动补足这样两个镜头之间的动作衔接会顺畅得多。实测这个技巧能把相邻镜头的跳变感降低一半以上。时长方面如果模型的单次生成上限是5秒而你的分镜设计是7秒不要硬扛。要么把分镜拆成更小的动作单元要么在剪辑时通过变速插件做慢动作延展比如把某个关键动作放慢到0.7倍速。我的经验是宁可让镜头短一点、干净一点也不要依赖AI生成超长镜头后者大概率会在后半段出现画面崩坏。4. 常见问题与排查技巧实录4.1 人物形象漂移怎么解决这是被问得最多的问题。明明同一套提示词这个镜头里是泪痣在左眼下个镜头泪痣跑到右眼去了。一个高效排查法是检查所有分镜提示词中人物描述是否完全复制粘贴。很多人习惯手打描述稍不留神就把“高束发髻”写成了“披肩发”模型自然就会改脸。用源代码思路理解就是描述字符串必须完全一致不能有丝毫偏差。如果确认描述一致但仍有漂移那就是参考图权重不够。建议调高参考图的影响权重或者在每个分镜提示词中靠近开头的位置重新强调一次人物描述。模型对提示词开头的注意力更高把人物描述放在画质词之后、场景词之前效果会比放在中间好很多。4.2 视频生成长度不足怎么处理目前主流AI视频生成工具单次生成时长大概在4到12秒之间不够长是很常见的事。我的处理方式是把一个长动作拆解成两个短动作。比如“角色转身、拔剑、挥出一道剑气”这个动作如果5秒内没生成完就拆成两段第一段生成“角色开始转身手握住剑柄”第二段生成“剑已出鞘剑气向画面右侧挥出”。后一段可以让首帧采用前一段的尾帧这样衔接起来就是一个完整的动作。这个方法有个前提两段生成之间要手动检查首尾帧是否吻合。如果第一段结束时手已经握在剑柄上第二段开头就必须是同一只手在剑柄上的角度不能是手已经松开。实在对不上就重新生成第二段直到吻合为止。4.3 配音和口型对不上怎么办目前多数AI短剧走的是旁白叙事路线刻意避免角色正脸长时间说话这也是一条成熟的制作思路。我在剧本阶段就控制台词量每个角色不超过3句并且尽量让台词发生在背影、侧脸或远景镜头里避开精确口型同步的难题。如果你的剧本里必须有正脸说话镜头也不建议用通用数字人对嘴型效果往往廉价。更稳妥的方案是把正脸说话镜头控制在2秒以内配合轻微的头部运动和眼神变化让观众注意力放在情绪上而不是嘴上。经验值是60秒的片子中正脸说话镜头不超过10秒观感就基本不会露馅。4.4 平台审核与发布策略短剧做完以后发布前要自查几个基础项画面是否存在过于血腥暴力的元素、台词是否有明显指向性或不当隐喻、标题是否带有夸大或误导性描述。短视频平台的审核机制对AI生成内容的检测越来越严格建议在视频开头添加“本片由AI辅助创作”的免责标识一方面合规另一方面也不会影响完播率。发布时间选择上古风复仇类短剧的受众活跃时段通常在晚间8点到10点之间我实测这个时间段发布的两条样本片平均播放量比白天发布高出近一倍。封面图选择最有冲突感的特写镜头不要放全景特写带来的情绪冲击力更容易提高点击率。5. 源码扩展把创作流程封装成自动化脚本5.1 一个最小可用的分镜批量生成脚本如果你是技术控这里是一个可以作为起点的小脚本用Python实现把剧本结构自动转换成提示词列表。它的作用不在于替代全部创作而在于减少复制粘贴的工作量让流程更接近“源码驱动”。import json # 定义一个分镜数据类 def make_prompt(shot, character, scene, camera, style): return f8k分辨率电影级光影{character}{scene}{camera}{shot[emotion]}{style} # 角色定妆描述 characters { heroine: 一位身披玄色斗篷、面容清冷、左眼角有泪痣的年轻女子, villain: 一位眼窝深陷、留着短须、穿深紫色锦袍的中年男子 } # 风格统一后缀 style_suffix 古风武侠电影质感水墨色调剧场级布光 # 分镜列表 shots [ {id: 1, character: heroine, scene: 远山、孤亭、密布的阴云雨丝密集, camera: 远景镜头缓慢推近, emotion: 平静但眼神坚毅}, {id: 2, character: villain, scene: 山脚石阶水雾弥漫, camera: 中景跟拍平移, emotion: 面色阴鸷}, ] # 批量生成提示词 prompts [] for shot in shots: person characters[shot[character]] prompt make_prompt(shot, person, shot[scene], shot[camera], style_suffix) prompts.append({id: shot[id], prompt: prompt}) print(json.dumps(prompts, ensure_asciiFalse, indent2))运行后会自动输出所有镜头的完整提示词。里面的分镜列表、角色描述都可以扩展成外部JSON文件这样换项目时只需要改数据文件不用改代码。5.2 用脚本做批量出图的选图策略有了提示词列表下一步是用程序调用文生图API批量生成。以市面上常见的API为例可以在脚本中设置生成数量为4然后自动从返回结果中根据提示词描述语义挑出最接近的一张。这里推荐一个简单的选图策略把候选图转成CLIP特征向量再和角色参考图的特征向量做余弦相似度比对取相似度最高的一张。这个方案在单人镜头中准确率较高多人同框时则需要手动判断因为脸部特征混合后相似度比对会失真。在跑自动化之前建议先把两条样片用纯手工方式完整过一遍确认角色描述和风格后缀没有任何问题再交给脚本批量。完全撇开人工直接跑脚本一旦提示词模板里有个错别字会在所有素材中复现改错成本是几何级增长的。关于版权这块也多说一句。AI生成的素材虽然工具方通常授权商用但涉及具体人物肖像的商业短剧仍需自查是否有侵权风险。稳妥的做法是全部使用AI生成的虚拟角色不要使用真实演员照片做参考图也不要在提示词中模仿某一真实演员的特征描述除非你有明确的肖像授权。最后一波经验我自己的体会是AI短剧创作最大的门槛不在AI而在创作者能不能用一个稳定的流程去约束AI。模板化的提示词写法和流程化的拆片思路就是那套约束AI的“源码”。先把单镜头质量磨到稳定再去做多镜头拼接最后才谈得上批量生产。第一次做建议只做一支30秒、3个镜头的极致短片跑通全流程后再放量。我自己踩过最大的坑就是一开始贪多试图一步到位做3分钟的连续剧结果被视频内容崩坏、角色漂移和审查不通过三连打击浪费了整整三天时间。从30秒起步反而让我在两周内稳定产出了4条成片。本文还有配套的精品资源点击获取
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门