Gorden Sun推文
AI短剧自动化实战:薅羊毛暴露的提示词工程经验
韩国AI视频聚合网站被中国短剧团队用程序薅羊毛,自动生成并分享提示词、参考图和结果,暴露了AI短剧自动化生产的实战经验。团队像工厂一样作业,追求90%一致性而非完美,通过结构化提示词最小化重抽和剪辑成本;故意破坏角色参考图以过人脸;将光影材质比例精确化锁定画面质感;用文本锁定起始结束状态实现镜头链式传递;以配音驱动叙事节奏。这些方法大幅提升效率,适合批量短剧制作。
译文
韩国一家做AI视频聚合服务的网站被中国做短剧的薅羊毛了,薅了大概几十万人民币。不过显然是程序来自动执行的,导致提示词、参考图、生成结果都自动分享到了社区。 相当有价值的一线AI自动化短剧的实战经验。 1、不是制作单部高品质艺术品,而是像工厂一样自动化作业 不会为了追求 100% 的一致性而消耗额外的时间与金钱成本。 单次生成即达到 90% 的一致性:提示词结构高度聚焦于“最小化 AI 重抽(Re-roll)成本”和“最小化后期剪辑时间”。 无需后期剪辑工序,实现镜头与镜头之间过渡连接的自动化。 即使是 10 秒以内、画面表现质量要求不高的短镜头,其提示词在结构上也经过了极其严密的推敲。 在制作超过 80 集的整部短剧中,该团队对提示词几乎不做大改动: · 各分镜角色动作:短叙述句,不把资源浪费在过度的镜头调度演出上。 · 各分镜角色台词:直接复制粘贴原作台词。 · 起始与结束镜头:各角色状态仅用简短的一行字明确定义。 2. 故意破坏角色参考图,用于过人脸和提升特写表现 为防止视频生成模型直接机械地照搬参考图中的整张脸,通常会搭配使用“无脸全身图”和“面部特写图”。 但该团队更进一步:故意破坏只保留身份识别特征的角色面部区域,强制模型在特写镜头下也不直接从参考图中死板硬套。 (备注:这是韩国团队对SD不了解,实际主要是为了过人脸) 3. 将“光影与材质”定义为锁定画面质感(Look)一致性的最高优先级元素 仅光影设计与各材质高光部分就占据了提示词预算的 1/5。 不使用“刀刃闪闪发光”这种模糊的形容词,而是精确指定 3 种材质的相对比例: 长刀金属高光×1.5、皮肤高光×0.5、布料高光×0.3 压暗皮肤和布料、仅突出金属材质,通过指定相对比例而非绝对数值,确保无论重新生成多少次,画面材质的关系与层级始终保持一致。 4. 锁定每个生成的起始与结束画面状态,最大限度压缩剪辑耗时 不使用参考图作为起始帧与结束帧,而是纯靠文本固定视频开始与结束时各人物的状态。 有团队甚至会在豆包(DuoBao)提示词中直接写明“承接下一集的内容与交接状态”。 不需要逐个确认视频去手动对齐下一镜头的连贯性,彻底消除了制作瓶颈。只需一键点击首次生成,下一段视频的首个镜头、首句台词以及角色的状态变化就会呈链式自动传递。 5. 依靠配音驱动整体叙事与节奏,而非依赖视觉调度 专为快节奏、重台词交互的微短剧定制。 团队极少把提示词资源耗费在镜头布局与运镜上。 将配音色调的一致性与情感演绎直接固化为可复用的文本结构: 音色与性格:标记为绑定在角色身上的“常量”。 状态与语调:标记为随分镜变化的“变量”。 角色的动作表演严格与台词对齐,依据台词中具体词汇的出现时间节点依次指示动作。 过人脸图片:
韩国一家做AI视频聚合服务的网站被中国做短剧的薅羊毛了,薅了大概几十万人民币。不过显然是程序来自动执行的,导致提示词、参考图、生成结果都自动分享到了社区。 相当有价值的一线AI自动化短剧的实战经验。 1、不是制作单部高品质艺术品,而是像工厂一样自动化作业 不会为了追求 100% 的一致性而消耗额外的时间与金钱成本。 单次生成即达到 90% 的一致性:提示词结构高度聚焦于“最小化 AI 重抽(Re-roll)成本”和“最小化后期剪辑时间”。 无需后期剪辑工序,实现镜头与镜头之间过渡连接的自动化。 即使是 10 秒以内、画面表现质量要求不高的短镜头,其提示词在结构上也经过了极其严密的推敲。 在制作超过 80 集的整部短剧中,该团队对提示词几乎不做大改动: · 各分镜角色动作:短叙述句,不把资源浪费在过度的镜头调度演出上。 · 各分镜角色台词:直接复制粘贴原作台词。 · 起始与结束镜头:各角色状态仅用简短的一行字明确定义。 2. 故意破坏角色参考图,用于过人脸和提升特写表现 为防止视频生成模型直接机械地照搬参考图中的整张脸,通常会搭配使用“无脸全身图”和“面部特写图”。 但该团队更进一步:故意破坏只保留身份识别特征的角色面部区域,强制模型在特写镜头下也不直接从参考图中死板硬套。 (备注:这是韩国团队对SD不了解,实际主要是为了过人脸) 3. 将“光影与材质”定义为锁定画面质感(Look)一致性的最高优先级元素 仅光影设计与各材质高光部分就占据了提示词预算的 1/5。 不使用“刀刃闪闪发光”这种模糊的形容词,而是精确指定 3 种材质的相对比例: 长刀金属高光×1.5、皮肤高光×0.5、布料高光×0.3 压暗皮肤和布料、仅突出金属材质,通过指定相对比例而非绝对数值,确保无论重新生成多少次,画面材质的关系与层级始终保持一致。 4. 锁定每个生成的起始与结束画面状态,最大限度压缩剪辑耗时 不使用参考图作为起始帧与结束帧,而是纯靠文本固定视频开始与结束时各人物的状态。 有团队甚至会在豆包(DuoBao)提示词中直接写明“承接下一集的内容与交接状态”。 不需要逐个确认视频去手动对齐下一镜头的连贯性,彻底消除了制作瓶颈。只需一键点击首次生成,下一段视频的首个镜头、首句台词以及角色的状态变化就会呈链式自动传递。 5. 依靠配音驱动整体叙事与节奏,而非依赖视觉调度 专为快节奏、重台词交互的微短剧定制。 团队极少把提示词资源耗费在镜头布局与运镜上。 将配音色调的一致性与情感演绎直接固化为可复用的文本结构: 音色与性格:标记为绑定在角色身上的“常量”。 状态与语调:标记为随分镜变化的“变量”。 角色的动作表演严格与台词对齐,依据台词中具体词汇的出现时间节点依次指示动作。 过人脸图片:

