拆解 Sora 2 数据集与短剧工作流:从提示词到成片的实战指南
12 月 29 日晚,AIGC 数字艺术设计高级工程师、AI 动画师大鹏在 WaytoAGI 社区「AI 短剧训练营」加餐课上,围绕 Sora 2 的模型特性、数据集构成、视频生成方式与提示词技巧展开分享,并逐一点评了学员提交的第八课作业。无论你是正在用 AI 工具做短剧的创作者,还是想了解 Sora 2 实际能力上限的爱好者,这篇文章都能帮你少走弯路。
Sora 2 的底层逻辑:数据集决定能力边界
大鹏认为,Sora 2 的核心优势在于“故事能力强、分镜能力出色、风格多样、真实感强、物理性能好、声音同步佳、音乐完成度高”,这些能力与其训练数据集的构成密切相关。他特别强调,Sora 2 与 Nano Banana 系列类似,都不是用图片训练,而是“拿世界观训练的”。
Sora 2 的数据集呈金字塔结构,越底层越重要:
- 真实世界连续视频(最底层):大量来自美国室外和室内监控器的视频。室外监控器涵盖大街交通、太阳阴影、时间变化等内容,这让 Sora 2 在光影变化、物理碰撞、人物动作上“没有模型能比他好”;室内监控器则包含美国家庭生活、工作场景和体育场运动会视频。
- 影视剧情类视频:大量电影、剧集素材让 Sora 2 的分镜和讲故事能力突出。大鹏提到,Sora 2 团队规模很小(不到 10 人),能做出厉害成果,“我觉得就是有钱,他的训练集太丰富了”。
- CG 动画和游戏录像:属于“可控世界”训练集,强化了空间连续性与复杂运镜的理解,因此 Sora 2 擅长生成类似游戏场景、第一人称或第三人称视角的视频。
- 多模态数据对齐:让 Sora 2 能将语言理解、视觉演绎等抽象内容表现出来。
- 补足内容:极抽象、不寻常视角和极端物理情况的素材。
Sora 2训练集金字塔结构
了解数据集对提示词撰写有直接指导作用。大鹏建议,写提示词时可以“先告诉它是属于哪类的场景,是属于生成一个视频的录像,还是一段人物的行为,还是一段影视,还是一段动画”,以此控制画面风格和运动方式。这个方法可以泛化到其他模型——通过查询模型的训练集,判断它在哪类视频生成上更有优势。他举例说,海螺模型在跳舞视频上表现出色,就是因为“海螺在跳舞的里面训练了好多的舞种,而且舞种它用了强化训练特别好”。
两种生成方式与提示词的关键作用
Sora 2 支持文生视频和单图生视频两种方式。单图生视频又分为两种情况:
人物加场景(两人以内):将人物的三视图、头雕和场景图交给 Nano Banana Pro 等具有世界观思考能力的模型进行组合。大鹏解释,这类模型“本身就是 agent”,能理解并思考整个画面,而不是简单地让首帧动一下。他演示了将人物三视图、头雕和餐厅场景图组合后,Sora 2 能生成一段完整的双人对话视频。
文生视频和单图生视频示例
多人物多分镜:分镜可以自己绘制,但声音不固定,需要声音模拟。大鹏提醒,即使对声音描述得再细致,输出多集内容时仍可能出现问题。
提示词对生成效果至关重要。大鹏现场演示了对比:仅用“画面中的角色和场景生成,未来情侣在吵架的故事”这样简单的提示词,生成的视频效果不佳;而加上“丰富的分镜、丰富的景别、丰富的运镜”后,视频质量显著提升,运镜和声音都到位了。他总结:“你看你怎么写,你要什么样的画面就写什么样的东西。”
分镜设计界面展示人物、服装及场景组合
提示词还应尽量详细,包括台词、分镜、镜别、运镜等内容。大鹏建议使用中文提示词以减少英文对白的出现,同时要规划好时长,避免因 15 秒限制导致台词无法完整呈现。他提到,完成作业的学员可以获得 Sora 2 的全套提示词模板。
学员作业点评:从 42 份作业中提炼的共性建议
第八课作业完成人数为 42 人,大鹏认为这些学员“都是百里挑一”,作品大多展现出一定的剪辑基础和创作能力。他逐一点评了多份作业,以下是一些共性问题和改进建议:
风格一致性:这是最普遍的问题。大鹏强调“风格提示词不对,一定要把风格提示词前置写在前面”,因为“越往前的提示词权重越高”。如果风格控不住,可以在前后都加风格提示词。他建议前期选择国漫、日漫风格,“容错率比较高”,有助于提升信心。
剪辑与节奏:大鹏建议减少转场效果,直接硬切。“如果你的镜头语言已经很好的情况下,转场效果要少,尽量没有转场效果。”他解释,分镜的最高境界是“看不出来分镜”,用转场效果反而让人看出痕迹。同时,他提醒学员注意语速和节奏,“前期最好的方式就是你尽量把视频做短,速度快一点、节奏快一点”。
声音处理:声音在短剧制作中至关重要。大鹏指出“短剧其实是在看声音”,要注意背景音和人物音的比例分配,背景音不要超过 70% 左右,避免掩盖人物音。他建议电话里的声音加电话音效以区分声源,多音字可以用错字替代避免读音错误。
画面动态感:大鹏提出“如果一个画面最好同时有两个东西在动态”,可以通过运镜加人物动作、添加烟雾等传统导演手法增强画面活力。
分辨率:尽量提高视频分辨率,720P 不够用,1080P 才有商用价值。
第八课作业提交数据详情
在点评中,大鹏特别表扬了几份优秀作业:一份真人短剧“场景道具细致,风格和人物一致性好,视听语言专业,能达到接单水平”;一份有爽感的短剧“风格一致,声音到位,镜头简单,情绪到位,节奏感很快”,他推荐学员阅读《一个故事的 90 种讲法》等分镜书籍;还有一份温馨的年度回顾视频,大鹏评价“技术是一方面,感情是一方面,投入感情作品立马就不一样了”。
视频编辑软件界面展示音频素材与时间轴
DaVinci Resolve编辑界面展示视频分镜
现场问答:关于 Sora 2 的实用答疑
Q:用 Sora 2 跑出来的多分镜视频,可以直接成片吗?
A:人物加场景方式跑完可以直接用;多分镜方式需要切分,因为“分镜的顺序不太对”的情况时有发生,需要重新剪辑组接。
Q:Sora 2 能出 1080P 吗?
A:免费版只能出 720P,分辨率不够;1080P 需要付费 API,目前价格较贵。大鹏建议,如果只是做自媒体可以接受,但“不能大规模商用”。
Q:Sora 2 的分镜效果不好,可以用它来辅助出分镜吗?
A:可以。大鹏表示“如果你分镜没那么专业,可以让他帮你跑分镜,或者帮你提供个思路也行”。也有学员将 Sora 2 生成的分镜作为参考,再用其他工具生成视频。
Q:用 Sora 2 生成视频时,需要把语音克隆的解说词也写进提示词吗?
A:需要。脚本和对白都要写上,同时要规划好时长,因为 15 秒是限制,台词可能讲不完。
要点回顾
- Sora 2 的数据集以真实世界连续视频(监控器)为底层,辅以影视、CG 动画、游戏录像和多模态数据,这决定了它在光影物理、分镜故事、复杂运镜上的优势。
- 写提示词时先告知模型场景类型(录像、人物行为、影视或动画),可控制画面风格和运动方式;了解不同模型的训练集,可判断其擅长领域。
- Sora 2 支持文生视频和单图生视频;两人以内用“人物加场景”方式最稳,多人物多分镜需注意声音不固定和分镜顺序问题。
- 提示词要详细,包含台词、分镜、镜别、运镜;中文提示词可减少英文对白;风格提示词要前置并适当增加。
- 短剧制作中,风格一致性、剪辑节奏(硬切为主)、声音处理(背景音不超过 70%)、画面动态感(两个以上动态元素)是提升质量的关键。
- 前期建议选择国漫、日漫风格,容错率高;尽量提高分辨率至 1080P 以满足商用需求。
直播回放约 231 分钟
播放器来自飞书妙记 · 在新窗口打开