让 AI 替你剪片:从自动剪辑到爆款视频反推的完整实操
这场分享围绕「用 OpenClaw(小龙虾)搞定视频创作」展开,两位讲师分别带来了两条截然不同、但都能直接上手的路径:Gilbert 展示了他如何把「筛选口播素材」这件耗时一两个小时的事,交给小龙虾全自动完成;CY 则演示了如何把一条 200 万播放的爆款短剧「反推」成可复用的分镜脚本、角色提示词,并最终生成一条属于自己的新片子。如果你正在做自媒体、短视频、短剧或广告片,且厌倦了重复的剪辑劳动,这篇文章值得读完。
先认识 OpenClaw:一个有手有脚的 AI 助手
Gilbert 用一句话概括了 OpenClaw 的定位:「OpenClaw 其实是一个能够拥有动手能力的 AI 助手。」它区别于市面上其他 AI 助手的地方在于,它不是被限制在浏览器或某个编程工具里,而是嵌入电脑后台的程序,可以真正操控你的电脑。
它的核心能力有三块。第一是收发信息:用户通过通讯软件发指令,背后的大模型接收后思考、形成方案,再交给 OpenClaw 调用工具执行。第二是记忆与上下文:短期记忆保证同一窗口内不同任务不混淆,长期记忆则让它记住你过往的对话、处理过的文档和个人偏好,让后续回答更有针对性。第三是工具调用与 Skills:只要开放足够权限,它能操作浏览器、创建文件夹、发送文件、打开 APP;而 Skills 可以理解为「经验模板」——把做 PPT、数据分析、自动剪辑这类经验固化成模板,它就能调用模板和工具自动执行工作。
养一只会剪片的虾:Gilbert 的自动剪辑 Skill 养成记
Gilbert 是内容创作者,他最大的痛点是处理 A-Roll 素材:一个五六分钟的成片,往往要录制十来段素材,每段约十分钟,他需要从中筛选出最流畅的段落、删掉废话和失误,「这个过程总共大概需要一个半到两个小时」。
他决定让 OpenClaw 试试。整个调教过程不是一蹴而就的,而是一步步「抠」出来的:
第一步,直接丢视频。 他让 OpenClaw 用内置的 auto-editor Skill 剪辑,效果不理想。
第二步,引入专业工具。 他让 OpenClaw 下载安装 Whisper(语音转文字)和 FFmpeg(音频裁剪),尝试删掉超过一秒的静音、只保留干货,但效果仍然不够好。
第三步,让 AI 识别段落差异。 他换了个思路,让 OpenClaw 把一个 8 分 54 秒的视频识别出 8 个段落,并分析每个段落的内容和特点,找出哪些有重复。
第四步,融入主观判断。 在 AI 客观分析出 8 个段落后,Gilbert 主观告诉它「第六个段落最好」,让它分析第六段与其他段落的区别,从而得出一套筛选标准。
第五步,用其他视频验证。 拿桌面上其他视频素材验证这套标准是否有效,满意后再微调规则——比如前面留 1 秒、后面留 3 秒缓冲,方便后期剪辑时有气口转化。
第六步,固化为 Skill。 最终满意后,让 AI 生成一套自动剪辑规则,形成正式的 Skill。
Gilbert 特别推荐这种「先让它试、再一点点抠问题」的方法:「如果你遇到一些摸不着头脑的问题,倒不如可以先给到 AI,先让它去尝试一下,先让它去输出结果,之后你再根据它输出的结果一点一点地去抠它的问题,再去引导它慢慢得出你想要的东西。」
自动剪辑的核心流程
Gilbert 展示了一张流程图,说明这套系统的工作原理:
单个视频素材:FFmpeg 做静音检测,定位无声时间点并剪掉;对剩余有声部分做四个维度评分——是否有清晰的开头、清晰的结尾、中间是否流畅、讲解节奏是否自然;筛选出最高分段落,加上缓冲规则(前 1 秒、后 3 秒),导出成片。
多个视频素材:从每个素材中筛选出最佳片段并拼接;用 Whisper 做音频转文字和语义理解,检查拼接后逻辑是否完整;对比段落优劣,识别有无卡顿、重复、中断;对比内容相似度和流畅度,计算调整分选出最佳段落;最后加入缓冲规则导出。
实际效果与成本
Gilbert 展示了一个实际案例:一个 8 分 54 秒的原始视频(包含调整眼镜、挠头等无用画面,同一内容讲了很多遍),OpenClaw 自动识别出 8 个段落并筛选出最流畅的一段,最终产出一个 30 秒的精剪视频。他还展示了批量处理报告:8 个原始视频成功剪辑出 9 个片段(其中一个视频有两段合格内容)。他在小红书发布的倒数第二个视频就是用这套工具剪出来的。
关于成本和效率,Gilbert 给出了几个关键数字:
- 段落切片准确度:约 70%~80%,微调部分直接交给剪辑软件处理。
- 剪辑耗时:取决于 AI 模型运行速度和网络环境,最久约一小时,通常二三十分钟,短视频 5 分钟内可完成。
- 费用:得益于缓存命中率(Cache Rate),重复类型的问题会大幅节省 Token 消耗,「一个完整的视频,大概也就花了 10~20 块钱左右」。
- 配置要求:因为连接的是云端模型,本地电脑不需要高配置,主要用于收发信息。
- 是否依赖口播文案:不依赖。Gilbert 设计时就考虑到有人不看稿直接录制的情况,所以不按文本剪辑,更像端到端的处理方式。
目前这套工具主要做初剪,已经能处理播客类内容,Gilbert 正在尝试自动配音和音轨匹配功能。Skill 已分享到 Claw Hub 和 GitHub。
视频反推:把爆款变成你的分镜脚本
CY 的分享从一个问题切入:以前可以用提示词反推图片,那视频能不能反推?他带着这个问题,用一个真实案例演示了完整流程——一个粉丝量很低的博主发布了一条仅一分钟的 AI 生成反转短剧,播放量高达 200 多万。他想复刻这种视频。
CY 先简要回顾了 OpenClaw 的基础能力:操作文件、执行终端命令、内存管理和记忆,可以把它想象成一个数字员工。百度生态内提供了大量实用 Skills,包括百度搜索、百科、学术、视频 AI 笔记、网盘、秒搭、百度地图、电商等。安装 Skill 很简单,直接在界面添加即可,而且搜索类 Skill 的调用量是每天限额(而非每月),非常够用。
四步反推工作流
第一步:全量视频分析(拉片)。 CY 介绍了「拉片」的概念——这是创作者向大神学习的方式,通过逐帧分析视频的结构、节奏、镜头语言、运镜、构图光影和情绪表达来学习。传统拉片需要逐帧分析并手动记录,非常耗费精力和记忆力。现在可以把视频直接丢给小龙虾,让它自动完成。
小龙虾交付的成果包括:逐帧截图与时间对应表(方便核查它有没有看全);全局画面风格分析(为后续生成视频定调,确保风格一致);剧情走向梳理(核查 AI 是否正确识别整体剧情);叙事结构与反转点分析;关键元素识别(如视频中的雪山、狐狸、酱板鸭等道具);角色列表(主角、配角等);以及按 10 秒一段进行重新划分编排——因为 AI 生成视频有时长限制,需要控制好每段长度。
第二步:生成角色提示词与分镜脚本。 基于第一步的分析结果,生成角色的详细提示词,用于后续生成视频时作为参考图来保持人物一致性。
第三步:生成角色卡片与分镜图。 小龙虾会自动判断如何生成分镜图。CY 只需说「继续」,它就会根据六个片段一次性生成六张分镜图,一致性保持得很好。
第四步:校验一致性并生成视频。 针对某些视频模型(如 Seedance 2.0)会检测人脸的问题,CY 分享了一个关键技巧:将画风转为「青彩绘」风格——关键在「青」字,如果全用彩绘风格效果不够好,加个「青」字就能绕过人脸检测,同时保持角色相似度。
CY 现场播放了最终成品:一个完整的反转短剧,剧情紧扣原视频的反转风格——从雪山救狐狸开始,经过多次反转(狐狸变酱板鸭、变核弹等),最终以百度千帆和小龙虾的广告植入收尾。
分镜头拓展与技能固化
CY 还分享了一个实用拓展功能:当分镜头数量不够时,可以用小龙虾自动拓展分镜。给它一张图片,它可以沿着剧情自动生成下一个镜头,包括空间建立、情绪特写、叙事推进、全景拓展等。这对创作中缺少一两张过渡图、或者不知道剧情走向的情况非常有帮助。
在实际演示中,他最初遇到了一致性问题——AI 把参考图理解成了文生图而非图生图,导致生成结果差异较大。解决方法是在 Skill 中明确加入限制条件:要求保持原图作为参考图,使用图生图而非文生图,调整后效果显著提升。
CY 强调,做这些内容时「不会一蹴而就」,遇到问题可以直接跟虾对话调整,调整到最后一个步骤时,让它把前面遇到的问题全部总结,形成一个新的 Skill 固化下来,这样就形成了自己的标准工作流。
现场问答
问:从反推到最后做出视频,大概成本是多少?
CY:没精确计算过。之前用 API 是按量计费,现在全部用 Coding Plan,购买后不限量使用直到限速。
问:视频反推和制作大概要多久?
CY:小龙虾生成提示词等准备工作很快,主要等待时间在于视频模型的生成速度。
问:Coding Plan 可以做视频吗?
AJ:Coding Plan 主要是让小龙虾可以跟你更顺畅地对话。真正做视频时要调视频模型的 API,把 API 丢给虾,告诉它「下次发动这个技能时用这个 API」就行,全部用自然语言沟通。
问:人脸检测是怎么绕过的?
CY:用「青彩绘」风格——「灵魂就在这个青字,如果是全部都彩绘的话,效果会差一点。用青的话,抽卡可能还要抽一两轮,因为是多角色在一块的」。
问:图和视频的模型怎么选?
AJ:直接在市面上找各种模型做组合,或者问 AI 哪个模型更适配你的场景。模型地位每个月甚至每周都在变化。
问:安装别人分享的 Skill 后,不合适怎么办?
CY:Skill 本质上是固化的工作流,大体通用。如果哪里不合心意,可以通过对话给它做微调。
AJ:装完别人的 Skill 后,如果发现跟自己的流程有变化,可以直接跟小龙虾对话,最终效果满意时说「把以上经验做一个总结,重新帮我梳理一个新的 Skill」,这个 Skill 就是你的了。
要点回顾
- OpenClaw 是嵌入电脑后台的 AI 助手,核心能力是收发信息、记忆上下文、工具调用与 Skills。
- Gilbert 的自动剪辑 Skill 是「抠」出来的:先让 AI 试剪,再逐步引入 Whisper 和 FFmpeg、识别段落差异、融入主观判断、用其他视频验证、最后固化为 Skill。
- 自动剪辑核心流程:静音检测 → 四维度评分(清晰开头/结尾、流畅度、节奏)→ 筛选最高分段落 → 加缓冲规则(前 1 秒后 3 秒)→ 导出;多素材则先拼接再语义去重。
- 成本与效率:一个视频剪辑约 10~20 元,通常二三十分钟完成,段落切片准确度约 70%~80%。
- 视频反推四步法:全量分析(拉片)→ 生成角色提示词与分镜脚本 → 生成角色卡片与分镜图 → 校验一致性并生成视频。
- 绕过人脸检测的技巧:将画风转为「青彩绘」风格,关键在「青」字。
- 分镜头拓展:给小龙虾一张图,它能沿剧情自动生成下一个镜头,补全缺失画面。
- 技能固化:遇到问题与虾对话调整,满意后让它总结经验形成新 Skill,沉淀为标准工作流。
- 所有文档、提示词、流程全部公开开源,可在 WaytoAGI 知识库搜索「百度千帆」或「养虾经验谈我睡觉虾剪片」找到。
直播回放约 78 分钟
播放器来自飞书妙记 · 在新窗口打开