AI 剪辑工具正在成为内容生产的新变量。最近一些 AI 剪辑产品受到关注,本质上说明了一件事:过去高度依赖人工的剪辑环节,正在被拆成一套可以标准化、自动化的流程。
618 前,为了提升带货视频的产能,我用 Codex 搭了一套自动化剪辑工作流。
跑下来之后,原本一天最多剪 6 条视频,现在可以稳定做到 30 条左右。其中表现最好的一条,带来了接近 1000 个订单。

618 期间,我们跑量素材里大约有三分之一来自这套流程。它并不替代创意,也不是一键生成精品视频的“万能工具”,但在需要高频测试的带货场景里,确实把产能拉上来了。
这篇文章,我把这套工作流从 0 到 1 的搭建思路、关键步骤和踩过的坑都整理出来。
先说结论:它适合什么,不适合什么
这套流程的核心,不是让 AI 从零创作,而是让它复刻一条已经被验证过的视频结构。
比如你刷到一条爆款带货视频,觉得它的开头、镜头节奏和文案逻辑都不错,想用自己的产品素材再做一条。传统做法通常是打开剪映,逐帧分析参考视频,再去素材库找画面、对字幕、卡节奏。一条视频做下来,两三个小时很常见。
而在这套流程里,你只需要准备好参考视频和素材库,剩下的交给 Codex:
- 识别参考视频的镜头切换点;
- 拆出每个镜头的结构和时长;
- 从素材库里匹配合适的画面;
- 生成配音与字幕;
- 输出预览视频,以及可继续编辑的剪映草稿。虚拟卡
流程跑熟后,单条视频从准备到出样稿,大约需要 20—30 分钟;如果素材库足够完整,最快可以压缩到 5 分钟左右。当然,最后的审核和微调仍然少不了。
它更适合以下几类内容:
- 电商与广告素材,例如抖音千川、硬广类视频;
- 无人出镜的带货视频,例如图书、日用品等内容;
- 素材拼接型的混剪内容或 Vlog。
第三类也能做,但效果通常一般。原因很简单:Codex 目前能够理解镜头结构和基础视觉特征,但对复杂情绪、叙事转折和微妙的节奏感,仍然不如成熟剪辑师。
所以我对这套工作流的定位很明确:它是自动化生产工具,不是精品创作工具。
我自己的 Skill 里包含一些内部内容,不便直接公开。不过下面这套流程和关键提示词已经足够你搭出一个可用版本。你也可以把本文直接交给 Codex,让它协助你整理成自己的 Skill。
用 AI 批量复刻爆款结构
做内容或做电商,最快拿到流量的方法之一,就是研究已经被市场验证过的爆款。
这里说的“模仿”,不是搬运,而是拆解它的结构:前几秒怎么抓人、镜头怎么切、卖点怎么铺、文案怎么推进、哪里该强调、哪里该停顿。
以前,这件事只能靠人工完成。现在可以把其中大量重复的部分交给 AI。虚拟卡

我自己的工作方式是:先找到合适的爆款参考视频,再准备好产品素材。Codex 负责完成拆解、匹配和初步合成,我只做审核和最后的细化。
在没有这套流程前,同类视频一天最多做 6 条;现在可以做到 30 条左右,效率至少提升了 5 倍。即使如此,我们还是会保留一部分人工精剪视频,用来维持内容上限和测试新的创意方向。
正式开始前,先准备好工具和项目结构
搭建这套流程前,要先准备两部分内容:工具环境和项目文件夹。
1. 工具环境
整个流程基于 Codex,需要准备以下工具:
- Codex;
- FFmpeg;
- Python 3.8 及以上版本;
- 配音工具;
- 剪映专业版。
其中,FFmpeg 用来处理视频拆分、合成和格式转换;Python 用来运行自动化脚本;剪映专业版用于打开和继续编辑最终生成的草稿。
配音工具可以按需求选。我做带货视频时,实测相对稳定的是豆包语音大模型;如果有声音克隆需求,也可以使用 VoxCPM 这类开源方案。
你可以把下面这段话发给 Codex,先检查环境:
请帮我检查视频自动化剪辑所需的环境:
1. 检查 FFmpeg 是否已安装;如果没有,请告诉我安装方式。
2. 检查 Python 版本是否 >= 3.8;如果没有,请告诉我升级方式。
3. 检查是否已安装剪映专业版;如果没有,请提供官方下载入口。
4. 检查并安装 Python 依赖包:opencv-python、numpy、pillow。
检查完成后,请告诉我:
- 哪些环境已经准备好;
- 哪些需要我手动处理;
- 下一步建议如何继续。
配音成本需要单独算。以我现在的使用情况,一条 1 分钟左右的带货视频,配音成本大约在 4—8 毛之间。
2. 项目文件夹
项目结构越清晰,后面越不容易出错。我通常按下面的方式组织:
项目文件夹/
├─ assets/ # 素材库
├─ work/ # 工作区,每次剪辑建立独立日期文件夹
├─ final/ # 最终成品
└─ AGENTS.md # 项目规则与验收标准

assets/ 用来存放全部原始素材。建议按产品、卖点、场景、人物、拍摄方式等维度分类。比如带货素材可以继续拆成 AI 生成素材、真人实拍、产品展示、使用场景等。
素材库前期多花一点时间整理,后面会省下大量返工。素材本身越完整,自动匹配的稳定性就越高。
work/ 是每次任务的工作区。每做一条视频,就建立一个独立文件夹,例如 2026-07-05,把参考视频、中间文件、语音、字幕和草稿都放在里面。
AGENTS.md 则相当于项目说明书,用来告诉 Codex:项目要做什么、输出规格是什么、哪些情况算合格。这个文件很重要,写得越清楚,结果越接近你的预期。
四步跑通自动化剪辑
整个工作流可以拆成四步:
- 拆解参考视频;
- 匹配替换素材;
- 生成配音;
- 输出样稿和剪映草稿。
第一步:拆解参考视频
这一步的目标,是把参考视频拆成独立镜头,并提取每个镜头的关键帧、时长和文案。
先找一条参考视频。它可以是外部爆款,也可以是你自己已经验证过、数据不错的视频。下载后放进 work/ 文件夹,并用便于识别的名字命名。

然后把下面的提示词发给 Codex:
我需要拆解一个参考视频。
参考视频位置:@(输入文件名,Codex 会自动搜索)
请完成以下工作:
1. 用 FFmpeg 识别视频的镜头切换点,可结合帧间差异分析;
2. 为每个镜头提取关键帧,并保存为图片;
3. 提取视频音轨,单独保存;
4. 生成 recipe.json,记录每个镜头的开始时间、结束时间、时长和关键帧路径;
5. 如果视频中有文案,请根据音频生成配音文本,并按镜头分段;
6. 对文案进行校对,避免明显错字、漏字和识别错误。
请按 AGENTS.md 的要求保存文件。完成后告诉我:
- 一共识别出多少个镜头;
- 每个镜头的时长;
- 是否存在疑似误切分的位置,等待我确认。
recipe.json 是后续流程的核心文件。它记录了参考视频的结构,后面的素材匹配、配音生成和草稿制作,都会以它为依据。
拆解完成后,建议你先人工检查一次。重点看镜头有没有被错误切开:例如一个完整画面被拆成两段,或者两个镜头没有分开。发现问题后,直接让 Codex 调整即可。
第二步:筛选和匹配素材
这一步是整个流程里最关键的部分,也是自动化最有价值的地方。
传统剪辑需要一个镜头一个镜头翻素材库,再把合适的画面拖到时间线上。素材多的时候,不仅耗时,也很容易遗漏更好的选择。
自动化流程里,只要告诉 Codex 素材库的位置,它就能先提取素材的关键帧,再根据颜色、亮度、构图和场景等特征,为参考镜头筛选相对匹配的素材。虚拟卡
可以这样提示:
我需要从素材库中匹配替换素材。
项目信息:
- recipe.json 路径:@(上一步生成的 recipe.json)
- 素材库路径:assets/
- 输出路径:work/(本次任务文件夹)
匹配要求:
1. 读取 recipe.json 中每个镜头的关键帧;
2. 遍历素材库,为每个素材提取关键帧;
3. 根据颜色、亮度、构图和场景特征,为每个镜头推荐最匹配的素材,并给出置信度得分;
4. 避免连续 3 个镜头使用同一类素材;
5. 避免相邻镜头出现明显重复的房间、人物或构图;
6. 生成 fragment_plan.json 和 matches.json;
7. 将选中的素材复制到 material/fragment01/、fragment02/ 等对应文件夹中。
重要原则:
如果某个镜头的匹配置信度低于 0.6,请标记为“缺素材”,不要用无关素材硬凑。
完成后,请汇总匹配结果,并列出需要人工补充素材的镜头。
这里一定要坚持一个原则:宁可留空,也不要硬凑。

我早期版本为了让每个镜头都有画面,会自动降低匹配标准。最后的结果很难看:部分镜头和上下文完全不搭,明明视频能跑,观感却很“假”。
后来我改成了低置信度直接标记“缺素材”。虽然会增加一点人工补素材的工作,但成片质量提升很明显。
还有一点要注意:匹配完成后,素材应该是“复制”到项目文件夹,而不是“移动”。原始素材库一旦被破坏,后面很容易出问题。
第三步:生成配音
素材匹配完成后,就可以开始做配音。
在拆解参考视频时,我们已经让 Codex 提取了文案。但 OCR 和 ASR 的识别准确率不可能百分之百,所以生成配音前,一定要先人工检查一遍文案。
确认无误后,可以用下面的提示词:
我需要为视频生成配音。
配音文本:@(你的文案.txt)
要求:
1. 调用豆包 TTS 接口,为每个镜头生成独立语音文件;
2. 读取每段语音的实际时长;
3. 如果配音时长与参考镜头时长不一致,记录时长差异;
4. 将所有语音片段拼接为完整配音文件:final_voice.mp3;
5. 更新 recipe.json,写入真实的配音时长。
完成后,请告诉我:
- 每段配音的实际时长;
- 与参考时长差异较大的镜头;
- 是否存在语速、生硬停顿或发音异常的问题。
配音时长要以实际生成结果为准。
举个例子:参考视频里一个镜头时长是 3 秒,但生成的配音需要 5 秒读完,那么最终视频就应该把这个镜头延长到 5 秒,保证声音和画面自然对齐。不要为了强行卡时长,把语音压得很急,观感通常会很差。

第四步:生成样稿和剪映草稿
最后一步是把素材、配音和字幕合成为预览视频,并生成可编辑的剪映草稿。
这一步相对复杂,因为剪映草稿格式比较严格。素材路径、时间轴和各类 ID 只要有一个不对,就可能出现打不开、素材丢失或草稿异常的问题。
我自己踩过几个典型的坑:
- 内容 ID、元数据 ID、根索引 ID 需要保持正确的关联关系,且不能和已有草稿冲突;
- 草稿引用的素材路径通常需要使用绝对路径;
- 素材文件必须真实存在,文件移动后草稿可能会失效;
- 不同剪映版本的草稿格式可能有差异,建议先拿一条样稿做兼容性验证。
可以直接使用下面的提示词:
我需要生成最终预览视频和剪映草稿。
输入信息:
- recipe.json:work/recipe.json
- matches.json:work/matches.json
- 素材路径:work/material/
- 配音文件(可选):work/voice/final_voice.mp3
- 字幕文本(可选):work/script.txt
输出内容:
1. 预览视频:work/remix.mp4
2. 字幕文件:work/captions.srt
3. 剪映草稿:work/jianying_draft/
要求:
1. 按 recipe.json 和 matches.json 的顺序拼接素材;
2. 如果有配音,优先以配音实际时长为基准;没有配音时,使用参考视频的镜头时长;
3. 生成 .srt 格式字幕文件;
4. 生成可被剪映打开的草稿;
5. 所有素材先复制到项目文件夹,避免原素材路径变化导致草稿失效;
6. 草稿生成后,请提醒我检查素材、字幕、配音和时间轴。
完成后,请说明:
- 预览视频是否生成成功;
- 草稿文件位置;
- 是否存在缺失素材、时长冲突或字幕异常。
第一次生成通常会慢一些,大约需要十几分钟。生成完成后,打开剪映重点检查以下内容:
- 草稿能否正常打开;
- 素材是否正常显示;
- 时间轴顺序是否正确;
- 字幕是否错位、遮挡或出现错字;
- 配音和画面是否同步。

如果有问题,就回到前面的步骤排查:是素材匹配出了问题,还是配音时长不对,或者是剪映草稿结构有误。不要一上来就推翻整套流程,逐个环节定位通常更快。
真正稳定的关键:把流程沉淀成 Skill
跑通一次,不代表流程就稳定了。
从参考视频拆解、素材匹配、生成配音到输出草稿,整套流程第一次跑下来通常需要 20—30 分钟。素材库足够完整、规则足够明确后,速度才会越来越快。
更重要的是,跑通之后要让 Codex 把流程封装成 Skill。
这样下一次你不需要反复输入一长串提示词,只要告诉它参考视频在哪里、使用哪个素材库,就能调用整个工作流。
刚开始的 Skill 一定会有问题,这很正常。你要做的不是期待它第一次就完美,而是在实际使用中不断发现问题、让 Codex 修正、再把经验写回 Skill。
几轮迭代后,流程会越来越稳定。虚拟卡
我现在的使用方式基本是:调用自动剪辑 Skill,告诉它参考视频位置,过一会儿去查看生成结果,再进剪映做最后的人工审核。
最后这一步人工细化,我通常会处理 BGM、音效、重点花字和少量节奏调整。Codex 也能做一部分,但在画面情绪、节奏协同和细微的审美判断上,人工依然更可靠。
每条视频多花 10 分钟做这一步,整体质感往往能提升一个档次。成片发出去,用户通常不会觉得它是一条“AI 拼出来的视频”。
自动化的价值,不是完全取消人工,而是把人从重复劳动里解放出来,把时间留给选题、素材、创意和最后的判断。
这才是这套工作流真正带来的变化。
原创文章,作者:wp-chen,如若转载,请注明出处:https://visaspay.com/2026/07/23/%e4%b8%80%e6%9d%a1%e8%a7%86%e9%a2%91%e5%b8%a6%e6%9d%a5-1000-%e8%ae%a2%e5%8d%95%ef%bc%9a%e6%88%91%e7%94%a8-codex-%e6%90%ad%e4%ba%86%e4%b8%80%e5%a5%97%e5%b8%a6%e8%b4%a7%e8%a7%86%e9%a2%91%e8%87%aa/