用 AI 做视频脚本和剪辑:从选题到成片的一条流水线

1 查看AI视频口播脚本剪映分镜AI任务清单

把「用 AI 做视频」拆成能跟着做的九步:先定一句话结论和事实来源,写成能念顺的口播稿,再让脚本自带分镜和时长,最后进剪辑软件对轴、校字幕、配封面。附可复制提示词、素材清单、首条与熟练后的耗时对比、费用结构,以及七种最常见的翻车方式和止损点。

视频创作者对照分镜表,在小型工作室里剪辑口播视频

视频创作者对照分镜表,在小型工作室里剪辑口播视频

「AI 任务清单」系列第 05 篇。本文的范围:解说型、口播型、录屏讲解型视频的完整制作路径,从选题到发布。它不覆盖真人表演、剧情短片和需要专业摄制的广告片,也不是 AI 视频生成工具的横评——那部分见2026 年 AI 视频生成工具终极测评

任务目标

做完这件事,你应该有:一条能直接发布的三到八分钟解说视频(或者一条 60 到 90 秒的短视频),有完整脚本、有分镜表、有配音、有校对过的字幕、有封面,素材归档整齐,下一条能在更短时间内做完。

关键词是「下一条更快」。第一条视频花多久其实不重要,重要的是你有没有留下一套可复用的东西:脚本模板、分镜表格式、字幕校对清单、素材库、封面模板。没有这些,第十条和第一条一样慢,而这正是大多数人做到第三条就停的原因。

推荐工具组合

干什么推荐备选
资料层选题、事实核对、找出处Perplexity秘塔AI搜索Felo
脚本层结构、论证顺序、信息密度ClaudeChatGPT
口语层把书面语改成能念顺的话KimiDeepSeek豆包
配音层中文或多语配音魔音工坊讯飞智作ElevenLabsFish Audio
画面层图表、示意图、封面、少量生成图稿定AIRecraft通义万相Napkin
生成片段层几秒空镜、转场、氛围镜头可灵即梦RunwayPika
剪辑层对轴、自动字幕、调音、导出剪映专业版度加创作工具Clipchamp
转写层先录后写时把录音转文字通义听悟讯飞听见
选题 + 一句话结论 资料与出处 口播脚本按「说」的方式写 念一遍不顺就改 分镜表画面 / 时长 / 字幕 配音 素材:截图 / 图表 / 少量生成片段 剪辑:对轴 + 字幕校对 + 调音 封面与发布

图 1:整条流水线。分镜表是全流程的枢纽——它同时决定配音怎么断句、需要哪些素材、剪辑时每段停留多久。没有它,这三件事会在剪辑软件里同时压到你身上。

为什么这样选

为什么把重心放在「脚本自带分镜」上。 做视频真正吃时间的不是写字,是在时间轴上反复拖拽:这句话配什么画面、这段停几秒、这个转场放哪。如果脚本阶段就把每句话对应的画面、时长和字幕写清楚,剪辑就变成了执行,速度差别是数倍。反过来,拿着一份纯文字稿进剪辑软件,你会在时间轴上边剪边想,这是最慢的做法。

为什么脚本一定要念一遍。 模型默认写书面语,而书面语在耳朵里非常难懂——长定语、嵌套从句、四字词堆叠,读着通顺,听着完全跟不上。判断方法只有一个:出声念一遍,凡是需要换气两次的句子就拆开,凡是念的时候会自动改口的地方就按你改口的说法改。

为什么不用 AI 生成整条视频。 当前的 AI 视频模型擅长几秒钟的氛围镜头、空镜和转场,不擅长承载具体信息——它画不对界面、写不对文字、也保证不了同一个主体在两个镜头里长得一样。用它撑满五分钟,代价是费用高、观感割裂、而且观众很快就会疲劳。合理用法是点缀:开场几秒、章节之间的转场、说到抽象概念时的示意画面。

为什么字幕必须人工校对。 自动字幕对日常口语准确率很高,但对专有名词、英文缩写、产品名、数字单位的错误率明显偏高。而字幕里的错别字是观众唯一会截图转发的东西。

完整步骤

第 1 步:定选题和一句话结论

先写出这条视频的一句话结论:看完之后观众能带走的那一句。写不出来就说明选题还没想清楚,这时候开始写脚本,最后一定是一堆信息没有落点。

第 2 步:资料与出处

用检索型 AI 把关键事实找齐,每条事实记下出处。视频比图文更难标注来源,所以核对要在前面做完。涉及数据、时间、价格、版本号的内容,一律以官方页面为准,模型给的记忆不可信。

第 3 步:写口播脚本

用下面第一段提示词。硬性要求写进提示词里:句子短、口语、不用书面连接词、每 30 秒有一个小结论。同时要求前 15 秒必须给出观众留下来的理由——不是自我介绍,是这条视频能解决他的什么问题。

第 4 步:念一遍

出声读全文,拿笔改。这一步平均能砍掉一到两成字数,而且砍掉的都是听不进去的部分。顺便记下自然停顿的位置,这就是后面的分句点。

第 5 步:出分镜表

让 AI 把脚本转成表格:序号 / 台词 / 画面内容 / 素材来源 / 预计时长 / 屏幕文字。画面来源要分类标注:自有截图、需要做的图表、素材库、需要生成的片段。这张表出来之后,你才知道要准备多少素材。

第 6 步:配音

两条路。自己录:手机加一副带麦的耳机就够,关窗、找软装多的房间、离麦一拳距离,比设备本身影响更大。AI 配音:优先选能调语速和停顿的,中文尤其要试听多音字和数字读法。无论哪条路,不要模仿真实人物的声音

第 7 步:备素材

按分镜表逐条准备,不要边剪边找。截图统一分辨率,图表统一配色,生成片段控制在总时长的一成以内。所有素材放进一个文件夹,按分镜序号命名。

第 8 步:剪辑

顺序固定:先把配音铺满时间轴 → 按分镜对画面 → 自动生成字幕 → 逐句校对字幕 → 统一音量并降噪 → 加转场和背景音乐 → 通看一遍 → 导出。

背景音乐音量压到人声之下明显一档,很多业余感就来自音乐太响。

第 9 步:封面、标题与复盘

封面用固定模板,标题写清「解决什么问题」。发布后隔几天看三个数据:前 3 秒的留存(封面和开场的问题)、平均播放时长(脚本节奏的问题)、互动(选题的问题)。

1. 一句话结论 2. 资料与出处 3. 写口播脚本 4. 出声念一遍 念得顺? 5. 分镜表 6. 配音 7. 备素材 8. 剪辑:对轴 / 校字幕 / 调音 9. 封面 / 发布 / 复盘

图 2:九步流程与那个唯一的回环。「念得顺吗」这个判断放在配音之前,是因为配完音再改脚本,等于全部重来。

提示词

一、写口播脚本

你是一位写解说视频脚本的编剧。请把下面的资料写成一条 {时长} 的口播稿。

硬性要求:
1. 这是给人念出来、给人听的稿子,不是文章。句子平均不超过 20 个字,
   一句话只说一件事,不用"其次""综上所述""值得注意的是"这类书面连接词。
2. 前 15 秒必须回答观众"我为什么要看下去",用一个具体问题或一个反常识的事实开场,
   不要自我介绍,不要说"今天我们来聊聊"。
3. 每 30 秒左右给一个可以带走的小结论。
4. 全文只有一个核心结论:{一句话结论}。所有段落都要服务于它。
5. 涉及数字、时间、名称时,只使用我提供的资料,不要补充你记忆里的信息。
   资料里没有的地方写"{待核实}"。
6. 结尾给一个具体动作,不要升华,不要求关注。

资料:
{贴你核对过的事实与出处}

二、把脚本转成分镜表

把下面的口播稿转成分镜表,输出 Markdown 表格,列为:
序号 / 台词 / 画面内容 / 素材来源 / 预计时长(秒) / 屏幕文字

规则:
1. 按自然语义断句,一格台词对应一个画面,单格不超过 12 秒。
2. 「素材来源」只能填这四类之一:自有截图 / 需要制作的图表 / 素材库空镜 /
   需要生成的片段。生成片段的总时长不得超过全片的 10%。
3. 「画面内容」要具体到能照着做,例如"产品设置页截图,高亮左侧第三项",
   不要写"相关画面"。
4. 「屏幕文字」只写需要打在画面上的关键词,每格不超过 10 个字;不需要就留空。
5. 预计时长按每分钟 240 字的语速估算,最后给出全片总时长。

口播稿:
{贴念顺之后的脚本}

三、生成素材需求清单

根据下面的分镜表,生成一份素材准备清单,按素材类型分组,方便我一次性备齐。

输出四组:
1. 需要我自己截图或拍摄的:逐条写清楚截什么界面、哪个状态、要不要高亮。
2. 需要制作的图表:写清楚图表类型、要表达的一句话结论、需要哪些数据。
3. 素材库可以直接找的:给出搜索关键词,每条两三个备选词。
4. 需要生成的片段:给出画面描述,并注明时长;同时告诉我这几条能不能用
   静态图加缓慢推拉替代——如果能,优先替代。

最后统计:四类各多少条,预计准备时间。

分镜表:
{贴分镜表}

四、字幕校对清单

下面是自动生成的字幕文本。请找出需要人工确认的地方,输出成清单。

重点检查:
1. 专有名词、产品名、公司名、英文缩写是否写错或写成同音词。
2. 数字、单位、日期、版本号是否与我的脚本一致。
3. 断句是否会造成歧义,长句是否需要拆成两行。
4. 口语中的语气词、重复词是否应该删掉。
5. 与原脚本相比有没有整句缺失或多出的内容。

输出格式:时间码 / 字幕原文 / 问题类型 / 建议改成。
不要顺手润色没有问题的句子。

原脚本:
{贴脚本}

自动字幕:
{贴导出的字幕文本}

实测演示:一段口播稿变成一张能照着做的分镜表

实测环境:macOS + Claude Code 命令行 2.1.226,--model sonnet,2026 年 8 月。口播稿是为演示写的,输出是真跑出来的。

动手前:先把命令行装好

演示用的是 Claude Code 的命令行版本,三条命令装好并验证:

# 1. 需要 Node.js 22 或更高版本
node --version

# 2. 全局安装
npm install -g @anthropic-ai/claude-code

# 3. 验证
claude --version        # 应输出类似 2.1.226 (Claude Code)
claude doctor           # 检查安装是否健康

第一次使用要登录:在终端直接敲 claude 进入交互界面,按提示完成账号授权(之后可以用 claude auth 管理登录状态)。登录完成后,下面这种一次性的 -p 调用就能直接跑了。

本文所有命令都写了 --model sonnet,是为了让你复现时和这里用的是同一档模型;不加这个参数会用你账号的默认模型,输出会有出入。

第一步:准备材料(复制粘贴即可)

一段 300 多字的口播稿,主题是「提示词为什么会失效、怎么发现、怎么修」,已经按第 4 步念过一遍、拆过长句:

mkdir -p ~/demo/video && cd ~/demo/video

cat > script.txt <<'EOF'
你有没有发现,同一个提示词,今天好用,过两周就不好用了。
这不是你的错觉。
模型会更新,你的提示词却停在原地。
今天讲三件事:为什么会失效、怎么发现、怎么修。
第一,为什么失效。提示词依赖模型的默认行为,模型一改,默认行为就变了。
比如你原来靠"简短回答"这四个字压住输出长度,新版本可能不吃这一套。
第二,怎么发现。你需要一组固定的测试题,每次模型更新后重新跑一遍。
不用多,五道题就够,但必须每次都是同一组。
第三,怎么修。不要整段重写,先定位是哪一条约束失效了。
把模糊的形容词换成可检查的条件,比如把"简短"换成"不超过三句话"。
下次模型更新时,把这五道题再跑一遍,你就知道要不要动了。
EOF

cat > shotlist-prompt.txt <<'EOF'
把下面的口播稿转成分镜表,输出 Markdown 表格,列为:
序号 / 台词 / 画面内容 / 素材来源 / 预计时长(秒) / 屏幕文字

规则:
1. 按自然语义断句,一格台词对应一个画面,单格不超过 12 秒。
2. 「素材来源」只能填这四类之一:自有截图 / 需要制作的图表 / 素材库空镜 /
   需要生成的片段。生成片段的总时长不得超过全片的 10%。
3. 「画面内容」要具体到能照着做,不要写"相关画面"。
4. 「屏幕文字」只写需要打在画面上的关键词,每格不超过 10 个字;不需要就留空。
5. 预计时长按每分钟 240 字的语速估算,最后给出全片总时长和各类素材条数统计。
只输出表格和统计,不要其他说明。
EOF

第二步:跑起来

{ cat shotlist-prompt.txt; echo; echo "口播稿:"; cat script.txt; } > input.txt
claude --model sonnet -p "$(cat input.txt)"

终端窗口:进入 demo/video 目录,把分镜提示词和口播稿合并成 input.txt,调用 claude,输出一张含台词、画面内容、素材来源、时长和屏幕文字的分镜表,末尾是素材条数统计

终端窗口:进入 demo/video 目录,把分镜提示词和口播稿合并成 input.txt,调用 claude,输出一张含台词、画面内容、素材来源、时长和屏幕文字的分镜表,末尾是素材条数统计

图 3:这一节命令的实际终端输出。末尾那几行统计是这张表最实用的部分——它把「备素材」变成了一个有终点的清单。

第三步:读结果

输出的分镜表有 14 格,这里节选四格:

| 序号 | 台词 | 画面内容 | 素材来源 | 预计时长(秒) | 屏幕文字 |
| 3 | 模型会更新,你的提示词却停在原地。 | 左右对比图:左侧"模型版本升级"时间线滚动,右侧"提示词内容"文本框静止不动 | 需要制作的图表 | 4.3 | 模型更新/提示词不变 |
| 7 | 比如你原来靠"简短回答"这四个字压住输出长度,新版本可能不吃这一套。 | 对话框截图并列对比:旧版本用"简短回答"输出简短文字,新版本同样提示词输出长文字 | 自有截图 | 8.5 | 简短回答→失效 |
| 12 | 不要整段重写,先定位是哪一条约束失效了。 | 提示词文档截图,红框标出其中一条被高亮的约束语句 | 自有截图 | 5.0 | 定位失效约束 |
| 13 | 把模糊的形容词换成可检查的条件,比如把"简短"换成"不超过三句话"。 | 对比替换图:左侧"简短"模糊标签划掉,箭头指向右侧"不超过三句话"可检查条件 | 需要制作的图表 | 8.5 | 简短→不超过三句话 |

统计
- 全片总时长:72 秒(约 1 分 12 秒)
- 自有截图:3 条 需要制作的图表:9 条 素材库空镜:2 条
- 需要生成的片段:0 条(占比 0%,未超过 10% 上限)

这张表能直接用,有三个原因。

画面写到了能照着做的程度。 第 7 格不是「相关画面」,是「对话框截图并列对比:旧版本输出简短文字,新版本同样提示词输出长文字」——你拿着这句话就能去截图,不用回头再想。提示词里那句「不要写『相关画面』」是这一条的直接来源。

素材需求变成了可数的量。 3 条自有截图、9 张要做的图、2 条空镜,这就是你今晚要备的全部东西。没有这张表的时候,「备素材」是一个没有终点的动作;有了它,它是一个 14 项的清单。

生成片段是 0 条。 提示词里写了「生成片段总时长不得超过全片 10%」,它干脆一条都没排——因为这条视频全是具体信息,没有需要氛围镜头的地方。这正是「费用」一节里说的:把这项控制住,AI 视频那部分成本就基本消失了。

要提醒一句:时长是估算,不是实测。它按语速折算出 72 秒,实际配音出来会有出入,剪辑时以配音时间轴为准。分镜表的时长列是用来判断篇幅是否失衡的,不是用来对轴的。

输入素材

  • 一句话结论,以及这条视频给谁看
  • 核对过的事实与出处清单(视频里不好标注,所以要提前核到位)
  • 你自己的观点或经验——这是视频区别于「资料汇编」的唯一来源
  • 自有素材:产品截图、操作录屏、照片
  • 录音条件:一个安静的房间、一副带麦的耳机;或者一个可用的配音服务
  • 品牌视觉:封面模板、字幕样式、片头片尾
  • 一个用来听效果的耳机,以及一次在手机上看成片的机会

最终结果

  • 一条可发布的成片,画面、字幕、音量都对得上
  • 一份口播脚本和一份分镜表,两者都能作为下条视频的模板
  • 一份校对过的字幕文件,可用于二次分发和图文改写
  • 一个按分镜编号整理的素材文件夹
  • 一套封面模板和标题写法
  • 一份复盘记录:三秒留存、平均播放时长、互动

时间成本

阶段首条(5 分钟解说)熟练后60–90 秒短视频
选题与一句话结论30–45 分钟15 分钟10 分钟
资料与核对60–90 分钟40 分钟20 分钟
写脚本60–90 分钟30 分钟15 分钟
念一遍并改20–30 分钟15 分钟5 分钟
分镜表30–45 分钟15 分钟10 分钟
配音30–60 分钟20 分钟10 分钟
备素材60–120 分钟40 分钟20 分钟
剪辑与字幕校对120–180 分钟60–90 分钟30 分钟
封面与发布30 分钟10 分钟10 分钟
合计约 6–10 小时约 3–4 小时约 1.5–2 小时

最大的两块是备素材剪辑。这两块的耗时几乎完全取决于分镜表写得多具体——写清楚了就是执行,写模糊了就是在时间轴上边想边做。

费用

  • 零成本路线可行:自己录音、用剪辑软件的免费版和自带素材库、封面自己做。总支出为零,代价是配音质量取决于你的房间和嗓子。
  • 配音是主要变量:AI 配音服务通常按字符或按时长计费,也有包月档。一条五分钟解说的字符量不大,单条成本很低;但如果你要做多语言版本或频繁改稿重配,费用会明显上升。
  • 剪辑与素材:剪辑软件的会员主要买的是高级素材、无水印导出和更高分辨率,按月计费,属于可选项。商用素材和背景音乐的授权要单独确认,免费不等于可商用。
  • AI 生成片段是最贵的一项:这类服务按秒或按次计费,而且经常要生成好几条才有一条能用。把它控制在全片一成以内,这条成本就基本可以忽略;一旦想靠它撑满全片,费用会跳一个量级。
  • 容易忘的:云存储(视频素材占空间很快)、字体授权、封面用的商用图片。

失败情况

脚本是书面语听着累,播放量断崖 止损:出声念一遍换两次气的句子必拆 字幕专有名词错被截图传播 止损:逐句对照脚本校对重点查名词与数字 滥用生成片段割裂且费用飙升 止损:生成片段不超过 10%能用静态图推拉就替代 音量忽大忽小音乐盖住人声 止损:统一响度音乐明显压在人声之下 素材来源不清音乐与影视片段侵权 止损:只用自有或明确授权免费不等于可商用 开头 15 秒在自我介绍观众直接划走 止损:开场先给问题或反常识事实 一条做了三周做完再也不想做第二条 止损:先定死时长与素材上限模板化后再提高标准

图 4:七种翻车方式。第一、六种决定有没有人看完,第二到五种决定观感是否专业,第七种决定你还会不会有第二条。

一、书面语脚本。 最隐蔽也最致命。文字读起来毫无问题,念出来观众跟不上,表现是平均播放时长很短但你找不到原因。念一遍就能解决九成。

二、字幕出错。 自动字幕把产品名写成同音词、把「2026 年」写成「二零二六年」、把英文缩写拆开,这些错误单独看都不大,但它们是观众唯一会截图的东西。逐句对照脚本校对一遍,五分钟视频大约十分钟。

三、滥用 AI 生成片段。 表现是画面风格前后不统一、人物长相在两个镜头之间变了、生成一堆废片费用还很高。把它当调味料,不要当主食。

四、声音不统一。 自己录的段落和 AI 配音混用时尤其明显。导出前把所有音轨统一到接近的响度,背景音乐压到人声之下明显一档。

五、素材侵权。 背景音乐、影视片段、体育画面是三大高风险区。素材库里标着「免费」的资源也可能限制商用,用之前看清授权范围。

六、开头浪费。 前 15 秒讲「大家好我是谁」「今天我们来聊聊」,观众已经走了。开场应该直接给问题、给冲突、或者给一个反常识的事实。

七、第一条做得太重。 花三周做一条精雕细琢的视频,做完的感受通常是「再也不想做了」。第一条的目标是跑通流程并留下模板,不是做出你最好的作品。时长先定死、素材数量先设上限,做完再提高标准。

替代方案

如果你不擅长写、但擅长讲:先录一段十到二十分钟的自由讲述,用通义听悟转成文字,再让 AI 整理成脚本和分镜。这条路对很多人快得多,而且语气天然是你自己的。

如果内容是操作教学:直接录屏,边操作边讲。录屏本身就是分镜,后期只需要剪掉停顿、加字幕和重点标注,耗时能压到上表的一半。

如果你只是想把文章变成视频:用图文转视频类工具做一版,控制预期——这类成片适合信息补充,不适合当主要内容。

如果你的瓶颈在剪辑:把脚本和分镜表做好,剪辑外包。分镜表越具体,外包沟通成本越低,这也是这套流程的额外收益。


同系列的其他任务:用 AI 运营自媒体用 AI 阅读和整理 PDF用 AI 做知识库