「AI 任务清单」系列第 05 篇。本文的范围:解说型、口播型、录屏讲解型视频的完整制作路径,从选题到发布。它不覆盖真人表演、剧情短片和需要专业摄制的广告片,也不是 AI 视频生成工具的横评——那部分见2026 年 AI 视频生成工具终极测评。
任务目标
做完这件事,你应该有:一条能直接发布的三到八分钟解说视频(或者一条 60 到 90 秒的短视频),有完整脚本、有分镜表、有配音、有校对过的字幕、有封面,素材归档整齐,下一条能在更短时间内做完。
关键词是「下一条更快」。第一条视频花多久其实不重要,重要的是你有没有留下一套可复用的东西:脚本模板、分镜表格式、字幕校对清单、素材库、封面模板。没有这些,第十条和第一条一样慢,而这正是大多数人做到第三条就停的原因。
推荐工具组合
| 层 | 干什么 | 推荐 | 备选 |
|---|---|---|---|
| 资料层 | 选题、事实核对、找出处 | Perplexity、秘塔AI搜索 | Felo |
| 脚本层 | 结构、论证顺序、信息密度 | Claude | ChatGPT |
| 口语层 | 把书面语改成能念顺的话 | Kimi、DeepSeek | 豆包 |
| 配音层 | 中文或多语配音 | 魔音工坊、讯飞智作 | ElevenLabs、Fish Audio |
| 画面层 | 图表、示意图、封面、少量生成图 | 稿定AI、Recraft | 通义万相、Napkin |
| 生成片段层 | 几秒空镜、转场、氛围镜头 | 可灵、即梦 | Runway、Pika |
| 剪辑层 | 对轴、自动字幕、调音、导出 | 剪映专业版 | 度加创作工具、Clipchamp |
| 转写层 | 先录后写时把录音转文字 | 通义听悟 | 讯飞听见 |
图 1:整条流水线。分镜表是全流程的枢纽——它同时决定配音怎么断句、需要哪些素材、剪辑时每段停留多久。没有它,这三件事会在剪辑软件里同时压到你身上。
为什么这样选
为什么把重心放在「脚本自带分镜」上。 做视频真正吃时间的不是写字,是在时间轴上反复拖拽:这句话配什么画面、这段停几秒、这个转场放哪。如果脚本阶段就把每句话对应的画面、时长和字幕写清楚,剪辑就变成了执行,速度差别是数倍。反过来,拿着一份纯文字稿进剪辑软件,你会在时间轴上边剪边想,这是最慢的做法。
为什么脚本一定要念一遍。 模型默认写书面语,而书面语在耳朵里非常难懂——长定语、嵌套从句、四字词堆叠,读着通顺,听着完全跟不上。判断方法只有一个:出声念一遍,凡是需要换气两次的句子就拆开,凡是念的时候会自动改口的地方就按你改口的说法改。
为什么不用 AI 生成整条视频。 当前的 AI 视频模型擅长几秒钟的氛围镜头、空镜和转场,不擅长承载具体信息——它画不对界面、写不对文字、也保证不了同一个主体在两个镜头里长得一样。用它撑满五分钟,代价是费用高、观感割裂、而且观众很快就会疲劳。合理用法是点缀:开场几秒、章节之间的转场、说到抽象概念时的示意画面。
为什么字幕必须人工校对。 自动字幕对日常口语准确率很高,但对专有名词、英文缩写、产品名、数字单位的错误率明显偏高。而字幕里的错别字是观众唯一会截图转发的东西。
完整步骤
第 1 步:定选题和一句话结论
先写出这条视频的一句话结论:看完之后观众能带走的那一句。写不出来就说明选题还没想清楚,这时候开始写脚本,最后一定是一堆信息没有落点。
第 2 步:资料与出处
用检索型 AI 把关键事实找齐,每条事实记下出处。视频比图文更难标注来源,所以核对要在前面做完。涉及数据、时间、价格、版本号的内容,一律以官方页面为准,模型给的记忆不可信。
第 3 步:写口播脚本
用下面第一段提示词。硬性要求写进提示词里:句子短、口语、不用书面连接词、每 30 秒有一个小结论。同时要求前 15 秒必须给出观众留下来的理由——不是自我介绍,是这条视频能解决他的什么问题。
第 4 步:念一遍
出声读全文,拿笔改。这一步平均能砍掉一到两成字数,而且砍掉的都是听不进去的部分。顺便记下自然停顿的位置,这就是后面的分句点。
第 5 步:出分镜表
让 AI 把脚本转成表格:序号 / 台词 / 画面内容 / 素材来源 / 预计时长 / 屏幕文字。画面来源要分类标注:自有截图、需要做的图表、素材库、需要生成的片段。这张表出来之后,你才知道要准备多少素材。
第 6 步:配音
两条路。自己录:手机加一副带麦的耳机就够,关窗、找软装多的房间、离麦一拳距离,比设备本身影响更大。AI 配音:优先选能调语速和停顿的,中文尤其要试听多音字和数字读法。无论哪条路,不要模仿真实人物的声音。
第 7 步:备素材
按分镜表逐条准备,不要边剪边找。截图统一分辨率,图表统一配色,生成片段控制在总时长的一成以内。所有素材放进一个文件夹,按分镜序号命名。
第 8 步:剪辑
顺序固定:先把配音铺满时间轴 → 按分镜对画面 → 自动生成字幕 → 逐句校对字幕 → 统一音量并降噪 → 加转场和背景音乐 → 通看一遍 → 导出。
背景音乐音量压到人声之下明显一档,很多业余感就来自音乐太响。
第 9 步:封面、标题与复盘
封面用固定模板,标题写清「解决什么问题」。发布后隔几天看三个数据:前 3 秒的留存(封面和开场的问题)、平均播放时长(脚本节奏的问题)、互动(选题的问题)。
图 2:九步流程与那个唯一的回环。「念得顺吗」这个判断放在配音之前,是因为配完音再改脚本,等于全部重来。
提示词
一、写口播脚本
你是一位写解说视频脚本的编剧。请把下面的资料写成一条 {时长} 的口播稿。
硬性要求:
1. 这是给人念出来、给人听的稿子,不是文章。句子平均不超过 20 个字,
一句话只说一件事,不用"其次""综上所述""值得注意的是"这类书面连接词。
2. 前 15 秒必须回答观众"我为什么要看下去",用一个具体问题或一个反常识的事实开场,
不要自我介绍,不要说"今天我们来聊聊"。
3. 每 30 秒左右给一个可以带走的小结论。
4. 全文只有一个核心结论:{一句话结论}。所有段落都要服务于它。
5. 涉及数字、时间、名称时,只使用我提供的资料,不要补充你记忆里的信息。
资料里没有的地方写"{待核实}"。
6. 结尾给一个具体动作,不要升华,不要求关注。
资料:
{贴你核对过的事实与出处}二、把脚本转成分镜表
把下面的口播稿转成分镜表,输出 Markdown 表格,列为:
序号 / 台词 / 画面内容 / 素材来源 / 预计时长(秒) / 屏幕文字
规则:
1. 按自然语义断句,一格台词对应一个画面,单格不超过 12 秒。
2. 「素材来源」只能填这四类之一:自有截图 / 需要制作的图表 / 素材库空镜 /
需要生成的片段。生成片段的总时长不得超过全片的 10%。
3. 「画面内容」要具体到能照着做,例如"产品设置页截图,高亮左侧第三项",
不要写"相关画面"。
4. 「屏幕文字」只写需要打在画面上的关键词,每格不超过 10 个字;不需要就留空。
5. 预计时长按每分钟 240 字的语速估算,最后给出全片总时长。
口播稿:
{贴念顺之后的脚本}三、生成素材需求清单
根据下面的分镜表,生成一份素材准备清单,按素材类型分组,方便我一次性备齐。
输出四组:
1. 需要我自己截图或拍摄的:逐条写清楚截什么界面、哪个状态、要不要高亮。
2. 需要制作的图表:写清楚图表类型、要表达的一句话结论、需要哪些数据。
3. 素材库可以直接找的:给出搜索关键词,每条两三个备选词。
4. 需要生成的片段:给出画面描述,并注明时长;同时告诉我这几条能不能用
静态图加缓慢推拉替代——如果能,优先替代。
最后统计:四类各多少条,预计准备时间。
分镜表:
{贴分镜表}四、字幕校对清单
下面是自动生成的字幕文本。请找出需要人工确认的地方,输出成清单。
重点检查:
1. 专有名词、产品名、公司名、英文缩写是否写错或写成同音词。
2. 数字、单位、日期、版本号是否与我的脚本一致。
3. 断句是否会造成歧义,长句是否需要拆成两行。
4. 口语中的语气词、重复词是否应该删掉。
5. 与原脚本相比有没有整句缺失或多出的内容。
输出格式:时间码 / 字幕原文 / 问题类型 / 建议改成。
不要顺手润色没有问题的句子。
原脚本:
{贴脚本}
自动字幕:
{贴导出的字幕文本}实测演示:一段口播稿变成一张能照着做的分镜表
实测环境:macOS + Claude Code 命令行 2.1.226,
--model sonnet,2026 年 8 月。口播稿是为演示写的,输出是真跑出来的。
动手前:先把命令行装好
演示用的是 Claude Code 的命令行版本,三条命令装好并验证:
# 1. 需要 Node.js 22 或更高版本
node --version
# 2. 全局安装
npm install -g @anthropic-ai/claude-code
# 3. 验证
claude --version # 应输出类似 2.1.226 (Claude Code)
claude doctor # 检查安装是否健康第一次使用要登录:在终端直接敲 claude 进入交互界面,按提示完成账号授权(之后可以用 claude auth 管理登录状态)。登录完成后,下面这种一次性的 -p 调用就能直接跑了。
本文所有命令都写了 --model sonnet,是为了让你复现时和这里用的是同一档模型;不加这个参数会用你账号的默认模型,输出会有出入。
第一步:准备材料(复制粘贴即可)
一段 300 多字的口播稿,主题是「提示词为什么会失效、怎么发现、怎么修」,已经按第 4 步念过一遍、拆过长句:
mkdir -p ~/demo/video && cd ~/demo/video
cat > script.txt <<'EOF'
你有没有发现,同一个提示词,今天好用,过两周就不好用了。
这不是你的错觉。
模型会更新,你的提示词却停在原地。
今天讲三件事:为什么会失效、怎么发现、怎么修。
第一,为什么失效。提示词依赖模型的默认行为,模型一改,默认行为就变了。
比如你原来靠"简短回答"这四个字压住输出长度,新版本可能不吃这一套。
第二,怎么发现。你需要一组固定的测试题,每次模型更新后重新跑一遍。
不用多,五道题就够,但必须每次都是同一组。
第三,怎么修。不要整段重写,先定位是哪一条约束失效了。
把模糊的形容词换成可检查的条件,比如把"简短"换成"不超过三句话"。
下次模型更新时,把这五道题再跑一遍,你就知道要不要动了。
EOF
cat > shotlist-prompt.txt <<'EOF'
把下面的口播稿转成分镜表,输出 Markdown 表格,列为:
序号 / 台词 / 画面内容 / 素材来源 / 预计时长(秒) / 屏幕文字
规则:
1. 按自然语义断句,一格台词对应一个画面,单格不超过 12 秒。
2. 「素材来源」只能填这四类之一:自有截图 / 需要制作的图表 / 素材库空镜 /
需要生成的片段。生成片段的总时长不得超过全片的 10%。
3. 「画面内容」要具体到能照着做,不要写"相关画面"。
4. 「屏幕文字」只写需要打在画面上的关键词,每格不超过 10 个字;不需要就留空。
5. 预计时长按每分钟 240 字的语速估算,最后给出全片总时长和各类素材条数统计。
只输出表格和统计,不要其他说明。
EOF第二步:跑起来
{ cat shotlist-prompt.txt; echo; echo "口播稿:"; cat script.txt; } > input.txt
claude --model sonnet -p "$(cat input.txt)"图 3:这一节命令的实际终端输出。末尾那几行统计是这张表最实用的部分——它把「备素材」变成了一个有终点的清单。
第三步:读结果
输出的分镜表有 14 格,这里节选四格:
| 序号 | 台词 | 画面内容 | 素材来源 | 预计时长(秒) | 屏幕文字 |
| 3 | 模型会更新,你的提示词却停在原地。 | 左右对比图:左侧"模型版本升级"时间线滚动,右侧"提示词内容"文本框静止不动 | 需要制作的图表 | 4.3 | 模型更新/提示词不变 |
| 7 | 比如你原来靠"简短回答"这四个字压住输出长度,新版本可能不吃这一套。 | 对话框截图并列对比:旧版本用"简短回答"输出简短文字,新版本同样提示词输出长文字 | 自有截图 | 8.5 | 简短回答→失效 |
| 12 | 不要整段重写,先定位是哪一条约束失效了。 | 提示词文档截图,红框标出其中一条被高亮的约束语句 | 自有截图 | 5.0 | 定位失效约束 |
| 13 | 把模糊的形容词换成可检查的条件,比如把"简短"换成"不超过三句话"。 | 对比替换图:左侧"简短"模糊标签划掉,箭头指向右侧"不超过三句话"可检查条件 | 需要制作的图表 | 8.5 | 简短→不超过三句话 |
统计
- 全片总时长:72 秒(约 1 分 12 秒)
- 自有截图:3 条 需要制作的图表:9 条 素材库空镜:2 条
- 需要生成的片段:0 条(占比 0%,未超过 10% 上限)这张表能直接用,有三个原因。
画面写到了能照着做的程度。 第 7 格不是「相关画面」,是「对话框截图并列对比:旧版本输出简短文字,新版本同样提示词输出长文字」——你拿着这句话就能去截图,不用回头再想。提示词里那句「不要写『相关画面』」是这一条的直接来源。
素材需求变成了可数的量。 3 条自有截图、9 张要做的图、2 条空镜,这就是你今晚要备的全部东西。没有这张表的时候,「备素材」是一个没有终点的动作;有了它,它是一个 14 项的清单。
生成片段是 0 条。 提示词里写了「生成片段总时长不得超过全片 10%」,它干脆一条都没排——因为这条视频全是具体信息,没有需要氛围镜头的地方。这正是「费用」一节里说的:把这项控制住,AI 视频那部分成本就基本消失了。
要提醒一句:时长是估算,不是实测。它按语速折算出 72 秒,实际配音出来会有出入,剪辑时以配音时间轴为准。分镜表的时长列是用来判断篇幅是否失衡的,不是用来对轴的。
输入素材
- 一句话结论,以及这条视频给谁看
- 核对过的事实与出处清单(视频里不好标注,所以要提前核到位)
- 你自己的观点或经验——这是视频区别于「资料汇编」的唯一来源
- 自有素材:产品截图、操作录屏、照片
- 录音条件:一个安静的房间、一副带麦的耳机;或者一个可用的配音服务
- 品牌视觉:封面模板、字幕样式、片头片尾
- 一个用来听效果的耳机,以及一次在手机上看成片的机会
最终结果
- 一条可发布的成片,画面、字幕、音量都对得上
- 一份口播脚本和一份分镜表,两者都能作为下条视频的模板
- 一份校对过的字幕文件,可用于二次分发和图文改写
- 一个按分镜编号整理的素材文件夹
- 一套封面模板和标题写法
- 一份复盘记录:三秒留存、平均播放时长、互动
时间成本
| 阶段 | 首条(5 分钟解说) | 熟练后 | 60–90 秒短视频 |
|---|---|---|---|
| 选题与一句话结论 | 30–45 分钟 | 15 分钟 | 10 分钟 |
| 资料与核对 | 60–90 分钟 | 40 分钟 | 20 分钟 |
| 写脚本 | 60–90 分钟 | 30 分钟 | 15 分钟 |
| 念一遍并改 | 20–30 分钟 | 15 分钟 | 5 分钟 |
| 分镜表 | 30–45 分钟 | 15 分钟 | 10 分钟 |
| 配音 | 30–60 分钟 | 20 分钟 | 10 分钟 |
| 备素材 | 60–120 分钟 | 40 分钟 | 20 分钟 |
| 剪辑与字幕校对 | 120–180 分钟 | 60–90 分钟 | 30 分钟 |
| 封面与发布 | 30 分钟 | 10 分钟 | 10 分钟 |
| 合计 | 约 6–10 小时 | 约 3–4 小时 | 约 1.5–2 小时 |
最大的两块是备素材和剪辑。这两块的耗时几乎完全取决于分镜表写得多具体——写清楚了就是执行,写模糊了就是在时间轴上边想边做。
费用
- 零成本路线可行:自己录音、用剪辑软件的免费版和自带素材库、封面自己做。总支出为零,代价是配音质量取决于你的房间和嗓子。
- 配音是主要变量:AI 配音服务通常按字符或按时长计费,也有包月档。一条五分钟解说的字符量不大,单条成本很低;但如果你要做多语言版本或频繁改稿重配,费用会明显上升。
- 剪辑与素材:剪辑软件的会员主要买的是高级素材、无水印导出和更高分辨率,按月计费,属于可选项。商用素材和背景音乐的授权要单独确认,免费不等于可商用。
- AI 生成片段是最贵的一项:这类服务按秒或按次计费,而且经常要生成好几条才有一条能用。把它控制在全片一成以内,这条成本就基本可以忽略;一旦想靠它撑满全片,费用会跳一个量级。
- 容易忘的:云存储(视频素材占空间很快)、字体授权、封面用的商用图片。
失败情况
图 4:七种翻车方式。第一、六种决定有没有人看完,第二到五种决定观感是否专业,第七种决定你还会不会有第二条。
一、书面语脚本。 最隐蔽也最致命。文字读起来毫无问题,念出来观众跟不上,表现是平均播放时长很短但你找不到原因。念一遍就能解决九成。
二、字幕出错。 自动字幕把产品名写成同音词、把「2026 年」写成「二零二六年」、把英文缩写拆开,这些错误单独看都不大,但它们是观众唯一会截图的东西。逐句对照脚本校对一遍,五分钟视频大约十分钟。
三、滥用 AI 生成片段。 表现是画面风格前后不统一、人物长相在两个镜头之间变了、生成一堆废片费用还很高。把它当调味料,不要当主食。
四、声音不统一。 自己录的段落和 AI 配音混用时尤其明显。导出前把所有音轨统一到接近的响度,背景音乐压到人声之下明显一档。
五、素材侵权。 背景音乐、影视片段、体育画面是三大高风险区。素材库里标着「免费」的资源也可能限制商用,用之前看清授权范围。
六、开头浪费。 前 15 秒讲「大家好我是谁」「今天我们来聊聊」,观众已经走了。开场应该直接给问题、给冲突、或者给一个反常识的事实。
七、第一条做得太重。 花三周做一条精雕细琢的视频,做完的感受通常是「再也不想做了」。第一条的目标是跑通流程并留下模板,不是做出你最好的作品。时长先定死、素材数量先设上限,做完再提高标准。
替代方案
如果你不擅长写、但擅长讲:先录一段十到二十分钟的自由讲述,用通义听悟转成文字,再让 AI 整理成脚本和分镜。这条路对很多人快得多,而且语气天然是你自己的。
如果内容是操作教学:直接录屏,边操作边讲。录屏本身就是分镜,后期只需要剪掉停顿、加字幕和重点标注,耗时能压到上表的一半。
如果你只是想把文章变成视频:用图文转视频类工具做一版,控制预期——这类成片适合信息补充,不适合当主要内容。
如果你的瓶颈在剪辑:把脚本和分镜表做好,剪辑外包。分镜表越具体,外包沟通成本越低,这也是这套流程的额外收益。
同系列的其他任务:用 AI 运营自媒体、用 AI 阅读和整理 PDF、用 AI 做知识库。