解剖:三轴体系——来源 × 职能 × 图层
痛点钩子:两条讲同一个话题的视频,一条看完想三连,一条 10 秒就被划走。区别多数人只能说出「节奏好」「看着舒服」——但「舒服」不是玄学,它是一组可以逐个指认的零件。能拆,才能装:看懂别人的视频,是让 agent 做出满意视频的前置课。
1.1暂停一帧:画面是叠出来的
暂停任何一条视频,你看到的「一个画面」其实是几层叠在一起的合成结果:背景、主体、图形叠加层(箭头、高亮框、贴纸)、文字层(标题与字幕)。声音虽然看不见,也是独立的轨——人声、BGM、音效各走各的。
另一种看法不按「层」,按「职能」:主叙事画面叫 A-roll(讲解者对着镜头讲),辅助画面叫 B-roll(手部特写、产品演示、资料画面)。专业视频的呼吸感,大多来自 A-roll 与 B-roll 的交替——一直对着脸讲,10 秒就闷了。
1.2演示:暂停一帧,数数有几层
1.3三条正交轴:像填快递单一样描述镜头
「层」和「职能」是两条不同的轴,再加上「画面从哪来」,就齐了。三条轴各回答一个问题,互不干涉——「正交」就是这个意思。像填快递单:寄的什么、干嘛用的、怎么打包,三栏各填各的,任意组合都合法。
| 轴 | 回答的问题 | 决定什么 | 取值(列举) |
|---|---|---|---|
| 轴一 · 来源 | 画面从哪来 | 成本与工期——选哪条路,价格和返工难度差出一个数量级 | 实拍 / 录屏 / 静帧运镜 / 代码 MG / AI 视频 / 数字人 / 数据可视化……共 13 类(见 1.5) |
| 轴二 · 职能 | 它在这段里起什么作用 | 叙事结构——与来源无关,同一段素材可以担不同职能 | A-roll 主叙事 / B-roll 辅助 / 钩子 / 章节卡 / 插入镜 / 转场 / 结尾卡 |
| 轴三 · 图层 / 轨道 | 它叠在第几层 | 工程结构——渲染时分几个元素、混音时分几条轨、改的时候动哪一层 | 背景 / 主体画面 / 图形叠加 / 文字字幕 / 音频分轨(人声、BGM、SFX) |
三轴合起来,描述一个镜头就是报出它的三个坐标。以一段「数字从 0 跳到 4 分钟」的计数动画为例(沿下图中红色虚线走一遍):来源是 ①数据可视化(代码生成的画面),职能是 ②B-roll(给口播配画面),位置是 ③图形叠加层(压在底图之上)。三个坐标一交,这个镜头就被完整描述了:
1.4演示:三轴坐标器
1.5轴一速查:13 类来源,按生产方式分五族
来源轴决定成本与工期,值得单独记一张速查表。13 类按生产方式分成五族——注意「代码生成」这一族,它是 agent 工作流的主场:
| 族 | 来源类别 | 要点 |
|---|---|---|
| 拍摄 / 捕获 | 实拍(A-roll / B-roll)· 录屏 / 界面捕获 · 静帧 + 运镜 | 录屏可脚本化(OBS / 无头浏览器);静帧 Ken Burns 推拉的运动曲线代码可精确控制 |
| 代码生成 | 图形动画(MG)· 数据可视化动画 · 三维动画 / CG · 透明叠加层 · 文字卡 / 标题卡 | agent 路线的结构性优势区:排版动画、计数、图表、下三分之一、LOGO 演绎全在这里 |
| AI 模型 | AI 文生视频(T2V)· AI 图生视频(I2V)· 数字人 | 按次计费,重试是主成本;I2V 先生成一致性静帧再动起来,是当前跨镜一致性的主流工程绕行方案 |
| 专用工具 / 库 | 白板 / 手绘 / 程序化动画(Manim 类) | 手写逐步画的效果,部分可代码生成 |
| 音频轨 | 口播 · BGM · SFX · 字幕轨 | 画面之外同样需要调度与混音——混音时人声、BGM、音效分轨处理 |
做教学 / 科普 / 产品宣传的开发者,实际高频组合是:录屏 + MG + 数据可视化 + 静帧运镜 + 少量 AI 视频(做氛围 B-roll)+ 可选数字人。这恰好是代码 + agent 路线覆盖最好的组合——你的主战场恰好是可以编程的那部分。