PART 1 · CHAPTER 01

解剖:三轴体系——来源 × 职能 × 图层

痛点钩子:两条讲同一个话题的视频,一条看完想三连,一条 10 秒就被划走。区别多数人只能说出「节奏好」「看着舒服」——但「舒服」不是玄学,它是一组可以逐个指认的零件。能拆,才能装:看懂别人的视频,是让 agent 做出满意视频的前置课。

1.1暂停一帧:画面是叠出来的

暂停任何一条视频,你看到的「一个画面」其实是几层叠在一起的合成结果:背景、主体、图形叠加层(箭头、高亮框、贴纸)、文字层(标题与字幕)。声音虽然看不见,也是独立的轨——人声、BGM、音效各走各的。

另一种看法不按「层」,按「职能」:主叙事画面叫 A-roll(讲解者对着镜头讲),辅助画面叫 B-roll(手部特写、产品演示、资料画面)。专业视频的呼吸感,大多来自 A-roll 与 B-roll 的交替——一直对着脸讲,10 秒就闷了。

💡 一句话直觉 A-roll 管「谁在讲」(主叙事),B-roll 管「看什么」(辅助画面)。口播驱动的视频里,大部分画面是 B-roll 性质的辅助视觉——它们的成败标准不是「多惊艳」,而是「是否刚好解释了这句话」。

1.2演示:暂停一帧,数数有几层

一帧画面的图层拆解器
下面是一帧合成的示意画面。点按开关逐个关掉图层,看画面如何「瘦身」——再全部关掉主体层试试:剩下的包装再精美也不是一条视频。音频轨虽然不可见,也画在下方分轨上。
画面层:— 音频轨:— —
💡 小实验 下次看视频时随便暂停一帧,数数这一帧有几层、想想它是什么职能(A-roll 还是 B-roll)。能回答这两个问题,你就已经开始「看懂」了。

1.3三条正交轴:像填快递单一样描述镜头

「层」和「职能」是两条不同的轴,再加上「画面从哪来」,就齐了。三条轴各回答一个问题,互不干涉——「正交」就是这个意思。像填快递单:寄的什么、干嘛用的、怎么打包,三栏各填各的,任意组合都合法。

轴回答的问题决定什么取值(列举)
轴一 · 来源画面从哪来成本与工期——选哪条路,价格和返工难度差出一个数量级实拍 / 录屏 / 静帧运镜 / 代码 MG / AI 视频 / 数字人 / 数据可视化……共 13 类(见 1.5)
轴二 · 职能它在这段里起什么作用叙事结构——与来源无关,同一段素材可以担不同职能A-roll 主叙事 / B-roll 辅助 / 钩子 / 章节卡 / 插入镜 / 转场 / 结尾卡
轴三 · 图层 / 轨道它叠在第几层工程结构——渲染时分几个元素、混音时分几条轨、改的时候动哪一层背景 / 主体画面 / 图形叠加 / 文字字幕 / 音频分轨(人声、BGM、SFX)

三轴合起来,描述一个镜头就是报出它的三个坐标。以一段「数字从 0 跳到 4 分钟」的计数动画为例(沿下图中红色虚线走一遍):来源是 ①数据可视化(代码生成的画面),职能是 ②B-roll(给口播配画面),位置是 ③图形叠加层(压在底图之上)。三个坐标一交,这个镜头就被完整描述了:

轴一 · 来源 画面从哪来(列举) 实拍 录屏 静帧运镜 MG AI 视频 数字人 数据可视化 三维 CG 叠加层/文字卡 音频轨与字幕轨 轴二 · 叙事职能 起什么作用,与来源无关 A-roll B-roll 钩子 章节卡 插入镜 转场 轴三 · 图层 / 轨道 叠在第几层,决定渲染与混音结构 背景 主体 图形叠加 文字字幕 音频分轨 1 2 3 例:一段数据计数动画(数字从 0 跳到 4 分钟) = ①数据可视化(来源) × ②B-roll(职能) × ③图形叠加(轨道)
∑ 想深一层 轴二最容易被忽视的一点是:同一段素材可以担不同职能——一段录屏,放开头是钩子,放中段是 B-roll。所以职能不贴在素材文件上,而贴在「时间轴上的这一段」上。这也是为什么分镜表要逐镜填写职能,而不是给素材库打标签。

1.4演示:三轴坐标器

给任何镜头报出「三轴坐标」
在三条轴上各点选一个值,readout 会报出这个镜头的完整坐标描述和一句点评。也可以直接点下面的预设——它们是文章里的练手画面,先自己猜再对答案。
轴一 · 来源(13 类)
轴二 · 职能
轴三 · 图层 / 轨道
尚未选定坐标 —

1.5轴一速查:13 类来源,按生产方式分五族

来源轴决定成本与工期,值得单独记一张速查表。13 类按生产方式分成五族——注意「代码生成」这一族,它是 agent 工作流的主场:

族来源类别要点
拍摄 / 捕获实拍(A-roll / B-roll)· 录屏 / 界面捕获 · 静帧 + 运镜录屏可脚本化(OBS / 无头浏览器);静帧 Ken Burns 推拉的运动曲线代码可精确控制
代码生成图形动画(MG)· 数据可视化动画 · 三维动画 / CG · 透明叠加层 · 文字卡 / 标题卡agent 路线的结构性优势区:排版动画、计数、图表、下三分之一、LOGO 演绎全在这里
AI 模型AI 文生视频(T2V)· AI 图生视频(I2V)· 数字人按次计费,重试是主成本;I2V 先生成一致性静帧再动起来,是当前跨镜一致性的主流工程绕行方案
专用工具 / 库白板 / 手绘 / 程序化动画(Manim 类)手写逐步画的效果,部分可代码生成
音频轨口播 · BGM · SFX · 字幕轨画面之外同样需要调度与混音——混音时人声、BGM、音效分轨处理

做教学 / 科普 / 产品宣传的开发者,实际高频组合是:录屏 + MG + 数据可视化 + 静帧运镜 + 少量 AI 视频(做氛围 B-roll)+ 可选数字人。这恰好是代码 + agent 路线覆盖最好的组合——你的主战场恰好是可以编程的那部分。

⚠️ 透明叠加层的编码坑 带 alpha 的图形层(字幕条、贴纸动效)编码要走 WebM alpha 或 ProRes 4444,与 HDR 通常互斥。第一次需要透明通道时再查编码参数就晚了,写进你的设计契约里。
✓ 本章小结 一条视频可以沿三条正交轴拆开:来源(画面从哪来,决定成本工期)、职能(A-roll / B-roll / 钩子 / 卡片,决定叙事结构)、图层(叠在第几层,决定渲染与混音结构)。看到任何镜头都报得出三轴坐标,你就「看懂」了。但画面还有另一个维度——镜头离你多远,下一章拆景别与构图。
← 返回
首页 · 学习路径