INTERACTIVE FIELD GUIDE
先学会看懂,
再让 agent 动手
写给已经会用 Codex / Kimi Code 的开发者:
上篇拆解「看懂一条视频」的框架,下篇把框架变成 agent 可执行的生产线。
💡 一句话直觉
能拆,才能装。做视频和写软件是同一件事:都有单一事实来源(视频脚本之于源码)、都有依赖构建顺序(音频先行之于先编译底层库)、都需要门禁与评审(G1–G4 闸门之于 CI + code review)、都需要显式的规范文件(设计契约之于 lint 规则)。这个网站把这套对应关系变成十几个可以亲手玩的演示。
§核心结论(TL;DR)
- 一条视频不是「一幅画面」,而是来源 × 职能 × 图层三条正交轴的叠加。看懂一条视频,就是能给每个镜头报出它的三轴坐标。
- 景别有含义(远→近=心理距离由疏到亲),风格是选出来的:选定一条路线写进设计契约,全系列不换皮——视觉壁垒是主题包,不是单条视频。
- 脚本从调研结果里长出来,不是让 AI 自由发挥:一份文档分段写【画面】【口播】【备注】,G2 先审口播栏、G3 再审画面栏。音频先行,画面时长由真实语音反推,real duration wins。
- 生成是最贵的来源:AI 写代码(MG、数据可视化)确定性产出、重试近乎免费;AI 生像素(AI 视频、数字人)按次计费、重试是主成本。一条 4 分钟科普片,90% 的画面可以不「生成」。
- 剪映 / ChatCut / HyperFrames 是三个物种,本质区别在可编程性、可复现性、agent 可驱动性。按工序混着用的混合管线,是务实答案。
§学习路径
九章一条主线:前四章建立「看懂」的框架,后五章把框架变成生产线。后一章只依赖前面讲过的概念。每章都有可以上手调的演示——亲手把参数调崩,比看十遍结论记得牢。
PART 1 · 看懂一条视频
CH.01
解剖:三轴体系
来源 × 职能 × 图层,三条正交轴。点按筛选器给镜头报坐标,再走一遍红色虚线的完整示例。
✓ 已完成 CH.02镜头:景别与构图
远景到特写,取景范围就是心理距离。拖动滑块切换五种景别,再开三分法网格看主体该放哪。
✓ 已完成 CH.03气质:风格是选出来的
同一个主体、九种风格路线一键切换。风格没有高下只有匹配,选定后写进设计契约不换皮。
✓ 已完成 CH.04「讲得清楚」是一门学问
科普视频的八个知识域,按杠杆率排序。最后动手:把一条你喜欢的视频拆成一张清单。
✓ 已完成PART 2 · 让 agent 按图纸生产
CH.05
修正后的工作流
从调研到脚本再到并行生产。拖动滑块看「画面先行」的返工量,用脚本生成器看一份视频脚本的标准结构。
✓ 已完成 CH.06人工闸门与常见坑
G1–G4 四个必设闸门,设几个最合适?拖出一条 U 形成本曲线。附按踩中频率排序的坑清单。
✓ 已完成 CH.07素材成本决策器
「AI 写代码」与「AI 生像素」是两种成本结构。勾选镜头类型,累加一条片的成本构成。
✓ 已完成 CH.08工具格局:剪映 / ChatCut / HyperFrames
谁动手剪、素材从哪来——三个物种按六条维度对比,看各自的主场。
✓ 已完成 CH.09混合管线与 30 分钟流水线
不按「用哪个工具」决策,按「哪道工序用哪个工具」分配。最后给你一条 30 分钟可跑通的最小流水线。
✓ 已完成§关于本站
内容来自 2026-09 完成的调研报告《用 AI 编程代理生成自己满意的视频》(三路独立调研交叉验证后的合并结论)与一次真实成片的复盘,文章版见《用 coding agent 做视频:先学会看懂,再让 agent 动手》。产品功能、定价、模型版本随时间变化,调研中标注「待核实」的条目本站均保留提示,不应作为决策依据。全站零依赖纯静态,双击任意 HTML 即可离线浏览。