INTERACTIVE FIELD GUIDE

先学会看懂,
再让 agent 动手

写给已经会用 Codex / Kimi Code 的开发者:
上篇拆解「看懂一条视频」的框架,下篇把框架变成 agent 可执行的生产线。

💡 一句话直觉 能拆,才能装。做视频和写软件是同一件事:都有单一事实来源(视频脚本之于源码)、都有依赖构建顺序(音频先行之于先编译底层库)、都需要门禁与评审(G1–G4 闸门之于 CI + code review)、都需要显式的规范文件(设计契约之于 lint 规则)。这个网站把这套对应关系变成十几个可以亲手玩的演示。

§核心结论(TL;DR)

  1. 一条视频不是「一幅画面」,而是来源 × 职能 × 图层三条正交轴的叠加。看懂一条视频,就是能给每个镜头报出它的三轴坐标。
  2. 景别有含义(远→近=心理距离由疏到亲),风格是选出来的:选定一条路线写进设计契约,全系列不换皮——视觉壁垒是主题包,不是单条视频。
  3. 脚本从调研结果里长出来,不是让 AI 自由发挥:一份文档分段写【画面】【口播】【备注】,G2 先审口播栏、G3 再审画面栏。音频先行,画面时长由真实语音反推,real duration wins。
  4. 生成是最贵的来源:AI 写代码(MG、数据可视化)确定性产出、重试近乎免费;AI 生像素(AI 视频、数字人)按次计费、重试是主成本。一条 4 分钟科普片,90% 的画面可以不「生成」。
  5. 剪映 / ChatCut / HyperFrames 是三个物种,本质区别在可编程性、可复现性、agent 可驱动性。按工序混着用的混合管线,是务实答案。

§学习路径

九章一条主线:前四章建立「看懂」的框架,后五章把框架变成生产线。后一章只依赖前面讲过的概念。每章都有可以上手调的演示——亲手把参数调崩,比看十遍结论记得牢。

PART 1 · 看懂一条视频

PART 2 · 让 agent 按图纸生产

§关于本站

内容来自 2026-09 完成的调研报告《用 AI 编程代理生成自己满意的视频》(三路独立调研交叉验证后的合并结论)与一次真实成片的复盘,文章版见《用 coding agent 做视频:先学会看懂,再让 agent 动手》。产品功能、定价、模型版本随时间变化,调研中标注「待核实」的条目本站均保留提示,不应作为决策依据。全站零依赖纯静态,双击任意 HTML 即可离线浏览。