按读者选择的阅读路径¶
本页将仓库内容重组为若干条面向不同目标的阅读路线。它们不是难度排名,也不要求按文件顺序读完;每条路线都以一个可检验的产出结束,再按需要横向进入其他路线。
如何使用:先选择最接近你当前任务的读者画像;按照“必读”顺序完成主线;只有遇到明确问题时再读“按需补充”。每读完一篇,记录一个结论、一个证据来源和一个仍未解决的问题。
0. 先选路线¶
| 你当前最想解决的问题 | 推荐路线 | 建议投入 | 完成后能做什么 |
|---|---|---|---|
| “视频生成到底在做什么,为什么会出错?” | A. 通识与教学读者 | 1–2 小时 | 解释训练、生成、控制与评测的基本边界 |
| “我想用它创作内容或评估产品能力。” | B. 创作者、产品与应用读者 | 半天 | 将需求翻译成任务、测试用例与验收标准 |
| “我需要选模型、搭建系统或优化推理。” | C. 工程与系统读者 | 2–4 天 | 区分系统组件,制定可复现实验与部署账本 |
| “我需要读论文、找问题、做研究。” | D. 研究生与研究者 | 1–2 周 | 形成可证伪的研究问题与最小实验计划 |
| “我关心物理、交互、机器人或世界模型。” | E. 世界模型与具身智能读者 | 3–5 天 | 判断生成视频何时能支持状态预测与决策 |
| “我需要把这些内容组织成一次课程或组会。” | F. 教师与课程组织者 | 1–2 天 | 组合一套由直觉、实践和证据构成的教学单元 |
如果你的身份跨越多类读者,建议先完成最贴近当下交付物的一条,再把另一条作为交叉路线;例如,做视频应用原型的工程师先走 C,再从 B 补齐任务验收。
A. 通识与教学读者¶
适合谁:第一次接触视频生成的学习者、希望理解产品工作原理的非技术读者、需要准备概览性讲解的教师。
核心问题:模型怎样从文字、图片或视频得到一段连续画面?“画面好看”与“真的理解、真的可靠”有什么差别?
必读顺序¶
- 零基础入门 —— 先建立“训练”和“生成”是两个阶段的直觉。
- 任务地图 —— 用输入、输出与约束区分文生视频、图生视频、编辑、控制与预测。
- 应用地图 —— 把技术任务映射到创作、数字人、修复、机器人等场景。
- 评测指南 的导言与基础维度 —— 学会把“演示效果”与“可靠能力”分开。
按需补充¶
- 想理解“为什么视频比图片难”:回到零基础入门中的时序一致性部分。
- 想讨论“模型是否理解物理”:读物理一致性。
- 想理解“视频模型是否就是世界模型”:读World Model的定义与边界。
建议产出与下一跳¶
用不超过 200 字解释一个视频产品的输入、生成过程、输出与一个典型失败模式。完成后:想做内容或评估产品,进入路线 B;想理解实现机制,进入路线 C。
B. 创作者、产品与应用读者¶
适合谁:内容创作者、产品经理、设计师、解决方案人员,以及需要选择视频生成能力的应用团队。
核心问题:我的任务究竟属于哪一类?需要什么控制信号?怎样设计测试,避免只被单个最佳样例说服?
必读顺序¶
- 任务地图 —— 先把需求表达成“输入 → 输出 → 约束”。
- 按你的任务选择一个专章:
- 从文字创作: 文生视频
- 让图片动起来: 图生视频
- 重剪、风格化或修改素材: 视频到视频
- 人物口播与角色呈现: 数字人
- 更精确的镜头、轨迹、姿态或对象约束: 细粒度可控生成
- 修复、补全既有视频: 视频退化修复 或 视频补全
- 多视角动态资产: 多视角与 4D
- 声画一体生成: 原生音视频
- 应用地图 —— 对照真实工作流、成本与风险边界。
- 评测指南 —— 为同一需求建立多次生成、失败标签和人工验收协议。
读法提示¶
- 先写验收,再选模型:至少写出主体身份、动作、镜头、时长、可接受失败与复生成本。
- 一次只验证一个变量:例如先验证人物一致性,再验证镜头控制;不要把所有控制项放进一条提示词后归因。
- 区分“可展示”与“可交付”:一次成功样例不代表跨提示、跨主体、跨时长仍稳定。
建议产出与下一跳¶
完成一页任务卡:目标用户 / 输入资产 / 期望输出 / 必须保持的约束 / 失败标签 / 验收样例。需要把任务落为系统时进入路线 C;希望追溯论文与方法依据时进入路线 D。
C. 工程与系统读者¶
适合谁:算法工程师、平台工程师、需要选型、复现、部署或优化推理的视频生成开发者。
核心问题:系统由哪些正交组件构成?速度、显存、质量和控制能力应该怎样同时记账?
必读顺序¶
- 生成模型路线 —— 建立
representation / factorization / objective / backbone / deployment的分层框架。 - 视频 Tokenizer 与生成式压缩 —— 明确 latent、token、量化、时空预算与真实码率的边界。
- Video DiT 与骨干扩展 —— 从 token 数量、注意力拓扑、条件融合与并行策略理解瓶颈。
- 视频后训练与对齐 —— 区分 SFT、偏好优化、强化学习、guidance 与少步蒸馏。
- 因果与流式生成 —— 如果目标是低首帧延迟、连续生成或中途修改条件。
- 开放模型 → 数据集 → 评测指南 —— 将方法选择落到可运行工件和实验协议。
按需分支¶
| 系统问题 | 优先阅读 |
|---|---|
| 长视频、上下文与记忆 | 视频预测 · 因果与流式生成 |
| 少步、高吞吐与部署成本 | Flow / consistency · 视频后训练与对齐 |
| 控制接口与多条件融合 | 细粒度可控生成 · 视频基础模型 |
| 声画联合时序 | 原生音视频 |
| 数据退化与恢复 | 视频退化修复 |
建议产出与下一跳¶
建立一张系统 manifest:输入条件、表示、生成目标、骨干、采样 NFE、解码与后处理、硬件、端到端时延、质量指标、失败场景。若指标没有明确计时边界,就不要比较“加速倍数”。准备提出新方法或复现实验时进入路线 D。
D. 研究生与研究者¶
适合谁:需要建立文献框架、确定研究问题、撰写论文或设计可验证实验的研究人员。
核心问题:一个研究主张究竟改变了哪一层?它依赖什么证据?怎样构造会推翻自己结论的实验?
必读顺序¶
- 技术时间线 —— 先理解不同路线如何并行演化,而不是把新模型简单看成替代旧模型。
- 论文阅读课程 的“先修诊断、共同主干与怎样选主修分支” —— 建立术语、证据等级与阅读问题。
- 生成模型路线 与 评测指南 —— 将论文放进统一技术轴,并建立证据判断习惯。
- 选定一条主修分支和一条交叉分支:
- 表示与压缩: 视频 Tokenizer
- 随机未来与不确定性: 变分随机视频生成
- 架构与效率: Video DiT
- 实时与流式: 因果与流式生成
- 控制、4D、个性化、修复、音视频或世界模型:按任务地图进入对应专题
- 引用与代码索引 —— 回到一手论文、官方代码、数据和基线。
研究阅读规则¶
每篇关键论文至少回答:
- 它建模的是 RGB、latent、token、state 还是 action?
- 它改变的是表示、分解、目标、骨干、条件、执行还是评测?
- 训练时能看到、部署时看不到的信息是什么?
- 结论来自正式论文、预印本、官方发布,还是你自己的复现?
- 哪个反事实实验会让该结论不成立?
建议产出与下一跳¶
输出一张 claim card:问题 / 方法改变的层 / 对比对象 / 证据等级 / 失败条件 / 最小复现实验。如果研究涉及物理、动作或决策,请继续路线 E;如果需要实现原型与量化性能,请回到路线 C。
E. 世界模型与具身智能读者¶
适合谁:关注物理一致性、动作条件预测、交互环境、机器人或把视频模型用于规划与决策的读者。
核心问题:一个会生成连贯视频的模型,何时才可以被称为可用的世界模型?动作、状态、反事实和闭环如何检验?
必读顺序¶
- 零基础入门 中“视频模型就是 world model 吗?” —— 先避免概念混淆。
- World Model —— 明确 observation、state、action、reward、open-loop rollout 与 closed-loop control。
- Video Reasoning —— 分清视频理解、时序推理与生成预测。
- 物理一致性 —— 从视觉合理性进入可干预、可测量的物理主张。
- 动作条件预测 与 交互式世界生成 —— 检查动作接口、状态延续和反馈闭环。
- 评测指南 —— 将演示视频替换为 action-conditioned、counterfactual、closed-loop 的证据协议。
读法提示¶
- 先区分相机控制与环境动作:镜头轨迹不等于可作用于世界状态的 action。
- 先区分单条连贯轨迹与可查询状态:可沿一条路径生成,不代表能在任意时刻、任意视角保持一致。
- 优先寻找反事实:同一初始状态下改变动作、外力或物体属性,结果是否按机制改变?
建议产出与下一跳¶
画出一个最小闭环:observation → state estimate → action → predicted next state/video → environment feedback → evaluation,并标出每个箭头可观测的指标。需要端到端系统实现时补路线 C;要形成论文问题时补路线 D。
F. 教师与课程组织者¶
适合谁:准备本科导论、研究生专题课、组会读书会或跨学科分享的教师与课程组织者。
核心问题:怎样让不同基础的学习者既建立直觉,又不把宣传性演示误当作研究结论?
推荐的三段式教学顺序¶
- 建立问题意识(第 1 次): 零基础入门 → 任务地图 → 应用地图。 课堂任务:让学习者为一个产品案例写出输入、输出、约束和可能失败。
- 理解技术坐标(第 2–3 次): 生成模型路线 → 视频基础模型 → 技术时间线。 课堂任务:让学习者把一篇模型论文拆到表示、目标、骨干、条件和部署层。
- 建立证据意识(第 4 次及以后): 评测指南 → 论文阅读课程 → 任选一个任务专题。 课堂任务:为一项能力声明设计多次生成、对照、失败标签与反事实测试。
分层布置建议¶
| 学习者基础 | 主线 | 推荐作业 |
|---|---|---|
| 无技术背景 | A 路线 | 解释一个生成案例及其局限 |
| 有编程基础 | C 路线前四篇 | 编写系统 manifest 或复现实验账本 |
| 研究生 | D 路线 | 提交 claim card 与最小反证实验 |
| 具身/机器人方向 | E 路线 | 设计 action-conditioned 闭环评测 |
建议产出与下一跳¶
每次教学都保留一个共同的“能力主张—证据—边界”表格。课程结束时,学生应能回答:系统声称会什么、证据是否足够、以及下一项实验如何推翻或支持该主张。
1. 跨路线的通用阅读准则¶
- 先任务,后模型名:先说清输入、输出、约束和成功条件,再讨论模型。
- 先主线,后专题:没有表示、时间与评测的共同语言时,直接追前沿专题容易误读结论。
- 先证据,后判断:区分论文结果、官方声明、预印本与个人复现。
- 用产出检查阅读是否完成:能复述不等于能应用;至少留下任务卡、系统 manifest、claim card 或评测协议之一。
- 允许跳读,但要写下跳过的前提:例如未读 tokenizer 细节时,不对“压缩率”或“码率”作强结论。
2. 从一条路线迁移到另一条路线¶
| 已完成 | 下一步想做什么 | 最短迁移 |
|---|---|---|
| A 通识 | 评估产品 | A 的评测导言 → B 的任务卡 |
| B 应用 | 搭建原型 | B 的任务专章 → C 的生成模型路线与开放模型 |
| C 工程 | 提出新方法 | C 的系统 manifest → D 的论文阅读课程与 claim card |
| D 研究 | 做可运行验证 | D 的最小实验 → C 的数据、模型与评测协议 |
| E 世界模型 | 研究或部署闭环系统 | E 的闭环图 → D 的证据设计或 C 的系统实现 |
| F 教学 | 为不同学生分层 | 依据学生背景分别指向 A、C、D 或 E |
阅读路线的终点不是“读完仓库”,而是用仓库中的概念、证据和方法完成一个更清楚、更可验证的下一步工作。