跳转至

按读者选择的阅读路径

本页将仓库内容重组为若干条面向不同目标的阅读路线。它们不是难度排名,也不要求按文件顺序读完;每条路线都以一个可检验的产出结束,再按需要横向进入其他路线。

如何使用:先选择最接近你当前任务的读者画像;按照“必读”顺序完成主线;只有遇到明确问题时再读“按需补充”。每读完一篇,记录一个结论、一个证据来源和一个仍未解决的问题。

0. 先选路线

你当前最想解决的问题 推荐路线 建议投入 完成后能做什么
“视频生成到底在做什么,为什么会出错?” A. 通识与教学读者 1–2 小时 解释训练、生成、控制与评测的基本边界
“我想用它创作内容或评估产品能力。” B. 创作者、产品与应用读者 半天 将需求翻译成任务、测试用例与验收标准
“我需要选模型、搭建系统或优化推理。” C. 工程与系统读者 2–4 天 区分系统组件,制定可复现实验与部署账本
“我需要读论文、找问题、做研究。” D. 研究生与研究者 1–2 周 形成可证伪的研究问题与最小实验计划
“我关心物理、交互、机器人或世界模型。” E. 世界模型与具身智能读者 3–5 天 判断生成视频何时能支持状态预测与决策
“我需要把这些内容组织成一次课程或组会。” F. 教师与课程组织者 1–2 天 组合一套由直觉、实践和证据构成的教学单元

如果你的身份跨越多类读者,建议先完成最贴近当下交付物的一条,再把另一条作为交叉路线;例如,做视频应用原型的工程师先走 C,再从 B 补齐任务验收。


A. 通识与教学读者

适合谁:第一次接触视频生成的学习者、希望理解产品工作原理的非技术读者、需要准备概览性讲解的教师。

核心问题:模型怎样从文字、图片或视频得到一段连续画面?“画面好看”与“真的理解、真的可靠”有什么差别?

必读顺序

  1. 零基础入门 —— 先建立“训练”和“生成”是两个阶段的直觉。
  2. 任务地图 —— 用输入、输出与约束区分文生视频、图生视频、编辑、控制与预测。
  3. 应用地图 —— 把技术任务映射到创作、数字人、修复、机器人等场景。
  4. 评测指南 的导言与基础维度 —— 学会把“演示效果”与“可靠能力”分开。

按需补充

  • 想理解“为什么视频比图片难”:回到零基础入门中的时序一致性部分。
  • 想讨论“模型是否理解物理”:读物理一致性
  • 想理解“视频模型是否就是世界模型”:读World Model的定义与边界。

建议产出与下一跳

用不超过 200 字解释一个视频产品的输入、生成过程、输出与一个典型失败模式。完成后:想做内容或评估产品,进入路线 B;想理解实现机制,进入路线 C。


B. 创作者、产品与应用读者

适合谁:内容创作者、产品经理、设计师、解决方案人员,以及需要选择视频生成能力的应用团队。

核心问题:我的任务究竟属于哪一类?需要什么控制信号?怎样设计测试,避免只被单个最佳样例说服?

必读顺序

  1. 任务地图 —— 先把需求表达成“输入 → 输出 → 约束”。
  2. 按你的任务选择一个专章:
  3. 从文字创作: 文生视频
  4. 让图片动起来: 图生视频
  5. 重剪、风格化或修改素材: 视频到视频
  6. 人物口播与角色呈现: 数字人
  7. 更精确的镜头、轨迹、姿态或对象约束: 细粒度可控生成
  8. 修复、补全既有视频: 视频退化修复视频补全
  9. 多视角动态资产: 多视角与 4D
  10. 声画一体生成: 原生音视频
  11. 应用地图 —— 对照真实工作流、成本与风险边界。
  12. 评测指南 —— 为同一需求建立多次生成、失败标签和人工验收协议。

读法提示

  • 先写验收,再选模型:至少写出主体身份、动作、镜头、时长、可接受失败与复生成本。
  • 一次只验证一个变量:例如先验证人物一致性,再验证镜头控制;不要把所有控制项放进一条提示词后归因。
  • 区分“可展示”与“可交付”:一次成功样例不代表跨提示、跨主体、跨时长仍稳定。

建议产出与下一跳

完成一页任务卡:目标用户 / 输入资产 / 期望输出 / 必须保持的约束 / 失败标签 / 验收样例。需要把任务落为系统时进入路线 C;希望追溯论文与方法依据时进入路线 D。


C. 工程与系统读者

适合谁:算法工程师、平台工程师、需要选型、复现、部署或优化推理的视频生成开发者。

核心问题:系统由哪些正交组件构成?速度、显存、质量和控制能力应该怎样同时记账?

必读顺序

  1. 生成模型路线 —— 建立 representation / factorization / objective / backbone / deployment 的分层框架。
  2. 视频 Tokenizer 与生成式压缩 —— 明确 latent、token、量化、时空预算与真实码率的边界。
  3. Video DiT 与骨干扩展 —— 从 token 数量、注意力拓扑、条件融合与并行策略理解瓶颈。
  4. 视频后训练与对齐 —— 区分 SFT、偏好优化、强化学习、guidance 与少步蒸馏。
  5. 因果与流式生成 —— 如果目标是低首帧延迟、连续生成或中途修改条件。
  6. 开放模型数据集评测指南 —— 将方法选择落到可运行工件和实验协议。

按需分支

系统问题 优先阅读
长视频、上下文与记忆 视频预测 · 因果与流式生成
少步、高吞吐与部署成本 Flow / consistency · 视频后训练与对齐
控制接口与多条件融合 细粒度可控生成 · 视频基础模型
声画联合时序 原生音视频
数据退化与恢复 视频退化修复

建议产出与下一跳

建立一张系统 manifest:输入条件、表示、生成目标、骨干、采样 NFE、解码与后处理、硬件、端到端时延、质量指标、失败场景。若指标没有明确计时边界,就不要比较“加速倍数”。准备提出新方法或复现实验时进入路线 D。


D. 研究生与研究者

适合谁:需要建立文献框架、确定研究问题、撰写论文或设计可验证实验的研究人员。

核心问题:一个研究主张究竟改变了哪一层?它依赖什么证据?怎样构造会推翻自己结论的实验?

必读顺序

  1. 技术时间线 —— 先理解不同路线如何并行演化,而不是把新模型简单看成替代旧模型。
  2. 论文阅读课程 的“先修诊断、共同主干与怎样选主修分支” —— 建立术语、证据等级与阅读问题。
  3. 生成模型路线评测指南 —— 将论文放进统一技术轴,并建立证据判断习惯。
  4. 选定一条主修分支和一条交叉分支
  5. 表示与压缩: 视频 Tokenizer
  6. 随机未来与不确定性: 变分随机视频生成
  7. 架构与效率: Video DiT
  8. 实时与流式: 因果与流式生成
  9. 控制、4D、个性化、修复、音视频或世界模型:按任务地图进入对应专题
  10. 引用与代码索引 —— 回到一手论文、官方代码、数据和基线。

研究阅读规则

每篇关键论文至少回答:

  1. 它建模的是 RGB、latent、token、state 还是 action?
  2. 它改变的是表示、分解、目标、骨干、条件、执行还是评测?
  3. 训练时能看到、部署时看不到的信息是什么?
  4. 结论来自正式论文、预印本、官方发布,还是你自己的复现?
  5. 哪个反事实实验会让该结论不成立?

建议产出与下一跳

输出一张 claim card:问题 / 方法改变的层 / 对比对象 / 证据等级 / 失败条件 / 最小复现实验。如果研究涉及物理、动作或决策,请继续路线 E;如果需要实现原型与量化性能,请回到路线 C。


E. 世界模型与具身智能读者

适合谁:关注物理一致性、动作条件预测、交互环境、机器人或把视频模型用于规划与决策的读者。

核心问题:一个会生成连贯视频的模型,何时才可以被称为可用的世界模型?动作、状态、反事实和闭环如何检验?

必读顺序

  1. 零基础入门 中“视频模型就是 world model 吗?” —— 先避免概念混淆。
  2. World Model —— 明确 observation、state、action、reward、open-loop rollout 与 closed-loop control。
  3. Video Reasoning —— 分清视频理解、时序推理与生成预测。
  4. 物理一致性 —— 从视觉合理性进入可干预、可测量的物理主张。
  5. 动作条件预测交互式世界生成 —— 检查动作接口、状态延续和反馈闭环。
  6. 评测指南 —— 将演示视频替换为 action-conditioned、counterfactual、closed-loop 的证据协议。

读法提示

  • 先区分相机控制环境动作:镜头轨迹不等于可作用于世界状态的 action。
  • 先区分单条连贯轨迹可查询状态:可沿一条路径生成,不代表能在任意时刻、任意视角保持一致。
  • 优先寻找反事实:同一初始状态下改变动作、外力或物体属性,结果是否按机制改变?

建议产出与下一跳

画出一个最小闭环:observation → state estimate → action → predicted next state/video → environment feedback → evaluation,并标出每个箭头可观测的指标。需要端到端系统实现时补路线 C;要形成论文问题时补路线 D。


F. 教师与课程组织者

适合谁:准备本科导论、研究生专题课、组会读书会或跨学科分享的教师与课程组织者。

核心问题:怎样让不同基础的学习者既建立直觉,又不把宣传性演示误当作研究结论?

推荐的三段式教学顺序

  1. 建立问题意识(第 1 次)零基础入门任务地图应用地图。 课堂任务:让学习者为一个产品案例写出输入、输出、约束和可能失败。
  2. 理解技术坐标(第 2–3 次)生成模型路线视频基础模型技术时间线。 课堂任务:让学习者把一篇模型论文拆到表示、目标、骨干、条件和部署层。
  3. 建立证据意识(第 4 次及以后)评测指南论文阅读课程 → 任选一个任务专题。 课堂任务:为一项能力声明设计多次生成、对照、失败标签与反事实测试。

分层布置建议

学习者基础 主线 推荐作业
无技术背景 A 路线 解释一个生成案例及其局限
有编程基础 C 路线前四篇 编写系统 manifest 或复现实验账本
研究生 D 路线 提交 claim card 与最小反证实验
具身/机器人方向 E 路线 设计 action-conditioned 闭环评测

建议产出与下一跳

每次教学都保留一个共同的“能力主张—证据—边界”表格。课程结束时,学生应能回答:系统声称会什么、证据是否足够、以及下一项实验如何推翻或支持该主张。


1. 跨路线的通用阅读准则

  1. 先任务,后模型名:先说清输入、输出、约束和成功条件,再讨论模型。
  2. 先主线,后专题:没有表示、时间与评测的共同语言时,直接追前沿专题容易误读结论。
  3. 先证据,后判断:区分论文结果、官方声明、预印本与个人复现。
  4. 用产出检查阅读是否完成:能复述不等于能应用;至少留下任务卡、系统 manifest、claim card 或评测协议之一。
  5. 允许跳读,但要写下跳过的前提:例如未读 tokenizer 细节时,不对“压缩率”或“码率”作强结论。

2. 从一条路线迁移到另一条路线

已完成 下一步想做什么 最短迁移
A 通识 评估产品 A 的评测导言 → B 的任务卡
B 应用 搭建原型 B 的任务专章 → C 的生成模型路线与开放模型
C 工程 提出新方法 C 的系统 manifest → D 的论文阅读课程与 claim card
D 研究 做可运行验证 D 的最小实验 → C 的数据、模型与评测协议
E 世界模型 研究或部署闭环系统 E 的闭环图 → D 的证据设计或 C 的系统实现
F 教学 为不同学生分层 依据学生背景分别指向 A、C、D 或 E

阅读路线的终点不是“读完仓库”,而是用仓库中的概念、证据和方法完成一个更清楚、更可验证的下一步工作。