English: OUTLINE.en.md
复刻 Stanford CS329A(AI Agents,Autumn 2025)。按课程讲座号组织,跳过中期展示(L10-L12)。
Part 总数:4 Notebook 总数:17
-
- 从 LLM 应用到 Agent
-
- Agent 的定义与组成
-
- 一条 Agent 循环
-
- Agent 生态地图
-
- 课程路线
- 小结
- 作业
-
- 训练完成后的算力:test-time compute
-
- 重复采样:Large Language Monkeys
-
- 从采样到投票:self-consistency 与 best-of-n
-
- Compute-optimal 缩放:Snell 定律
-
- 方法组合与架构搜索:Archon
- 小结
- 作业
- 参考资料
-
- 生成与验证的差距
-
- 验证器的训练:Cobbe 的数学验证器
-
- 结果验证器(ORM)与过程验证器(PRM)
-
- Step-by-step 验证:Lightman
-
- 无人工标注的步级验证:Math-Shepherd
-
- 验证器与采样结合
- 小结
- 作业
- 参考资料
-
- 从推理到行动:ReAct 循环
-
- 工具的定义与调用
-
- 代码执行作为反馈信号
-
- RLEF:用执行反馈做强化学习
-
- Constitutional AI:用 AI 反馈对齐 AI
- 小结
- 作业
- 参考资料
-
- 单步推理的局限
-
- 任务分解:ADaPT
-
- 树搜索:LATS
-
- 并行规划与执行:SPRINT
-
- 自适应分支:Wider or Deeper
- 小结
- 作业
- 参考资料
-
- 训练期 vs 测试期缩放
-
- STaR:用推理自举推理
-
- DeepSeekMath 与 GRPO
-
- DAPO:开源大模型 RL 系统
-
- 从强化到 Agent 训练
- 小结
- 作业
- 参考资料
-
- 让 Agent 自己设计 Agent:ADAS
-
- 自动化的科学发现:AI Scientist
-
- 代码作为 Agent 基因组:AlphaEvolve
-
- 开放进化的失败模式与风险
- 小结
- 作业
- 参考资料
-
- 程序合成中的搜索:AlphaCode
-
- AlphaCode 2:从采样到过滤
-
- 智能体搜索增强推理:Search-o1
-
- 深度研究的工作流
- 小结
- 作业
- 参考资料
-
- 后训练是什么
-
- SFT 与 RLHF:Chatbot 时代
-
- Agent 化后训练:工具、执行、反馈
-
- 演进路线图
- 小结
- 作业
- 参考资料
-
- 代码任务中的 test-time compute:CodeMonkeys
-
- 让 LLM 写高效内核:KernelBench
-
- Agent-System 接口设计
-
- SWE-Agent 循环的构建
- 小结
- 作业
- 参考资料
-
- 记忆为什么重要
-
- MemGPT:LLM 作为操作系统
-
- Cartridges:长上下文表示的自学习
-
- CacheBlend:RAG 的 KV 缓存复用
-
- 记忆系统的工程实践
- 小结
- 作业
- 参考资料
-
- 评测 Agent 的难点
-
- 长程任务评测:Measuring Long Tasks
-
- 真实经济价值任务:GDPVal
-
- 深度研究评测:DeepScholar-Bench
-
- 构建自己的评测 Harness
- 小结
- 作业
- 参考资料
-
- 推理能力从哪来
-
- Chain-of-Thought 与自洽性
-
- 推理的涌现
-
- 推理模型的发展
- 小结
- 作业
- 参考资料
-
- 数学:推理的试金石
-
- AlphaGeometry:几何的神经-符号结合
-
- AlphaProof:形式化证明的 RL
-
- IMO 金牌:Gemini 的路线
- 小结
- 作业
- 参考资料
-
- 从演示到自治
-
- 可靠性:错误检测与恢复
-
- 监督与信任边界
-
- 开放问题
- 小结
- 作业
- 参考资料
-
- 具身智能与 VLA
-
- 视觉-语言-动作模型
-
- 机器人数据的收集
-
- 从物理世界学习的反馈
- 小结
- 作业
- 参考资料
-
- 当前系统的边界
-
- 开放问题清单
-
- 可能的研究路线
-
- 如何参与
- 小结
- 作业
- 参考资料
课程按学习顺序连续编号为 L1–L17。Notebook 文件名、研读笔记目录和在线阅读器使用相同编号。