速览
AI 摘要
文字稿 · 3261 段
名词表 · 15
AGI 不是某级台阶,是一座可能没有尽头的雪山——杨植麟:问题不可避免,但问题总可以被解决,我希望这座山一直没有尽头。
101分钟
22个章节
10条金句
15个名词
3261段对话
核心要点
🏔️
无限的雪山
借《The Beginning of Infinity》:问题不可避免、但总能解决;AGI 是持续攀登的方向,不是一夜抵达的台阶。
🧠
两种 test-time scaling
强思考推理 RL 是「缸中之脑」纯思考;Agentic RL 靠多轮交互调用工具——都在 scale 推理时的 token。
🔁
反思=猜想+验证
推理模型不断提出新猜想并自我验证,等价于试了好几次,把 pass@k 变成 pass@1。
⚙️
Muon 换掉 Adam
K2 用矩阵正交化的 Muon 优化器,token efficiency 约 2 倍——30T 数据当 60T 用,loss 降得更快。
🎯
Agent 最大瓶颈是泛化
RL 易过拟合到单点 benchmark;分数涨≠泛化好。不能 overfit 到某些工具/环境/任务。
🤖
用 AI 训练 AI(L4 做 L3)
让模型参与模型开发、做对齐研究,用 innovation 层的能力去解 agent 的泛化——L4 解 L3。
📦
模型即产品
训模型时已要把工具/context 全搭好,模型训完产品就基本成型;一方产品的垂直整合上限更高。
🧑💼
用 RL/SFT 管团队
以 RL(给目标)为主、少量 SFT(防跑偏);SFT 太多扼杀创造力,RL 又易被 reward hacking。
话题脉络 点哪跳哪 ↡
出场名词
其他《The Beginning of Infinity》
人物杨植麟
产品Kimi K2
概念缸中之脑
概念Agentic RL
概念test-time scaling
概念L1–L5 分级
公司Anthropic / Claude
产品K1.5
概念token efficiency
概念Muon 优化器
概念数据改写(rephrase)
概念MuonClip / MaxLogit 爆炸
概念用 AI 训练 AI / L4 做 L3
概念reward hacking