速览
AI 摘要
文字稿 · 5257 段
名词表 · 15
模型越大,数学反而越差——张祥雨:问题出在 next-token prediction 优化的是压缩率,不是算对;它天生爱跳步,长链一步错就全错。
149分钟
17个章节
10条金句
15个名词
5257段对话
核心要点
🧩
CV 为何缺 GPT 时刻
对比学习、MIM 学到的只是人工设计的「不变性」,不是 learn from data,没有 scaling 特性——一放大就失效。
🖼️
生成≠理解≠对齐
语言里三者天然合一;静态图像来自大自然、不含人类理解,三件事隔裂,所以生成与理解极难统一。
📉
越大数学越差的怪现象
1B→70B 系统实验:对话/情商/知识越大越强,但数学等推理先升后降——一个尚未被充分讨论的非共识。
🎯
next-token 的本质缺陷
它优化压缩率而非算对。大模型爱「一口爆」跳步,单步 90% 对,但长链一步错则全错。
🔁
O 系列=注入反思
核心不是 RL 算法而是「思维链的 pattern」。反思把被预训练过度压缩的动作空间补回来,本质是 meta-CoT。
🌐
泛化来自预训语料
RL 不能无中生有;O 的反思 pattern 本就稀疏散布在语料里,交错相连,才能融会贯通、强泛化。
🧠
别迷信 long context
Transformer 只有「太长的短期记忆」、没有压缩压力,反是智能倒退。该学人类分层记忆 + 思维链「翻书」。
🚀
未来两年两个 GPT-4 时刻
多模态推理(把 CoT 带进视觉空间,约一年内)与自主/在线学习(两到三年、甚至两年内)。
话题脉络 点哪跳哪 ↡
出场名词
人物李广密
人物张祥雨
概念ResNet(残差网络)
概念model scaling / data scaling
概念对比学习 / MIM
产品step1 / step2
概念Diffusion
产品O 系列(O1/O3/O4)
概念next-token prediction
概念Rule-based RL
概念meta-CoT / 反思
概念long context
概念Forward-Forward(Hinton)
概念自主/在线学习
概念世界模型(李飞飞 / LeCun)