来源:Adam Hunt (@RealAdamHunt) 推文 2026-07-29 主题:反驳 Adam 从 AGI 乐观派转向坚定悲观派的论证 视角:技术架构层(agentic loop / self-reflection / recursive self-improvement)
Adam 的论点其实可以压缩成三层:
第一层(经验观察): o3 之后的模型没有变得更通用,反而变窄了。编码能力 spiking,语言能力倒退。模型在简单逻辑/语言任务上偶尔变笨。
第二层(机制归因):
第三层(预测): 40% 信心——一两年内不会出现"广泛显著且公认的"通用能力提升。可能路径是垂类模型做 RL 再链回通用,但需要资本密度 → 可能是"等不到的承诺"。
Adam 抓对了一个真问题:o3 之后的模型语言风格确实在降级。这不是他一个人的错觉,是社区共识。
但他把"风格降级"当成了"能力降级"——这是致命误读。
公开数据说话:
数据来源:OpenAI GPT-5.2 发布报告 2025-12。
Adam 看到的"模型变笨",其实是另一种东西:模型不再秒回了。它在调用一个长达几分钟到十几分钟的思考过程——自我反思、多轮验证、工具调用——然后才吐出最终答案。
拿一个"思考了 8 分钟"的回答跟"瞬间生成"的回答比"流利度",当然觉得前者笨。但前者可能对了 53%,后者对了 4%。
Adam 看错了指标。
Adam 的框架里有一个大洞:RL 正在被重新设计。
2025 到 2026 年,业界已经意识到"单任务 RL 深耕"的天花板,开始全面转向 agentic RL(智能体强化学习)。
核心差别:
ICML 2026 已经专门开了 Agentic RL workshop。CSDN 的综述给了一组实测数字:自我反思(Self-Reflection)机制把复杂任务完成率提升 40% 以上,幻觉率大幅降低。
主流反思系统分三类:
这不是 Adam 预测的"窄化",这是任务组合空间的指数级扩张——RL 的优化对象从 N 个独立任务,变成 N×M×K 个任务链。
2026 年 6 月 Anthropic 发布了一份让人后背发凉的报告:
这不是 Adam 预测的"垂类模型拼接回通用模型"——这是 AI 开始造 AI。它不再需要人类设计训练目标,它自己设计、自己验证、自己迭代。
Anthropic 自己也在报告里警告:递归自我改进(RSI)可能在未来两年内发生,甚至更早。一家 9000 亿估值的公司主动喊停——这不是危言耸听。
他说"AI 公司押编码是因为编码赚钱"——因果关系反了。
不是 AI 公司主动选编码,是评测基建只在这一块天然成立:
而"语气自然""逻辑连贯""理解潜台词"——没有客观打分函数。直到 ARC-AGI、GDPval、GPQA 这一批通用推理评测在 2024-2025 年陆续成熟。
评测基建到位 → 通用能力才有了 RL 信号 → 算力才开始回流。
所以 2025 年底到 2026 年初的跳涨——不是 AI 突然变聪明了,是因为终于有人能测出来它聪明。
Adam 提了一个值得认真对待的设想:垂类模型做 RL,再链接回通用模型。
他把这当成了"等不到的承诺"。但这件事正在发生:
但路径不是 Adam 想的"手动拼接"——而是 agentic loop。
通用模型不需要"什么都直接做对"——它需要"知道什么时候调用哪个垂类 agent,然后整合答案"。这正是 o3 / GPT-5.2 在做的:把推理时间分配给"思考 + 工具调用 + 自我反思"。
Tomas Pueyo 的 AGI 刺猬图把"所有刺"画成同步向外长——这是错的。
Adam Hunt 的反驳把"刺不同步变长"解读为"AGI 来不了"——这更是错的。
真正的图景是:
Adam 看到的 spike 是真的——但他没看到这些 spike 正在通过 agentic loop 编织成一张网。
如果你是工程师,最近半年大概率吐槽过:
这些吐槽全是真的。
但你可能没注意到的是:当你让这些模型去解 ARC-AGI-2、跑 SWE-Bench Pro、调用 5 个工具链做一个 12 小时的任务——它们在 2025 年底到 2026 年初跳了一个台阶。
你怀念的是流利度,不是正确率。
下次评估一个模型的能力,别看它说话像不像人,看它:
这四个指标比"语气自然"重要一万倍。
Adam,你的语言风格降级观察是对的,RL 窄化担忧也是对的。 但你漏了三件事: 通用推理基准一年涨 13 倍不是"窄化",是评测基建补齐后的回流 RL 正在被重构成 agentic RL,任务组合空间在指数级扩张 Anthropic 自己的报告告诉你 AI 已经能造 AI——这不是"垂类拼接",是 RSI 你预测的"等不到的承诺",可能在你写下那条推文的同时正在发生。
Adam,你的语言风格降级观察是对的,RL 窄化担忧也是对的。
但你漏了三件事:
你预测的"等不到的承诺",可能在你写下那条推文的同时正在发生。
不理解那么早要AGI做什么,为了智械危机?还是股票概念?
Featured Collection
Popular Ranking
Popular Events
当 AGI 悲观派遇上 agentic loop:Adam Hunt 的刺猬图批评到底哪里错了
一、Adam 的核心论点(先复述清楚再反驳)
Adam 的论点其实可以压缩成三层:
第一层(经验观察):
o3 之后的模型没有变得更通用,反而变窄了。编码能力 spiking,语言能力倒退。模型在简单逻辑/语言任务上偶尔变笨。
第二层(机制归因):
第三层(预测):
40% 信心——一两年内不会出现"广泛显著且公认的"通用能力提升。可能路径是垂类模型做 RL 再链回通用,但需要资本密度 → 可能是"等不到的承诺"。
Adam 抓对了一个真问题:o3 之后的模型语言风格确实在降级。这不是他一个人的错觉,是社区共识。
但他把"风格降级"当成了"能力降级"——这是致命误读。
二、为什么 Adam 看错了:通用能力在换维度涨
公开数据说话:
数据来源:OpenAI GPT-5.2 发布报告 2025-12。
Adam 看到的"模型变笨",其实是另一种东西:模型不再秒回了。它在调用一个长达几分钟到十几分钟的思考过程——自我反思、多轮验证、工具调用——然后才吐出最终答案。
拿一个"思考了 8 分钟"的回答跟"瞬间生成"的回答比"流利度",当然觉得前者笨。但前者可能对了 53%,后者对了 4%。
Adam 看错了指标。
三、Adam 的归因错在哪里:他把 RL 窄化当成了终点
Adam 的框架里有一个大洞:RL 正在被重新设计。
2025 到 2026 年,业界已经意识到"单任务 RL 深耕"的天花板,开始全面转向 agentic RL(智能体强化学习)。
核心差别:
ICML 2026 已经专门开了 Agentic RL workshop。CSDN 的综述给了一组实测数字:自我反思(Self-Reflection)机制把复杂任务完成率提升 40% 以上,幻觉率大幅降低。
主流反思系统分三类:
这不是 Adam 预测的"窄化",这是任务组合空间的指数级扩张——RL 的优化对象从 N 个独立任务,变成 N×M×K 个任务链。
四、Anthropic 递归自我改进报告:AI 开始造 AI
2026 年 6 月 Anthropic 发布了一份让人后背发凉的报告:
这不是 Adam 预测的"垂类模型拼接回通用模型"——这是 AI 开始造 AI。它不再需要人类设计训练目标,它自己设计、自己验证、自己迭代。
Anthropic 自己也在报告里警告:递归自我改进(RSI)可能在未来两年内发生,甚至更早。一家 9000 亿估值的公司主动喊停——这不是危言耸听。
五、Adam 漏掉的第二件事:通用评测基建补齐了
他说"AI 公司押编码是因为编码赚钱"——因果关系反了。
不是 AI 公司主动选编码,是评测基建只在这一块天然成立:
而"语气自然""逻辑连贯""理解潜台词"——没有客观打分函数。直到 ARC-AGI、GDPval、GPQA 这一批通用推理评测在 2024-2025 年陆续成熟。
评测基建到位 → 通用能力才有了 RL 信号 → 算力才开始回流。
所以 2025 年底到 2026 年初的跳涨——不是 AI 突然变聪明了,是因为终于有人能测出来它聪明。
六、Adam 的真正洞见:垂类 → 通用,但路径错了
Adam 提了一个值得认真对待的设想:垂类模型做 RL,再链接回通用模型。
他把这当成了"等不到的承诺"。但这件事正在发生:
但路径不是 Adam 想的"手动拼接"——而是 agentic loop。
通用模型不需要"什么都直接做对"——它需要"知道什么时候调用哪个垂类 agent,然后整合答案"。这正是 o3 / GPT-5.2 在做的:把推理时间分配给"思考 + 工具调用 + 自我反思"。
七、刺猬图到底错在哪
Tomas Pueyo 的 AGI 刺猬图把"所有刺"画成同步向外长——这是错的。
Adam Hunt 的反驳把"刺不同步变长"解读为"AGI 来不了"——这更是错的。
真正的图景是:
Adam 看到的 spike 是真的——但他没看到这些 spike 正在通过 agentic loop 编织成一张网。
八、给技术社区的反思:别再用"流利度"当智能指标
如果你是工程师,最近半年大概率吐槽过:
这些吐槽全是真的。
但你可能没注意到的是:当你让这些模型去解 ARC-AGI-2、跑 SWE-Bench Pro、调用 5 个工具链做一个 12 小时的任务——它们在 2025 年底到 2026 年初跳了一个台阶。
你怀念的是流利度,不是正确率。
下次评估一个模型的能力,别看它说话像不像人,看它:
这四个指标比"语气自然"重要一万倍。
九、给 Adam Hunt 的公开信(如果他能看到)
参考来源