[Technical exchange] 当 AGI 悲观派遇上 agentic loop
Tofloor
poster avatar
sshnuke
deepin
8 hours ago
Author

mmexport1785295248870.jpg

当 AGI 悲观派遇上 agentic loop:Adam Hunt 的刺猬图批评到底哪里错了

来源:Adam Hunt (@RealAdamHunt) 推文 2026-07-29
主题:反驳 Adam 从 AGI 乐观派转向坚定悲观派的论证
视角:技术架构层(agentic loop / self-reflection / recursive self-improvement)


一、Adam 的核心论点(先复述清楚再反驳)

Adam 的论点其实可以压缩成三层:

第一层(经验观察)
o3 之后的模型没有变得更通用,反而变窄了。编码能力 spiking,语言能力倒退。模型在简单逻辑/语言任务上偶尔变笨。

第二层(机制归因)

  • RL 只能在单一任务上无限深耕,不能跨任务传递
  • LLM 表面"通用"靠的是通用语料库覆盖(所有书、所有维基)
  • 真正的突破是 CoT + 联网搜索,2024 后的进步本质上是这俩
  • AI 公司发现编码好用又赚钱 → 全力优化编码 → 编码尖峰↑、通用语言↓

第三层(预测)
40% 信心——一两年内不会出现"广泛显著且公认的"通用能力提升。可能路径是垂类模型做 RL 再链回通用,但需要资本密度 → 可能是"等不到的承诺"。

Adam 抓对了一个真问题:o3 之后的模型语言风格确实在降级。这不是他一个人的错觉,是社区共识。

但他把"风格降级"当成了"能力降级"——这是致命误读


二、为什么 Adam 看错了:通用能力在换维度涨

公开数据说话:

通用推理基准 2024 年底 2025 年底 → 2026 年初 涨幅
ARC-AGI-2 o3 / o1 pro 不到 4% GPT-5.1 thinking 17.6% → GPT-5.2 Pro52.9% 13 倍
GDPval(44 职业 vs 人类专家) GPT-5.2 Thinking 胜率70.9% 首次超越
GPQA Diamond(研究生级科学问答) GPT-5.2 ~93% 顶尖
SWE-Bench Pro GPT-5.2 55.6% SOTA
工具调用可靠性 GPT-5.298.7% 接近确定

数据来源:OpenAI GPT-5.2 发布报告 2025-12。

Adam 看到的"模型变笨",其实是另一种东西:模型不再秒回了。它在调用一个长达几分钟到十几分钟的思考过程——自我反思、多轮验证、工具调用——然后才吐出最终答案。

拿一个"思考了 8 分钟"的回答跟"瞬间生成"的回答比"流利度",当然觉得前者笨。但前者可能对了 53%,后者对了 4%。

Adam 看错了指标。


三、Adam 的归因错在哪里:他把 RL 窄化当成了终点

Adam 的框架里有一个大洞:RL 正在被重新设计

2025 到 2026 年,业界已经意识到"单任务 RL 深耕"的天花板,开始全面转向 agentic RL(智能体强化学习)

核心差别:

  • 单任务 RL:在同一个 benchmark 上死磕 → Adam 说的"窄化"
  • agentic RL:在任务链上训练——规划、调用工具、反思、修订、再调用工具,整个循环作为一个完整轨迹打分

ICML 2026 已经专门开了 Agentic RL workshop。CSDN 的综述给了一组实测数字:自我反思(Self-Reflection)机制把复杂任务完成率提升 40% 以上,幻觉率大幅降低

主流反思系统分三类:

  1. 基础 Reflection Agent:生成器 + 反思器循环,编辑类任务效果不错
  2. Reflexion Agent:结构化反思,在可追踪日志中记录历史行为/假设/反思
  3. Agentic RL:反思 + 工具调用 + 长程记忆,作为完整轨迹训练

这不是 Adam 预测的"窄化",这是任务组合空间的指数级扩张——RL 的优化对象从 N 个独立任务,变成 N×M×K 个任务链。


四、Anthropic 递归自我改进报告:AI 开始造 AI

2026 年 6 月 Anthropic 发布了一份让人后背发凉的报告:

  • 截至 2026 年 5 月,Anthropic 代码库超过 80% 的合并代码由 Claude 编写
  • 工程师人均日合并代码量是 2024 年的 8 倍
  • Claude Mythos Preview 在训练优化任务上,比人类研究员最高性能提升 52 倍
  • Claude Opus 4.6 已经能稳定处理 12 小时级别的连续任务
  • AI 可靠完成任务的时长约每 4 个月翻倍
  • Anthropic 联合创始人 Jack Clark 估计:2028 年前实现递归自我改进的概率 60%

这不是 Adam 预测的"垂类模型拼接回通用模型"——这是 AI 开始造 AI。它不再需要人类设计训练目标,它自己设计、自己验证、自己迭代。

Anthropic 自己也在报告里警告:递归自我改进(RSI)可能在未来两年内发生,甚至更早。一家 9000 亿估值的公司主动喊停——这不是危言耸听。


五、Adam 漏掉的第二件事:通用评测基建补齐了

他说"AI 公司押编码是因为编码赚钱"——因果关系反了。

不是 AI 公司主动选编码,是评测基建只在这一块天然成立

  • 编码有可验证信号:测试通过/失败,编译器返回 0/1
  • 编码有即时反馈:运行 3 秒就知道对错
  • 编码有海量训练数据:GitHub 公开仓库

而"语气自然""逻辑连贯""理解潜台词"——没有客观打分函数。直到 ARC-AGI、GDPval、GPQA 这一批通用推理评测在 2024-2025 年陆续成熟。

评测基建到位 → 通用能力才有了 RL 信号 → 算力才开始回流。

所以 2025 年底到 2026 年初的跳涨——不是 AI 突然变聪明了,是因为终于有人能测出来它聪明


六、Adam 的真正洞见:垂类 → 通用,但路径错了

Adam 提了一个值得认真对待的设想:垂类模型做 RL,再链接回通用模型

他把这当成了"等不到的承诺"。但这件事正在发生

  • 编程领域:Cursor / Devin / Cline——专攻编码的 agent 已经开始反过来训练通用模型的能力
  • 研究领域:Sakana AI 的 AI Scientist、DeepMind 的 AlphaProof——垂类突破后能力回流到通用底座
  • 医疗领域:Hippocratic AI、Atropos Health——医疗 agent 在垂直评测上超人类后开始跨领域迁移

但路径不是 Adam 想的"手动拼接"——而是 agentic loop

通用模型不需要"什么都直接做对"——它需要"知道什么时候调用哪个垂类 agent,然后整合答案"。这正是 o3 / GPT-5.2 在做的:把推理时间分配给"思考 + 工具调用 + 自我反思"。


七、刺猬图到底错在哪

Tomas Pueyo 的 AGI 刺猬图把"所有刺"画成同步向外长——这是错的。

Adam Hunt 的反驳把"刺不同步变长"解读为"AGI 来不了"——这更是错的。

真正的图景是

  • 某些刺在 2025-2026 年长得飞快(推理、工具调用、抽象问题)
  • 某些刺长得慢(语言风格、闲聊流畅度)
  • 所有的刺都在通过 agentic loop 连成一个有机体

Adam 看到的 spike 是真的——但他没看到这些 spike 正在通过 agentic loop 编织成一张网


八、给技术社区的反思:别再用"流利度"当智能指标

如果你是工程师,最近半年大概率吐槽过:

  • GPT-5.x "说话不像 GPT-4 那样顺了"
  • Claude 4 "开会体",emoji 多得像实习生
  • o3 "想得太久"显得笨

这些吐槽全是真的

但你可能没注意到的是:当你让这些模型去解 ARC-AGI-2、跑 SWE-Bench Pro、调用 5 个工具链做一个 12 小时的任务——它们在 2025 年底到 2026 年初跳了一个台阶

你怀念的是流利度,不是正确率。

下次评估一个模型的能力,别看它说话像不像人,看它:

  1. 能不能稳定调用 5+ 工具链完成 12 小时任务
  2. 在 ARC-AGI 这种"对人类来说相对容易但需要抽象推理"的基准上能拿多少分
  3. 自我反思时能不能识别自己的幻觉
  4. 长期任务里能不能保持目标一致不漂移

这四个指标比"语气自然"重要一万倍。


九、给 Adam Hunt 的公开信(如果他能看到)

Adam,你的语言风格降级观察是对的,RL 窄化担忧也是对的。

但你漏了三件事:

  1. 通用推理基准一年涨 13 倍不是"窄化",是评测基建补齐后的回流
  2. RL 正在被重构成 agentic RL,任务组合空间在指数级扩张
  3. Anthropic 自己的报告告诉你 AI 已经能造 AI——这不是"垂类拼接",是 RSI

你预测的"等不到的承诺",可能在你写下那条推文的同时正在发生。


参考来源

  • Adam Hunt (@RealAdamHunt) 原推(2026-07-29):o3 之后模型窄化、刺猬图批评、40% 信心预测
  • OpenAI GPT-5.2 发布报告(2025-12):ARC-AGI-2 17.6% → 52.9%、GDPval 70.9% 胜率、SWE-Bench Pro 55.6%、工具调用 98.7%
  • ARC Prize 公开排行榜(2026-05):GPT-5.5、Claude Opus 4.7 在 ARC-AGI-3 加起来不到 1 分 vs 人类 100 分——通用推理天花板远未到顶
  • ICML 2026 Agentic RL Workshop(2026-06):任务链强化学习作为新训练范式
  • Anthropic 递归自我改进报告(2026-06):Claude 写 80% 合并代码、52 倍训练加速、Jack Clark 估 2028 前 RSI 概率 60%
  • 自我反思机制综述(CSDN 2026-07):Self-Reflection 提升复杂任务完成率 40%+,大幅降低幻觉

Reply Favorite View the author
All Replies
avatar
神末shenmo
deepin
Spark-App
Q&A Team
7 hours ago
#1

不理解那么早要AGI做什么,为了智械危机?还是股票概念?

Reply View the author