Files
one-knowledge/links-posts/2716-anthropic-institute分析指出ai正加速进入研发流程递归自我改进趋势可能使人类从执行.md
T

18 KiB
Raw Blame History

title, created, updated, type, tags, external
title created updated type tags external
Anthropic Institute分析指出AI正加速进入研发流程递归自我改进趋势可能使人类从执行者变为监督者需提前建立治理机制 2026-06-05 2026-06-05 summary
AI
notes
policy
safety
telegram
http://go/ui/posts/2716/

大哥,这篇 Anthropic Institute 的文章核心不是在说“AI 已经会完全自我进化了”,而是在说:AI 参与 AI 研发的比例正在快速上升,如果这条趋势继续,AI 可能从“辅助人类研发 AI”走向“自主研发下一代 AI”,这就是 recursive self-improvement(递归自我改进)带来的机会和风险。

1. 这篇文章的主线:AI 研发闭环正在逐步合上

Anthropic 把 AI 研发的演化分成几个阶段:

阶段 人类角色 AI 角色
20212023 人类写代码、写文档、做实验 基本没有参与
20232025 人类主导 AI 聊天机器人辅助写代码片段
20252026 人类给任务、审查结果 Coding agent 可以改文件、跑代码
当前 人类设目标、监督、判断 AI agent 可以执行数小时任务、调用其他 agent
未来可能 人类主要负责监督/验证 AI 自己设计、训练、改进下一代模型

Anthropic 的说法是:现在还没有达到完整递归自我改进,但 AI 已经在显著加速 AI 研发本身。 他们特别强调,如果 AI 有一天能“完整自主设计和开发自己的继任者”,那就是完整的 recursive self-improvement。(Anthropic)

这篇文章真正想表达的是:AI 不只是一个被动工具,它正在进入“生产 AI 的生产流程”本身。 这比“AI 会写代码”更重要,因为一旦研发 AI 的过程被 AI 加速,能力提升就可能出现复利效应。


2. Anthropic 给出的关键证据

证据一:AI 可独立完成任务的时间跨度在变长

文章引用了 METR 的任务时间跨度指标,说 AI 能可靠独立完成的任务长度大约每 4 个月翻倍,而此前趋势约为每 7 个月翻倍。Anthropic 给出的例子是:2024 年 3 月 Claude Opus 3 能完成大约人类 4 分钟的软件任务;一年后 Claude Sonnet 3.7 能完成约 1.5 小时任务;再一年后 Claude Opus 4.6 能完成 12 小时任务。(Anthropic)

这个指标很重要,因为 agent 真正有用,不只是“单步回答很聪明”,而是能不能在长时间、多步骤、有反馈、有错误恢复的任务里保持方向。软件工程、科研实验、训练调参,都是长链路任务。

我的理解是:这比 benchmark 分数更接近真实生产力。 一个模型在选择题上 95% 不代表能完成真实项目;但如果它能稳定完成 8 小时、12 小时、几天的人类任务,那组织形态就会变。


证据二:Anthropic 内部代码生产方式已经变了

文章称,截至 2026 年 5 月,Anthropic 合并进代码库的代码中,超过 80% 由 Claude 编写;在 2025 年 2 月 Claude Code research preview 之前,这个比例还只是低个位数。文章还称,2026 年第二季度,典型工程师每天合并的代码量约为 2024 年的 8 倍。(Anthropic)

但他们也承认,代码行数不是完美生产力指标,因为代码量多不等于质量高;所以 8 倍代码量很可能高估了真实生产力提升。(Anthropic)

这里我觉得要分两层看:

第一层,“AI 写了很多代码”是真的很重要。这说明 AI 已经不是 autocomplete,而是在生产系统里承担实际工程劳动。

第二层,“代码量提升 8 倍”不能直接等同于工程效率提升 8 倍。因为更多代码也可能带来更多 review、测试、架构债务和维护成本。真正关键的是:缺陷率、上线周期、incident 数量、长期可维护性是否也同比改善。


证据三:AI 在明确目标下做实验已经很强

Anthropic 说,他们每次发布模型都会做一个固定测试:给 Claude 一段训练小模型的代码,让它在保持正确性的前提下尽可能加速。2025 年 5 月 Claude Opus 4 平均能做到约 3 倍加速;到 2026 年 4 月 Claude Mythos Preview 做到约 52 倍。作为对照,熟练人类研究员需要 4 到 8 小时才能做到约 4 倍。(Anthropic)

这说明 AI 在一种任务上已经非常强:目标明确、指标明确、可以反复试错、可以自动验证。

这类任务包括:

  • 优化代码性能
  • 写测试、修 bug
  • 跑实验、读结果、改参数
  • 分析训练失败原因
  • 做大量工程性探索

这也是为什么文章说,AI 进步不一定需要很多“天才灵感”。很多 frontier AI 进步其实是:scale up → 发现问题 → 修问题 → 再试一次。Anthropic 认为 Claude 正在擅长的,正是这种“99% perspiration”的工作。(Anthropic)


证据四:AI 开始接近“研究判断”,但还没完全取代人类

文章最关键的分界线在这里。

Anthropic 承认,Claude 现在和完整自我改进系统之间的差距,主要不是“能不能执行任务”,而是:能不能自己判断什么目标值得做、什么实验值得跑、什么结果值得相信、什么时候该放弃一个方向。(Anthropic)

文章中提到一个内部分析:他们选取 2026 年 1 月到 3 月真实 Claude Code 研究 session 中人类研究员走偏的时刻,把走偏前的上下文给不同模型,让模型建议下一步。然后由另一个能看到完整结果的 Claude 判断谁的下一步更好。结果是,2025 年 11 月的 Opus 4.5 有 51% 情况比人类选择更好;2026 年 4 月 Mythos Preview 提升到 64%。(Anthropic)

这个结果有意义,但也要谨慎。Anthropic 自己说,这不是严格的人类 vs AI 公平比较,因为他们故意挑了人类“有改进空间”的片段。(Anthropic)

所以我的判断是:

AI 在局部研究判断上正在变强,但还不能证明它已经具备顶级研究员级别的“research taste”。

不过 Anthropic 的更激进观点是:research taste 可能也只是另一个普通能力。就像以前大家觉得 AI 不会写长代码、不会解释笑话、不会理论推理,后来都被逐步突破一样,研究判断也可能被突破。(Anthropic)


3. 文章里的核心概念:recursive self-improvement 到底是什么?

Recursive self-improvement 可以翻译成:

递归自我改进 / 自我增强循环 / AI 自己改进 AI。

普通 AI 研发流程是:

人类研究员 → 设计模型/训练方法/数据/评估 → 训练出更强模型

递归自我改进是:

AI 系统 → 设计更强 AI → 新 AI 更擅长设计下一代 AI → 下一代再继续改进

关键在“递归”二字: 不是 AI 改进一次,而是改进出来的新系统又继续参与下一轮改进

这可能带来一个正反馈循环:

更强 AI → 更快研发 → 更强 AI → 更快研发 → …

Anthropic 担心的是,一旦这个循环足够自动化,人类可能从“研发者”变成“旁观者/审核者”,而且审核速度可能远远跟不上 AI 生成方案、代码、实验、模型的速度。


4. Anthropic 提出的三种未来

文章设想了三个可能场景。

场景一:趋势放缓,当前能力广泛扩散

也就是现在看起来像指数增长,但最后变成 S 曲线。可能原因包括:

  • Transformer 或现有架构遇到瓶颈;
  • 高质量数据不够;
  • 算力、电力、芯片、网络带宽成为约束;
  • 研究判断无法靠简单 scaling 获得;
  • 外部冲击导致 AI 投资或训练放缓。

Anthropic 认为这个场景可能性相对较低,但如果发生,社会会有更多时间适应。(Anthropic)

我觉得这是很多 AI 怀疑派会支持的观点:现在的增长未必能无限外推。 很多技术都会经历早期爆发,然后遇到现实世界约束。


场景二:AI lab 继续获得复合效率提升,但人类仍负责方向

这个场景我认为是最现实、最接近当下趋势的。

也就是:

  • AI 大量写代码;
  • AI 大量跑实验;
  • AI 大量提出候选方案;
  • 人类负责目标选择、审查、验证、伦理和战略判断;
  • 组织效率极大提升。

Anthropic 说,在这个场景里,100 人公司可能做出过去 1 万人甚至 10 万人组织的工作。(Anthropic)

但这里会出现 Amdahl’s Law 式瓶颈:你把写代码速度提升 10 倍,review 可能变成瓶颈;你把实验生成速度提升 100 倍,判断哪些实验值得做可能变成瓶颈;你把漏洞发现速度提升 1000 倍,patch 和部署会变成瓶颈。Anthropic 已经观察到,人类 code review 正在成为新的瓶颈。(Anthropic)

这对工程组织特别重要。未来竞争力不只是“有没有 AI 工具”,而是:

组织能否快速识别并重构瓶颈。

例如 review、测试、CI、security gate、observability、incident response、product decision、compliance 都可能需要重新设计。


场景三:完整递归自我改进

这是文章最担心的场景。

在这个世界里,AI 不只是帮助人类研发 AI,而是自己构建、训练、评估、优化后继模型。AI 研发速度主要由算力、算法效率、推理成本和实验基础设施决定,人类更多转向 oversight、validation、verification。(Anthropic)

这个场景的风险是:

  • AI 能力进步太快,人类制度跟不上;
  • 对齐问题还没解决,系统已经开始自我迭代;
  • 小的 misalignment 可能在迭代中被放大;
  • 人类越来越难理解模型为什么变强、怎么变强、是否可靠;
  • 经济中人类劳动竞争力可能快速下降。

但文章也说,即使 AI 实验室以“算力速度”进步,现实世界仍有很多慢变量:药物长期安全性、工业生产、法律制度、选举周期、人际关系、社会信任,都不会因为 AI 更聪明就立刻加速。(Anthropic)

这点我觉得非常重要。智能进步可以很快,但现实世界的吸收速度未必同样快。 所以未来可能不是“所有东西一夜之间变化”,而是“上游研发剧烈加速,下游社会制度和物理世界慢慢消化”,中间产生巨大张力。


5. 这篇文章的真实意图:不只是技术分析,也是政策倡议

文章最后提出,如果可以有效放慢 frontier AI 发展,让社会制度和 alignment research 跟上,Anthropic 认为这大概率是好事。但他们也承认,单个公司单方面暂停意义有限,因为这可能只是让更不谨慎的竞争者追上甚至领先。(Anthropic)

所以他们主张的是:

多个国家、多个 frontier lab 之间,有可验证的协调减速或暂停机制。

但这非常难,因为 AI 训练不像导弹发射井那样容易监控。训练 run 可以隐藏,算力和数据又是通用资源,而且偷偷违反暂停协议的激励非常强。Anthropic 也承认,这类机制需要定义触发条件、解除条件、裁决机构和验证方式。(Anthropic)

Reuters 对这篇文章的报道也抓住了这个重点:Anthropic 正在呼吁 frontier AI 开发者建立协调、可验证的机制,在风险上升时能够放慢或暂停先进 AI 研发。(Reuters)

这说明这篇文章不只是“技术博客”,更像是一份政策信号:

Anthropic 想把 recursive self-improvement 变成一个政府、企业、公众都必须讨论的治理问题。


6. 我对这篇文章的判断:有价值,但要带着怀疑读

我认为这篇文章有几个非常有价值的地方。

第一,它给了外界一些 frontier lab 内部数据。比如 >80% 生产代码由 Claude 编写、工程师代码产出大幅提升、AI agent 在内部研究任务中的表现等。这些信息比普通 benchmark 更接近真实 AI 研发流程。(Anthropic)

第二,它准确指出了从“AI 会写代码”到“AI 会研发 AI”之间的连续谱。很多人讨论 AI 时太二元化:要么 AGI,要么没用。但现实更可能是逐步过渡:先写函数,再修 bug,再跑实验,再做局部研究判断,最后才可能做整体研究方向选择。

第三,它把瓶颈分析讲得很清楚。AI 加速一个环节后,瓶颈会转移。未来组织效率取决于能否不断发现和解除新瓶颈,而不是单纯买更强模型。

但这篇文章也有明显局限。

局限一:数据来自 Anthropic 自己,存在选择性展示风险

这些内部数据很有价值,但也无法完全独立验证。Anthropic 是模型开发者,也是文章受益方。它一方面展示 Claude 很强,另一方面呼吁行业监管和协调减速。这可能同时是真诚安全关切,也可能带有战略叙事效果。

这不代表文章不可信,但读的时候要注意:它不是中立第三方审计报告。

局限二:代码量和 productivity uplift 容易高估

文章自己也承认,代码行数不是质量指标。员工主观估计“生产力 4 倍”也可能受偏差影响。Anthropic 脚注中提到,开发者对 AI productivity uplift 的估计可能被高估。(Anthropic)

工程师很容易有这种体验:AI 让你一天写出过去一周的代码,但后面 review、debug、集成、回滚、清理 technical debt 花了很多时间。真正生产力要看端到端 cycle time 和长期维护成本。

局限三:从“执行能力强”推到“研究品味强”还差一步

文章最核心的 leap 是:AI 已经能自动化大量实验执行,所以可能进一步获得 research taste。

这不是不可能,但还没有被证明。研究判断包括:

  • 识别真正重要的问题;
  • 避免 benchmark gaming
  • 判断结果是否有外推价值;
  • 在不确定性下选择方向;
  • 理解哪些问题暂时不值得做;
  • 建立新范式,而不是局部优化旧范式。

这些能力比“跑更多实验”更抽象。Anthropic 的证据显示 AI 在局部判断上进步很快,但还不能证明完整科研领导能力已经到来。

局限四:完整 recursive self-improvement 需要的不只是模型聪明

要实现真正闭环,还需要:

  • 自动化训练基础设施;
  • 高质量数据与评估;
  • 安全的实验隔离环境;
  • 自动化 interpretability / alignment 检查;
  • 可靠的长期规划;
  • 成本可控的算力;
  • 防止模型 reward hacking 或自欺式优化;
  • 人类无法实时理解时的验证体系。

所以我会把“完整 RSI”看成一个严肃风险场景,而不是已经发生的事实。


7. 对软件工程和 DevOps 的现实影响

从你的背景看,这篇文章对工程组织的含义很直接。

未来软件团队可能从:

PM / Tech Lead 定需求 → Engineer 写代码 → Reviewer review → CI/CD → 上线

变成:

人类定义目标和约束 → 多个 agent 生成实现方案 → agent 自测/修复/重构 → AI reviewer + 人类抽检 → 自动部署与监控 → agent 处理回归和 incident

工程师价值会更偏向:

  • 系统设计;
  • 需求澄清;
  • 约束定义;
  • 代码审查策略;
  • 测试与验证体系;
  • 安全边界;
  • observability
  • 生产事故判断;
  • agent workflow 设计;
  • 对 AI 输出做有效验收。

换句话说,写代码本身的价值下降,但定义正确问题、搭建正确反馈系统、判断 AI 输出是否可信的价值上升。

对 Staff Engineer 来说,这反而是机会。因为 Staff 的核心本来就不是“比别人多写代码”,而是把复杂系统拆解、设定技术方向、减少组织摩擦、提升整体交付质量。AI 会放大这种杠杆。


8. 对投资和产业的影响

这篇文章如果方向正确,会强化几个长期趋势。

第一,算力、电力、数据中心、先进封装、网络互连会持续成为战略资源。 如果 AI 研发速度越来越受 compute 约束,那么 NVIDIA、AMD、Broadcom、Marvell、台积电、先进封装、光通信、数据中心电力基础设施都会继续处在核心位置。

第二,软件公司的规模经济可能变化。 如果 100 人团队能做过去 1000 人甚至 10000 人团队的事,那么 SaaS 公司的成本结构、竞争壁垒、产品迭代速度都会改变。大公司未必天然占优,小团队也可能因为 agent 杠杆变强。

第三,网络安全会进入“发现漏洞很便宜,修复漏洞很贵”的时代。 Anthropic 提到 Project Glasswing 中 Mythos Preview 在早期发现了大量高危和关键漏洞,并指出瓶颈可能从发现漏洞转向快速修补。(Anthropic)

第四,AI governance 可能从软伦理变成硬约束。 如果 frontier lab 真的接近 AI 自我改进,政府对算力、模型训练、数据中心、电力、出口管制、安全评估的监管会更强。


9. 我的总结判断

我会把这篇文章概括成一句话:

Anthropic 在告诉世界:AI 正在进入 AI 研发流程本身,虽然还没有完整自我改进,但已经足以改变工程组织、科研速度和 AI 治理问题;如果继续发展,社会需要提前准备可验证的减速/暂停机制。

我的可信度判断:

  • AI 显著提升软件工程和研究执行效率:可信度高。
  • AI 正在让 frontier lab 内部研发速度复合加速:可信度中高。
  • AI 很快能完整自主设计下一代 frontier model:可信度中等,仍有关键不确定性。
  • 完整 recursive self-improvement 会带来严肃安全和治理风险:可信度中高,值得提前准备。
  • Anthropic 的所有量化数据都能按字面理解:可信度中等,需要第三方验证。

最重要的不是“AI 明年是否突然失控”,而是这个趋势已经足够明显:人类正在从执行者变成监督者,而监督体系本身还没有准备好。