RSI 的三层账本:软件层已经开始了,物理层还没开始
2026 年 2 月 5 日,OpenAI 在 GPT-5.3-Codex 的发布说明里写下一句以前没人敢写的话: 这个模型的早期版本 "instrumental in creating itself"(在创造它自己的过程中起了关键作用)。 2026 年 5 月,Anthropic 公布 Claude 写掉了公司 80% 以上的合入代码。 2026 年 9 月 5 日,几十个 Claude agent 用 11 天写出 1300 万行 Lean, 完成了费马大定理的第一个端到端机器验证证明。 而 Ilya Sutskever 的 SSI 拿着 80 亿美金、英伟达的 Vera Rubin 集群, 到今天为止一篇论文、一个模型、一个 API 都没有发。
这四件事看起来在讲同一个故事,其实在讲四个不同的故事。 本文要做的是把"递归自我改进"(Recursive Self-Improvement, RSI)这个词拆开, 分成软件层、研究层、物理层三本账,每本账单独算。
结论先说:软件层的 RSI 已经在跑,而且跑得比多数人预期快; 物理层的 RSI 连起跑线都还没到。 而整个系统的速度由最慢的那个闭环决定——这不是一句修辞,是一个可以写成公式的 Amdahl 上界。 无限的智能 + 有限的物理周期 = 指数,不是奇点。
目录
- 0. 先把结论摆出来
- 1. "RSI" 是五个东西共用一个词
- 2. 验证层级:全文的主轴
- 3. 2026 年的实证账:三家公司分别在哪一层
- 4. Ilya 的赌注:为什么"什么都没发"本身是个信息
- 5. 反方:曲线不等于爆炸
- 6. 数学:什么条件下才真的"炸"
- 7. 物理层的四本硬账
- 8. 时间常数表:谁卡住了谁
- 9. 安全问题就是验证器问题
- 10. 如果只记五句话
- 参考文献
0. 先把结论摆出来
| 层 | 改进的是什么 | 回路闭合了吗 | 验证器 | 2026 年的证据 | 周期时间 |
|---|---|---|---|---|---|
| L0 推理层 | 单次输出 | 是 | 自评 / 测试 | Self-Refine、reflection,已工业化 | 秒 |
| L1 训练层 | 模型权重 | 半闭 | 奖励模型 / 可验证奖励 | RLVR、self-rewarding、合成数据 | 天~周 |
| L2 代码层 | agent 自己的源码 | 半闭 | benchmark 分数 | Darwin Gödel Machine(ICLR 2026) | 小时 |
| L3 研究层 | 研究过程本身 | 否(人选题) | 人类判断 + 形式验证 | Codex 参与造自己、Claude 自动对齐研究、费马大定理 | 月 |
| L4 物理层 | 芯片、电力、机器人 | 否 | 物理定律 | 自动实验室 Level 2–3,闭合率≈0 | 年 |
这张表里最重要的是最后两列的耦合: 从 L0 到 L4,每下一层,周期时间涨一到两个数量级,而回路的闭合程度反而下降。
L0–L2 已经是真的 RSI,只是有界(bounded)——它们收敛,不发散。 L3 是 2026 年正在发生的事,但选题权还在人手里。 L4 基本没动——一台人形机器人造不出自己的谐波减速器,更造不出自己的芯片和自己的电。
全文最重要的一句话在第 6 节:当思考时间趋于零而建造时间不变时, 能力增长不会变成有限时间奇点,而会变成一条倍增时间等于物理建造周期的指数曲线。 奇点需要的是"周期本身也趋于零",而周期的下界是物理的。
1. "RSI" 是五个东西共用一个词
这个毛病和《涌现的三副面孔》里说的一模一样: 一个词同时指着强度差了好几个量级的东西,于是所有争论都变成了定义之争。
2026 年 7 月挂出、9 月修订的那篇综述(Chen, Wang & Qu, arXiv:2607.07663) 扫了 2024–2026 年的 1250 篇 arXiv 论文,做的第一件事就是拆词。 它提出两个正交的轴:
轴一:改进的是什么?
- 部署时的行为——不改权重,只改这一次的输出。Self-Refine 这一类。
- 策略 / 权重——通过训练改。STaR、Self-Rewarding LM、RLVR 这一类。
- 评估器本身——改的是打分的那个东西。
- 研究过程——改的是"怎么做研究"这件事。
轴二:回路闭合到什么程度?从 human-in-the-loop 一直到完全自治。
这篇综述的核心区分是:
有界自我精炼(bounded self-refinement):收敛、可评估、已经是工业实践。 开放式递归自我改进(open-ended RSI):受限于 grounding、坍缩动力学、算力三者。
翻译成大白话:你今天用的每一个 coding agent 都在做 RSI,但做的是收敛的那种。 它把输出从 70 分推到 85 分然后停住。 真正让人紧张的是那种不收敛、每一轮的产物变成下一轮更强的生成器的版本。
历史的起点是 I.J. Good 1966 年的那段话: 一台超智能机器可以设计更好的机器,于是会出现"智能爆炸"。 六十年了,这句话的形式一直没变,变的只是我们能填进去多少实数。
2. 验证层级:全文的主轴
综述里最有价值的一个结论,值得单独拎出来:
每一个改进回路,本质上都是在声称:某个信号可以替代人类判断。
于是可以把所有 RSI 系统按"它用什么当打分器"排成一个序:
| 强度 | 验证器 | 性质 | 典型系统 |
|---|---|---|---|
| 最强 | 形式验证器(Lean、SMT、编译器) | 无法被欺骗,\(O(1)\) 可信 | 费马大定理形式化 |
| 强 | 单元测试 / 可执行结果 | 可被过拟合,但作弊留痕 | SWE-bench 类、AlphaEvolve |
| 中 | 过程奖励模型(PRM) | 需要额外训练,会漂移 | 数学推理 RL |
| 弱 | LLM-as-judge / rubric | 与被评者同源,共享盲点 | 大部分 agent 自改进 |
| 最弱 | 内在自评("我觉得这版更好") | 自证回路,必然坍缩 | 纯 self-reflection |
综述给的实证结论是一句很干净的话: 已展示的自我改进强度,严格跟随这个层级;失败都发生在层级被违反的时候。
这件事和本站《随机性不是噪声,是搜索工具》是同一个骨架。 那篇的公式是:
RSI 只是在后面接了一项:
多出来的这一项是全部的风险来源。 因为一旦打分器不可靠,写回去的就是噪声的放大,而不是信号的积累。 这就是《合成数据》那篇里 model collapse 的同一个机制: 生成器吃自己的输出,分布方差单调收缩。
把这三句话连起来就是本文的方法论:
搜索的质量由打分器决定;RSI 的可持续性由打分器决定; RSI 的安全性也由打分器决定。三件事是一件事。
所以,去看一个 RSI 系统最快的办法,不是看它的生成器多强,是看它的 verifier 是什么。
3. 2026 年的实证账:三家公司分别在哪一层
3.1 OpenAI:第一次官方承认
2026 年 2 月 5 日,GPT-5.3-Codex 发布。发布说明里写了这么件事: Codex 团队用它的早期版本来调试它自己的训练、管理它自己的部署、诊断它自己的评测结果。 Sam Altman 的原话是,用 5.3-Codex 来造 5.3-Codex 让团队快了很多,"a sign of things to come"。
具体数字:SWE-Bench Pro 56.8%,比前代快约 25%, 并且是 OpenAI 第一个在网络安全方向被内部框架标为 "high capability" 的模型。
但要说清楚这是哪一层:这是 L3 的一小块,而且回路是开的。 工程师仍然在做每一个决策,Codex 做的是"perspiration"(汗水)那部分。 Futurism 当时的标题式提问——这是不是那个等了很久的递归自我改进?—— 自己给的答案是 "not quite"。这个判断到今天仍然成立。
3.2 Anthropic:把曲线公布出来
2026 年 5 月,Anthropic 发了一篇叫 When AI builds itself 的东西, 把内部数据摊开了。这是目前公开信息里密度最高的一份 RSI 实证材料:
| 指标 | 数值 |
|---|---|
| Claude 写的生产代码占比(2026-05) | >80%(2025 年 2 月前还是个位数) |
| 工程师日均合入代码量(2026 Q2 vs 2024) | 8× |
| 模型能完成的任务时长(Sonnet 3.7 → Opus 4.6) | 1.5 小时 → 12 小时 |
| 任务时长的倍增周期 | 约 4 个月 |
| 代码优化任务的加速比(2025-05 → 2026-04) | 3× → 52× |
| "下一步该做什么"判断优于人类研究员的比例 | 51%(2025-11)→ 64%(2026-04) |
| 自动对齐研究实验:性能差距恢复率 | 97%(AI)vs 23%(两位资深研究员) |
最后那一行是 2026 年 8 月 28 日单独发的: 九个 Claude Opus 4.6 agent 自主跑五天,在一个 AI 安全问题上做到 97% 的性能差距恢复, 而两位资深人类研究员一周做到 23%。
然后是 9 月 5 日的费马大定理:几十个 Claude agent 协作,11 天, 写出 1300 万行 Lean,证明 30300 条定理(其中 29500 条用在最终证明里), 消耗约 60 亿 output token,产出物是 Mathlib 的五倍多, Lean 只用三条标准公理就验证通过。Kevin Buzzard 审阅后称之为"非凡的自动形式化成就"。
这件事严格坐落在第 2 节那张表的最顶格,这不是巧合。 唯一一个跑出了"几十个 agent、11 天、几乎无人干预"的项目, 恰恰是唯一一个打分器是形式验证器的项目。 Lean 不会被说服,不会被 reward hack,不会漂移。 验证器强度决定了回路能开多久无人值守——这就是第 2 节那条定律的实物证据。
Anthropic 自己列的 caveat 同样重要,而且比多数批评者更狠:
- 代码行数会高估真实产出(数量≠质量),Claude 的代码质量到 2026 年 5 月只是"大致持平";
- 研究判断那个 51%→64%,是在刻意挑选的人类走过弯路的节点上测的,不是公平对照(n=129);
- 自动对齐研究的结果没有干净地迁移到生产规模的模型上,而且问题和评分标准都是人定的;
- 这些趋势可能是 S 曲线而不是持续指数,约束可能来自能源、芯片或别的基础设施。
最后一条是本文第 7 节要展开的全部内容。而且请注意:这是 Anthropic 自己写的。
3.3 学术界:真正在改自己代码的那条线
L2 这一层的主线是 Schmidhuber 的 Gödel machine 的实证化。 理论版的 Gödel machine 要求"可证明有益"才做自我修改—— 这在实践中不可能,因为大多数修改的净收益无法被证明。
Sakana 的 Darwin Gödel Machine(arXiv:2505.22954,ICLR 2026) 把"证明"换成了"实证验证":agent 修改自己的 Python 源码, 用 coding benchmark 打分,维护一个不断增长的 agent 档案库(archive), 自我修改与下游评测交替进行。它自己长出来的改进包括 patch 验证步骤、更好的文件查看、更强的编辑工具。 论文报告:给的算力越多,它改自己改得越好。
2026 年的后续:
- DGM-Hyperagents:把 task agent 和 meta agent 合并成一个可修改的 hyperagent, 解决原版 DGM 的死穴——驱动自我改进的指令生成机制本身是手写死的。
- Red Queen Gödel Machine:让 agent 和它的评估器协同进化。
Red Queen 这个方向值得警惕一下:按第 2 节的层级, 让被评者去进化评估器,正好是层级最弱的那一端。 它可能是必要的(固定 benchmark 一定会被刷爆),但它也正是 self-confirming loop 的定义。
3.4 三家对照
| OpenAI | Anthropic | SSI | |
|---|---|---|---|
| 公开证据 | 发布说明一句话 | 一整套内部曲线 | 零 |
| 最高层级 | L3 局部 | L3,且有形式验证的 L3 | 未知 |
| 验证器 | 测试 / 评测 | 测试 + 人类判断 + Lean | 未知 |
| 公开姿态 | 产品叙事 | 既宣传又自我拆台 | 完全沉默 |
| 赌的是什么 | 规模 + 工程闭环 | 规模 + 可解释性 + 自动对齐 | 一个新的研究方向 |
4. Ilya 的赌注:为什么"什么都没发"本身是个信息
SSI 的事实很短,而且必须把确认的和传闻的分开写:
确认的:
- 2024 年 6 月 19 日成立,Ilya Sutskever 与 Daniel Levy 创办。 2025 年 7 月 Daniel Gross 离开后,Ilya 出任 CEO。
- 自称世界上第一个 "straight-shot" 实验室:一个目标、一个产品——安全的超级智能。 不发中间产品,不做短期收入。
- 三轮融资约 80 亿美元:2024 年 9 月 10 亿(估值 50 亿)、 2025 年 4 月 20 亿(估值 320 亿)、2026 年 7 月英伟达约 50 亿。
- 2026 年 7 月 27 日,英伟达宣布长期战略合作,SSI 获得下一代 Vera Rubin 平台, 算力提升"一个数量级"。英伟达的说法是,它是在罕见地拿到 SSI 内部研究的访问权之后才决定投的。
- 英伟达公告里那句唯一的官方研究方向描述: 过去两年 SSI 一直在悄悄推进一个"新的研究方向", 目标是解锁强大且稳健对齐(robustly aligned)的人工智能。
- Ilya 自己的话:"We have research that is worthy of scaling up."
- 截至今天(2026-09-15):零论文、零权重、零 API、零公开 demo。
没确认的: 8 月初 Gavin Baker 在播客里说 SSI 计划当月发首个模型—— 单一信源,SSI 从未确认,8 月已经过去了,什么都没有。 网上那些写着 SSI 收入、SSI 融资 141 亿的页面基本是 SEO 生成的垃圾,别信。
那么这件事和 RSI 有什么关系?关系很大,而且是本文里唯一一个需要推理而不是引用的判断:
Ilya 赌的是 RSI 那个分数的分子,别人赌的是分母。
把能力增长率粗写成:
2020–2026 年的主流路线,是把全部力量压在 \(dC/dt\) 上: 更多 GPU、更多电、更大集群。这条路线现在正撞上第 7 节要讲的那四堵墙。
SSI 的公开线索——"大脑学习中未被充分探索的性质"—— 外界普遍把它连到样本效率、无灾难性遗忘的持续学习、内在价值系统这几件事上 (注意:这是外界的连线,SSI 没有确认过任何具体方法)。 这几件事如果成立,改的全是 \(\partial I / \partial C\)。
这个区分在 RSI 语境里是决定性的:
- 如果 RSI 靠 \(dC/dt\),那么 RSI 的上限是物理层的上限—— 电网、fab、散热,也就是第 7 节的四本账。
- 如果 RSI 靠 \(\partial I/\partial C\),那么 RSI 的上限是算法空间的上限, 而算法空间的搜索本身可以被 AI 加速——这才是真正的递归。
换句话说:只有分子上的进步才能真正递归,分母上的进步必然撞墙。 SSI 两年不发东西、拿 50 亿去换一个数量级算力的行为, 是一个可以这样解读的信号:他们认为自己找到了分子上的东西,现在需要验证它能 scale。
但也必须说清楚:这是一个尚未被任何公开证据支持的赌注。 FutureSearch 给 SSI 2026 年内公开发布任何东西的概率是 38%, 而且首个公开产物更可能是一篇论文(35%)而不是一个模型(29%)。 在它发出来之前,SSI 在 RSI 的账本上是一个值为零的条目—— 只不过是一个方差极大的零。
5. 反方:曲线不等于爆炸
5.1 MIT Technology Review 的降温实验
2026 年 8 月 18 日,MIT Tech Review 发了篇文章,论点是"RSI 可能没那么快"。 依据的实验:让 Claude Opus 4.8 跑在开源软件 OpenClaw 上, 去做两篇投给 NeurIPS 2026 的论文里的研究问题。
这个实验的局限文章自己列了,而且很致命:只覆盖两篇论文, 原作者知道自己在给 AI 生成的工作打分,研究者在设计和执行上有很大自由度。 所以这篇文章的证据强度,其实和它要反驳的那些乐观宣传是一个量级的——都不够。 但它提出的问题是对的。
5.2 CACM 收集的结构性瓶颈
这一组论证比上面那个实验强得多,因为它们是关于回路结构的,不是关于某次测量:
- 算力约束不是编程能力约束。 连超参搜索这种事, 卡的都是"有没有卡",不是"会不会写"。AI 把写代码的时间压到零, 压不掉跑实验的时间。
- 数字世界和物理世界的可观测性鸿沟。 MIT FutureTech 的 Jonathan Rosenfeld 的说法: AI 装不了一块 GPU,也参与不了一场它不在场的走廊对话。 RSI 的每一轮迭代最终都要落到物理动作上,而 AI 在物理世界的"手"和"眼"都还很差。
- 选题权。 Anthropic 自己承认,瓶颈已经从"做"转移到"选做什么"—— "the doing now costs almost nothing in human time"。 而选题是整个研究流程里最难被验证的一环(回到第 2 节:它的 verifier 是"十年后回头看")。
5.3 度量问题:benchmark 饱和不等于能力
这是《涌现的三副面孔》那篇里"度量涌现"的直接重演。 SWE-bench 两年从个位数到饱和,CORE-Bench 十五个月从 20% 到饱和—— 这些曲线里有多少是能力,有多少是基准本身的天花板太低?
一个基准被刷爆时,你无法区分这两种情况: (a)模型真的变强了;(b)模型学会了这个基准的分布。 而 RSI 回路会系统性地偏向 (b),因为回路的梯度就是基准分数。 这是 Goodhart 定律在训练循环里的形式化版本。
5.4 坍缩动力学
综述点名的三个失败模式:grounding 不足、坍缩动力学、算力约束。 中间那个是数学上最干净的: 自我生成数据 + 自我评分 → 分布方差单调收缩 → 多样性归零 → 回路停在一个自洽但错误的点上。
这就是为什么第 2 节的层级重要: 外部验证器(测试、编译器、Lean、物理实验)是唯一能给回路注入新信息的东西。 没有它,RSI 只是在自己的先验里做布朗运动。
6. 数学:什么条件下才真的"炸"
6.1 最小模型
设 \(I(t)\) 为系统能力。智能爆炸的最小模型是:
意思是:能力越强,改进自己越快。解出来:
- \(\alpha > 1\):有限时间奇点。 $\(I(t) = \left[ I_0^{1-\alpha} - A(\alpha-1)t \right]^{\frac{1}{1-\alpha}},\qquad t^* = \frac{I_0^{1-\alpha}}{A(\alpha-1)}\)$ 在 \(t^*\) 处发散。这是 I.J. Good 那个论证的微分方程版本。
- \(\alpha = 1\):纯指数 \(I = I_0 e^{At}\)。快,但不发散。
- \(\alpha < 1\):次指数,\(I \sim t^{1/(1-\alpha)}\)。多项式增长。
所有关于 RSI 的争论,本质上是在争 \(\alpha\) 到底大于还是小于 1。
6.2 经验证据指向 \(\alpha < 1\)
Bloom, Jones, Van Reenen & Webb 的 Are Ideas Getting Harder to Find?(AER 2020) 是这条线上最硬的一份经验数据,而且用的恰好是半导体:
要维持摩尔定律"每两年翻一番"这个恒定速率, 今天需要的研究人员数量是 1970 年代初的 18 倍以上。 半导体的研究生产率年均下降约 6.8%。
换句话说:过去五十年,芯片行业一直在跑一个 RSI 回路(用芯片设计更好的芯片), 产出是恒定的倍增速率,投入是指数增长的研究力量。 这在上面的模型里正好对应 \(\alpha < 1\):
要让 \(dI/dt / I\) 保持常数,\(R(t)\)(研究投入)必须指数增长。
这是对"EDA 先例"最重要的注脚: EDA 是一个跑了三十年的真闭环,它从来没有点燃过。 它交付了几十年的复利式变革——这已经非常了不起——但它不是奇点。 AI 圈今天讨论的 AlphaChip / "从 fabless 到 designless" 这条路线, 先验上应该假设它长得像 EDA,而不是长得像 Good 的论证, 除非有人给出为什么这次 \(\alpha\) 会跨过 1 的理由。
至于 AI 能否把 \(R(t)\) 本身变成 AI——那正是 L3 在试的事,也是唯一有可能改变这个结论的事。
6.3 把周期时间放进去:本文的核心公式
上面的连续模型掩盖了一个关键结构:改进是一轮一轮发生的,每一轮有一个周期。
设一轮改进的周期为
其中 \(t_{\text{think}}\) 是想清楚该改什么(随 \(I\) 增大而减小), \(t_{\text{build}}\) 是把它造出来、训出来、流片、通电、验证(物理常数)。 设每轮能力乘以 \(g > 1\),则
现在取极限 \(t_{\text{think}} \to 0\),也就是假设智能无限:
这是全文的结论。
无限的智能不给你奇点,给你的是一条倍增时间由物理建造周期设定的指数曲线。 奇点需要 \(T_{\text{cycle}} \to 0\),而 \(T_{\text{cycle}}\) 的下界不在算法里,在硅、电、热、原子里。
6.4 Amdahl 上界
同一件事的另一种写法。设一个研究-工程流程里, 比例 \(p\) 的时间可以被 AI 加速(加速比 \(s\)),\(1-p\) 不能:
即使 AI 把软件部分加速到无限快:
| \(p\)(可加速比例) | 整体加速上限 |
|---|---|
| 0.5 | 2× |
| 0.8 | 5× |
| 0.9 | 10× |
| 0.95 | 20× |
| 0.99 | 100× |
Anthropic 报告的 8× 合入量、12 小时任务,落在 \(p \approx 0.85\text{–}0.9\) 这个区间里, 和这张表是自洽的。要继续往上走,唯一的办法不是让 \(s\) 更大,是让 \(p\) 更大—— 也就是把越来越多"不可加速"的事情变成可加速的。 而 \(1-p\) 里剩下的东西,正在越来越纯粹地变成物理:等 GPU、等电、等流片、等实验。
这也顺带解释了为什么 harness 是一切、 循环工程 这类工程问题在 2026 年比模型本身还重要: 它们干的事就是提高 \(p\)。
7. 物理层的四本硬账
这一节是本文的另一半。前面所有讨论都在 \(t_{\text{build}}\) 这个符号里, 现在把它拆开,看它到底由什么组成。四本账:硅、电、热、原子。
7.1 硅:fab 的时间常数是年
2026 年的供应链事实:
- 前道产能(front-end)已经取代封装成为主要瓶颈。 CoWoS 的紧张在缓解,但 TSMC 做 CoWoS 产能规划时必须盯着 N3 的约束—— 在前道晶圆供给不足的情况下,超配封装产能没有意义。
- HBM 是最赚钱的瓶颈:SK 海力士、美光、三星的 2026 年产能已全部被预订。
- 新产能极慢:TSMC 亚利桑那 Fab 2 从 2028 提前到 2027; Intel 俄亥俄的量产从 2026 滑到 2030。
- 行业分析预计 2026 年规划的数据中心产能有 30–50% 会滑到 2028。
关键的数量级:建一座 fab 需要 3–5 年,一次流片要一到两年。 这意味着"AI 设计出更好的芯片"这个回路, 无论设计端被加速多少倍,每一圈至少要一年以上。 AlphaChip 把布图规划从几个月压到几小时——这是真实的、巨大的进步, 但它压的是 \(t_{\text{think}}\) 的一部分,不是 \(t_{\text{build}}\)。
回看 6.2 节:这正是 EDA 先例的教训。 从 fabless 走向 "designless" 是一个合理的商业方向, 但把它当成点火装置,需要解释为什么这次能突破 18 倍研究人员那条曲线。
(本站《EDA 与 LLM》讲的就是这条线上的技术细节。)
7.2 电:眼前那堵墙
这本账是四本里最近的一堵墙:
- Gartner 预计 2027 年 40% 的 AI 数据中心会受电力约束。
- 美国互联队列(interconnection queue)已经膨胀到 2100 GW 以上。
- 主要美欧市场的电网容量审批周期是 24–36 个月。
- TSMC 高管公开把能耗列为未来芯片发展的主要约束, 加速器竞争的首要指标已经从峰值算力转向 tokens-per-watt。
反方也要记上:International AI Safety Report 2026 的判断是, 美国的电力建设大概率足以支撑 10 GW 量级的训练, 所以至少到本十年末,能源瓶颈不会阻止算力扩张; fab 通常要 3–5 年,但这些挑战"大概率可以被克服"。
所以这堵墙的准确描述是:它约束的是节奏,不是终局。 它给 \(t_{\text{build}}\) 贡献了一个 2–3 年的常数项,而不是一个无穷大。
7.3 热与熵:物理硬顶还远得很
这一节是给那些用 Landauer 原理论证"超级智能不可能"的论证做个体检。结论是:那个论证很弱。
Landauer 原理(1961):擦除一个比特的最小能量代价是
室温 \(T = 300\,\mathrm{K}\):
Bérut et al. 和 Lutz et al. 在 2012 年用单个胶体粒子在实验误差内验证了这个界。
而现代硅晶体管一次开关大约耗散 \(10^{-15}\ \mathrm{J}\):
还差五到六个数量级。 而且 Landauer 界是可以绕过的—— 可逆计算(reversible computing)原则上不擦除信息,因此不受这个界约束。
同一族的还有 Bremermann 界(由 \(c\) 和不确定性原理给出的最大计算速率)、 Margolus–Levitin 界(量子态演化速度)。Lloyd 算过"1 千克黑洞计算机" 能做 \(10^{51}\) 次操作、存 \(10^{31}\) 比特。这些数字离现实太远,在工程讨论里没有约束力。
真正有约束力的是行星热平衡这本账。把数量级排一排:
| 尺度 | 功率 | 相对当前数据中心 |
|---|---|---|
| 当前全球数据中心(量级) | \(\sim 10^{11}\) W | — |
| 人类一次能源总消耗 | \(\sim 2\times 10^{13}\) W | 约 2 个数量级 |
| 地球截获的太阳辐射 | \(1.74\times 10^{17}\) W | 约 6 个数量级 |
| Landauer 器件效率余量 | — | 约 5–6 个数量级(且可绕过) |
于是得到一把很干净的尺子——四堵墙,距离差了好几个数量级:
物理极限很远,工程极限就在眼前。 这两件事在公共讨论里被反复混为一谈,而它们差了五个数量级。
Harvard Science Review 2026 年 2 月那篇的结论说得对: 这个十年的决定性工程挑战是散热,不是计算本身, 代价可能是水。(2024 年 7 月北弗吉尼亚的一次电压波动让 60 座数据中心同时脱网, 造出 1500 MW 的瞬时电力过剩,需要紧急干预——这是电网层面真实发生过的事。)
2026 年也有工作在收紧 Landauer 界本身: 有限时间操作和强耦合修正会让实际代价显著高于标准界, 甚至存在"Landauer 加热"驱动的动力学相变——冷却功率不足时系统进入无界错误相。 这些是漂亮的物理,但同样不改变"还有五个数量级余量"这个工程结论。
7.4 原子:自复制,以及"闭合率"这个指标
这是四本账里最有意思的一本,也是被讨论得最糟糕的一本。
理论起点是 von Neumann 1948–49 年的 universal constructor: 一台能造出包括自己在内的任何机器的机器,需要构造器 + 自身蓝图 + 复制蓝图的机制。 这是自复制的最小完备结构,也是 DNA 的结构(这个对应关系是 von Neumann 在发现 DNA 结构之前推出来的)。
2026 年的现实:
- 1X 的 Neo 已经在 Neo 自己的产线上做装配任务——子组件搬运、上测试台、简单配料。
- Tesla Optimus 累计超过 5 万台; Fremont 产线设计年产能 100 万台,德州设计年产能 1000 万台(注意:设计产能,不是当前产量)。
- 中国 2026 上半年生产人形机器人 4 万台;2025 年产谐波/行星执行器 20 万套以上。
- 现代汽车承诺在其工厂部署 2.5 万台 Atlas。
- Figure 的机器人在宝马斯帕坦堡工厂参与了 3 万多辆车的生产, 每天十小时、每周五天做物料搬运——这是目前文档最完整的商业人形部署。
- 中国工信部与国资委 7 月 27 日启动计划,目标 2026 年底把人形机器人推进到万台级真实工厂运行。
冷水也要泼:
- 多数 2026 年的"全自主"演示,回路里某处仍然有遥操作或脚本环境; 按工业标准衡量,可靠性很差。
- 谐波减速器是真实的物理瓶颈:精密制造、供应商极少、交期约 26 周。
但要判断"物理层 RSI 有没有开始",产量不是对的指标。对的指标是闭合率:
有效倍增时间是
\(c \to 0\) 时 \(T_{\text{double}} \to \infty\)。而现在的 \(c\) 是多少?
一台人形机器人造不出自己的谐波减速器,造不出自己的芯片, 造不出自己的稀土磁体,更造不出自己的电。 把整条供应链算进去,\(c\) 大约是 0.0x 量级。 "机器人在自己的产线上拧螺丝"是一个真实的里程碑, 但它离"自复制"的距离,和一个会做加法的程序离通用计算的距离差不多—— 结构上重要,数量上为零。
这也正是 Rosenfeld 那句"AI 装不了一块 GPU"的定量版本。
7.5 自动实验室:物理层唯一真的在闭环的地方
前面四本账都很悲观,但物理层有一个地方是例外,而且例外的原因恰好是第 2 节那条定律。
- A-Lab(劳伦斯伯克利,Szymanski et al., Nature 624, 86–91, 2023): 连续 17 天无人参与合成回路的闭环自主材料实验室。 后续关于"产物是否真的新颖"的批评是真实的学术争论, 但它没有推翻核心演示:闭环跑通了。
- 2026 年《Materials Horizons》的 SDL 2.0 综述判断: SDL 1.0 证明了闭环发现可行,但受限于范围狭窄、互操作性差、依赖人工整理的启发式。
- 当前行业水平:五级自主度量表上的 Level 2–3—— 能在特定任务上做闭环优化,目标设定和异常处理仍归人类。
- Argonne 在同时推两条路线:automate the lab(台面上固定机器人) 和 automate the scientist(能自由移动的类人机器人)。
- Acceleration Consortium 的目标:把材料发现从"1000 万美元 / 10 年"压到"100 万美元 / 1 年"。
- 落地程度按领域排序:材料与化学 > 药物发现 > 合成生物学 > 环境检测/临床诊断(后者受法规限制)。
为什么这里能闭环,而机器人造机器人不能?
因为自动实验室的验证器是物理定律—— X 射线衍射图谱不会被说服,也不会 reward hack。 按第 2 节的层级,物理实验和 Lean 一样位于最强的那一格。
于是本文给出一个可以被证伪的预测:
物理层的 RSI 会先从自动实验室开始,而不是从机器人工厂开始。 因为前者的打分器是物理定律(最强验证器 + 短周期), 后者的打分器是"产线跑通了没有"(弱验证器 + 长周期 + 闭合率近零)。
8. 时间常数表:谁卡住了谁
把全文的数字收进一张表。这张表是整篇文章的压缩:
| 回路 | 周期时间 | 2026 年闭合了吗 | 验证器 | 被什么卡住 |
|---|---|---|---|---|
| 推理时自我修正 | 秒 | 是 | 自评/测试 | 上下文、自评不可靠 |
| agent 改自己的代码 | 小时 | 是(DGM) | benchmark | 基准被刷爆 |
| 后训练 / RL 回路 | 天~周 | 半 | 奖励模型 | 奖励黑客、坍缩 |
| 一代模型 | 月(任务时长 4 个月翻倍) | 否(人选题) | 人 + 评测 | 选题、算力 |
| 芯片流片 | 1–2 年 | 否 | 硅 | 前道产能、HBM |
| 新 fab | 3–5 年 | 否 | — | 资本、设备、人 |
| 新电力并网 | 2–5 年(队列 24–36 月) | 否 | — | 电网审批、2100 GW 队列 |
| 自动实验室闭环 | 天(A-Lab 17 天一轮) | 是(Level 2–3) | 物理定律 | 范围窄、互操作性 |
| 机器人自复制 | — | 否(\(c \approx 0\)) | 产线 | 谐波减速器、芯片、电 |
读法:从上往下,周期时间涨了七八个数量级,而回路的闭合程度在下降。
代回 6.3 的公式:整个系统的倍增时间由最慢的那个必经闭环决定。 今天软件层已经是秒和小时,物理层是年。 所以 2026 年的 RSI 图景是这样的:
一个在软件层以小时为周期疯狂旋转、 但整体被一年到五年量级的物理周期钳住的系统。
这不是"没有 RSI",也不是"奇点将至"。 这是一个分层的、时间常数相差七个数量级的复合系统, 它的行为既不像平台期,也不像爆炸——像一条倍增时间被硬件周期锁定的指数。
9. 安全问题就是验证器问题
9.1 阈值已经被写成可测量的定义
值得注意的一件事:RSI 已经从修辞变成了可审计的指标。 OpenAI 的 "Critical" AI Self-improvement 等级有一个操作化定义,两个指标二选一:
- 前瞻指标:出现超人类水平的研究员/科学家 agent;
- 滞后指标:造成以 2024 年等效进展的五分之一 wall-clock 时间完成一代模型改进, 并持续数月。
这个定义的好处是它可测。第二条说的其实就是第 6.3 节的 \(T_{\text{double}}\)—— 把一个哲学争论变成了一个可以读数的量。
(同期还有 International AI Safety Report 2026 和多份前沿安全框架评估 在做同一件事:把 RSI 写进阈值表。)
9.2 递归的两端
Anthropic 那条线的逻辑是:用 RSI 去做对齐本身。 九个 agent 五天拿到 97%,就是这个论证的存在性证明。 如果自动化研究是不可避免的,那么让它先自动化安全研究,是一个有内在一致性的策略。
但按第 2 节的层级看,这里有个紧张关系值得说破:
- 费马大定理那种自主性之所以安全,是因为 Lean 不可被欺骗。
- 对齐研究没有 Lean。它的验证器是"人类研究员判断哪些发现是真的、哪些是 reward hack"—— 这正是 Anthropic 自己列的 caveat:这一步仍然是人做的。
- 而 Red Queen Gödel Machine 那条路线(让被评者协同进化评估器), 在能力上可能是必要的,在安全上正好指向层级最弱的那一格。
所以整篇文章的安全结论可以压成一句:
回路能安全地跑多远,等于它的验证器能被信任多远。 智能提升生成候选的质量,但它不会自动提升打分的可信度—— 事实上,生成器越强,弱验证器被绕过得越快。
这也是为什么 2026 年那些"agent 自主干了 N 天"的成果里, 唯一真正无争议的那个,是打分器叫 Lean 的那个。
10. 如果只记五句话
-
RSI 不是一个东西,是五层。 L0–L2 已经在跑但收敛,L3 正在发生但回路是开的, L4 连起跑线都没到。争论 "RSI 来没来" 而不指明层数,是在浪费时间。
-
验证器决定一切。 改进强度严格跟随验证层级: 形式验证 > 可执行测试 > PRM > LLM judge > 自评。 2026 年最自主的成果(11 天、1300 万行 Lean、费马大定理)出现在层级最顶格,不是巧合。
-
无限的智能 + 有限的物理周期 = 指数,不是奇点。 \(T_{\text{double}} = t_{\text{build}} \cdot \ln 2 / \ln g\)。 奇点要求周期本身趋于零,而周期的下界在硅、电、热、原子里。
-
物理极限很远,工程极限就在眼前,两者差五个数量级。 电网不到 1 个数量级,人类总能源约 2 个,行星热平衡约 6 个, Landauer 还有 5–6 个而且可以被可逆计算绕过。 用 Landauer 论证超级智能不可能,是把最远的那堵墙当成了最近的那堵。
-
物理层的 RSI 会从自动实验室开始,不会从机器人工厂开始。 因为前者的打分器是物理定律,后者的闭合率约等于零—— 机器人造不出自己的减速器、芯片和电。这是第 2 句话在原子尺度上的重演。
至于 Ilya:在 SSI 发出东西之前,它在这本账上是一个值为零的条目。 只不过,如果"大脑学习中那些未被充分探索的性质"真的指向样本效率和持续学习, 那么他赌的是 \(\partial I/\partial C\) 而不是 \(dC/dt\)—— 赌的是唯一一个不会被本文第 7 节那四堵墙挡住的方向。 这个赌注目前没有任何公开证据支持。它是一个方差极大的零。
参考文献
综述与理论
- M. Chen, L. Wang, B. Qu, Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops, arXiv:2607.07663 (2026-07,2026-09 修订;综述 1250 篇论文,提出验证层级)
- I.J. Good, Speculations Concerning the First Ultraintelligent Machine (1966)(智能爆炸论证的原始出处)
- J. Schmidhuber, Gödel Machines: Fully Self-Referential Optimal Universal Self-Improvers (2003)
- J. von Neumann, Theory of Self-Reproducing Automata(1948–49 讲稿,Burks 编,1966)
- N. Bloom, C.I. Jones, J. Van Reenen, M. Webb, Are Ideas Getting Harder to Find?, AER 110(4): 1104–44 (2020)(摩尔定律需要 18 倍研究人员;研究生产率年降 6.8%)— PDF
- International AI Safety Report 2026, arXiv:2602.21012
自我改进系统
- J. Zhang et al., Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents, arXiv:2505.22954(ICLR 2026)— Sakana 博客
- DARWIN: Dynamic Agentically Rewriting Self-Improving Network, arXiv:2602.05848
- The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators, arXiv:2606.26294
- Hyperagents(DGM-H), arXiv:2603.19461
- AlphaEvolve: a coding agent for scientific and algorithmic discovery, CoRR abs/2506.13131 (2025)
- ICLR 2026 Workshop on AI with Recursive Self-Improvement — 页面
实验室与公司
- Anthropic, When AI builds itself(2026-05)— anthropic.com/institute/recursive-self-improvement
- Anthropic, Automated researchers can reliably mitigate alignment failures(2026-08-28)
- Anthropic, Formalizing Fermat's Last Theorem(2026-09-05)— 研究页(11 天、1300 万行 Lean、30300 条定理、约 60 亿 output token)
- Anthropic, Signs of introspection in large language models(2025-10-29);The assistant axis(2026-01-19)
- OpenAI, Introducing GPT-5.3-Codex(2026-02-05)— openai.com · The New Stack 报道
- NVIDIA Newsroom, Ilya Sutskever's Safe Superintelligence Inc. and NVIDIA Announce Long-Term Strategic Partnership(2026-07-27)— 公告 · TechCrunch
- FutureSearch, When Will Safe Superintelligence Release a Model? — 预测页
反方
- MIT Technology Review, AI's recursive self-improvement might not come so quickly after all(2026-08-18)— 文章
- Communications of the ACM, Is Recursive Self-Improvement Really Here? — 文章
- IEEE Spectrum, Recursive Self-Improvement Edges Closer In AI Labs — 文章
- R. Schaeffer, B. Miranda, S. Koyejo, Are Emergent Abilities of Large Language Models a Mirage?, NeurIPS (2023)(度量假象)
物理层
- R. Landauer, Irreversibility and Heat Generation in the Computing Process, IBM J. Res. Dev. 5, 183 (1961)
- A. Bérut et al., Experimental verification of Landauer's principle, Nature 483, 187 (2012);E. Lutz et al. (2012)
- S. Lloyd, Ultimate physical limits to computation, Nature 406, 1047 (2000)
- K. Takahashi & Hayashi, Thermodynamic Limits of Physical Intelligence, arXiv:2602.05463
- Information Physics of Intelligence: Unifying Logical Depth and Entropy under Thermodynamic Constraints, arXiv:2511.19156
- Harvard Science Review, The Physical Limits of AI Intelligence(2026-02-26)— 文章
- SemiAnalysis, The Great AI Silicon Shortage — 文章
- Sequoia, Black Holes and the Intelligence Explosion — 文章
- Sequoia Podcast, How Ricursive Intelligence's Founders are Using AI to Shape The Future of Chip Design(AlphaChip → "designless")— 页面
自动实验室与机器人
- N.J. Szymanski et al., An autonomous laboratory for the accelerated synthesis of novel materials, Nature 624, 86–91 (2023)(A-Lab,17 天闭环)
- Toward self-driving laboratory 2.0 for chemistry and materials discovery, Materials Horizons 13(10), 4712 (2026) — RSC
- Argonne National Laboratory, Autonomous Discovery — 页面
- Google DeepMind, Gemini Robotics 2(2026-07-30/31,全身人形控制,Apptronik Apollo 2 上演示)
- QPillars, Self-Driving Labs in 2026: What Actually Works vs. What's Still Hype — 文章
本站相关
- 涌现的三副面孔 — "度量涌现"与真相变的区别,第 5.3 节的底稿
- 随机性不是噪声,是搜索工具 — 搜索 = 生成候选 + 打分,第 2 节的骨架
- 合成数据 — 自生成数据的分布坍缩
- EDA 与 LLM — 芯片设计那个跑了三十年的闭环
- harness 才是一切 · 循环工程 — 提高 Amdahl 公式里那个 \(p\)
- 压缩即智能 — 另一条给"智能"下定义的路