涌现的三副面孔:超导、蛋白质、大模型,只有一个是真正的相变
"涌现"是过去三年被滥用得最厉害的词。它同时指着三样不同的东西: 凝聚态物理里一个有严格定义、能被证明的数学事实; 生物学里一套有具体分子机制、可实验干预的过程; 以及大模型圈里一个2022 年提出、2023 年被证明有一半是度量假象的经验观察。
这三样东西共用一个词,但强度差了不止一个量级。本文把它们并排放好, 说清楚各自的机制是什么、哪些地方真的同构、哪些地方只是修辞。
结论先说:在严格意义上,三者里只有量子多体系统真的有"相变"—— 因为只有它取了 \(N \to \infty\) 的极限。大模型的"能力跃升"大部分是度量造出来的台阶, 但训练过程中确实有真的相变(induction head 的形成),只是不在参数规模那根轴上。 蛋白质和 DNA 里没有"智能涌现",但有货真价实的分子计算—— 而且提出它的人,和 1982 年提出 Hopfield 网络的是同一个人。
目录
- 0. 先把结论摆出来
- 1. "涌现"这个词被用坏了
- 2. 量子涌现:机制到底是什么
- 3. 大模型的"涌现能力":一个被证伪了一半的说法
- 4. 蛋白质与 DNA:分子层面有没有智能
- 5. 三者共有的四个零件
- 6. 类比在哪里断掉
- 7. 一张对照表
- 8. 如果只记三句话
- 参考文献
0. 先把结论摆出来
| 量子多体 | 生物分子 | 大模型 | |
|---|---|---|---|
| 微观单元 | 电子、自旋 | 氨基酸、碱基 | 参数、token |
| 数量级 \(N\) | \(10^{23}\) | \(10^2 \sim 10^9\) | \(10^9 \sim 10^{12}\) |
| 耦合 | 库仑力、交换作用 | 氢键、疏水作用 | 注意力、矩阵乘 |
| 选择原则 | 自由能极小 | 自然选择(40 亿年) | SGD 极小化交叉熵 |
| 宏观新变量 | 序参量、准粒子 | 折叠构象、细胞类型 | 电路(circuit)、特征 |
| 有没有真·相变 | 有,\(N\to\infty\) 时自由能非解析 | 有(Turing 失稳是真分岔) | 参数轴上基本没有;训练轴上有 |
| 尖锐性来自 | 热力学极限 | 动力学分岔 | 大部分来自度量的不连续 |
| 可否从微观推出宏观 | 原则上可以,实际不可行 | 原则上可以,实际不可行 | 原则上可以,实际不可行 |
最后一行三个"实际不可行"是这篇文章唯一无争议的共同点。 Anderson 1972 年那篇文章的整个论点就是这一行: 还原论成立,并不意味着建构论成立(reductionism ≠ constructionism)。
1. "涌现"这个词被用坏了
1.1 Anderson 1972:More Is Different
1972 年 P.W. Anderson 在 Science 上发表 More Is Different, 这是"涌现"作为一个物理概念的奠基文献。他的论证只有一句话:
把一切还原为简单基本定律的能力,并不蕴含从这些定律出发重建宇宙的能力。
他给的技术例子不是哲学,是自发对称破缺: 氨分子 \(\mathrm{NH_3}\) 的哈密顿量有空间反演对称性,它的基态是两个金字塔构型的对称叠加, 所以单个氨分子没有电偶极矩。但一块糖(手性分子晶体)会旋转偏振光, 它的基态破坏了原本哈密顿量具有的对称性。
差别在哪?在 \(N\)。分子越大,两个构型之间的隧穿劈裂越小, 到宏观尺度时劈裂小于任何实验能分辨的能标,对称态在物理上不再可及。
这是全文的起点:涌现的强度由 \(N\) 控制,而且这句话可以写成公式。
1.2 三种被混为一谈的"涌现"
| 名称 | 含义 | 谁在用 | 是否有争议 |
|---|---|---|---|
| 弱涌现(认识论) | 原则上可从微观推出,实际算不动 | 物理、生物、ML 都在用 | 无争议 |
| 强涌现(本体论) | 宏观有新的、不可还原的因果力 | 哲学、少数科普 | 物理学界基本不接受 |
| 度量涌现 | 指标曲线上出现了台阶 | ML 论文(2022 后) | 这是争议的全部来源 |
大模型圈说的"涌现",Wei et al. 2022 的原始定义是第三种:
一种能力如果在小模型上不存在、在大模型上存在,且无法通过外推小模型的表现来预测, 就称为 emergent。
注意这个定义里没有任何机制,它完全是关于曲线形状的。 而物理学里的涌现有机制、有序参量、有可以证明的定理。 把两者用同一个词说出来,是绝大多数混乱的源头。
1.3 一个能用的判据
判断"这里是不是真有涌现",我用三个问题:
- 宏观描述能不能自我闭合? 也就是:不引用微观量,能不能写出宏观量的完整演化方程? (超导:能,Ginzburg–Landau 方程;蛋白质:部分能,反应坐标;大模型:目前不能。)
- 新变量是不是微观变量的简单函数? 如果只是求和平均,那是统计,不是涌现。
- 尖锐性经得起换指标吗? 如果换一个连续指标台阶就没了,那台阶是你画上去的。
第 3 条会在 §3 直接干掉大模型"涌现能力"的大半江山。
2. 量子涌现:机制到底是什么
这一节讲物理,但目的是提取机制模板,后面两节要反复用它。
2.1 自发对称破缺:有限系统里根本没有相变
取最简单的例子,横场 Ising 模型:
\(H\) 对全局翻转 \(\sigma^z \to -\sigma^z\) 是对称的。当 \(h < J\) 时, 系统"应该"选择全部朝上或全部朝下——磁化 \(m = \langle \sigma^z\rangle \ne 0\)。
但对任何有限的 \(N\),真正的基态是两者的对称叠加:
对称态和反对称态之间的能隙随 \(N\) 指数衰减:\(\Delta E \sim e^{-cN}\)。
所以:
- \(N\) 有限 → 基态不破缺对称性,\(m = 0\),没有铁磁相。
- \(N \to \infty\) → 隧穿时间超过宇宙年龄,两个态成为独立的世界,\(m \ne 0\)。
对称破缺不是"\(N\) 很大时近似成立",它是"\(N\) 无穷时精确成立、\(N\) 有限时精确不成立"。
这一点还有更硬的版本。配分函数
对有限 \(N\) 是有限多个正指数函数之和,因此 \(\log Z_N\) 是 \(\beta\) 的解析函数—— 解析函数没有奇点,没有折角,没有台阶。 自由能的非解析性(也就是相变的数学定义)只能在 \(N \to \infty\) 时出现。 这是 Yang–Lee 1952 年的结果:相变对应配分函数零点在热力学极限下逼近实轴。
记住这句话,它是全文最锋利的一刀: 真正的相变要求 \(N \to \infty\)。任何有限系统的曲线都是光滑的。 大模型的参数量是有限的,所以它的损失曲线在数学上必然是光滑的。 你看到的台阶只可能来自两个地方:度量,或者训练动力学。
2.2 元激发:没有一个电子带 1/3 电荷
分数量子霍尔效应(Laughlin 1983)里,二维电子气在强磁场下的低能激发 带有 \(e/3\) 的电荷。而构成它的每一个电子都带 \(e\)。
\(e/3\) 不是"平均下来"的,它是可测的:1997 年两组独立的散粒噪声实验 (de-Picciotto 等;Saminadayar 等)直接测出了 \(e/3\) 的电荷量子。
这是"more is different"最干净的实验证据: 宏观的自由度不是微观自由度的重新排列,它是新的东西。 准粒子(声子、磁振子、Cooper 对、任意子)是涌现出的"新粒子", 它们只在集体态里存在,把系统拆开就找不到。
2.3 拓扑序:连序参量都没有
Landau 范式说:相变 = 对称破缺 = 出现一个局域序参量。 拓扑序(文小刚,1989 起)是这个范式外的东西:
- 基态简并度依赖于系统所在流形的拓扑(环面上 \(\nu=1/3\) 的 Laughlin 态是 3 重简并);
- 没有任何局域算符能区分这些简并基态;
- 特征是长程纠缠,用拓扑纠缠熵 \(S = \alpha L - \gamma\) 里的 \(\gamma\) 刻画。
意义在于:涌现出的性质可以完全没有局域的对应物。 你在任何有限区域内做任何测量,都读不出这个"序"。
2.4 重整化群:为什么宏观可以不管微观
前面三节讲的是"涌现存在"。RG 讲的是"涌现为什么是科学而不是玄学"—— 它给出了宏观描述可以脱离微观的推导。
粗粒化的操作:把短波长自由度积掉,再把尺度重标回去。 在这个过程中,哈密顿量里的耦合常数会"流动":
关键在于流的不动点附近,算符分成三类: 相关(relevant,越流越大)、无关(irrelevant,指数衰减到零)、边缘。
微观细节几乎全都是无关算符。 粗粒化几步之后它们就死了。 留下来的只有几个相关方向——它们决定宏观行为。
结果是普适类:微观上毫不相干的系统,宏观上完全一样。 三维 Ising 普适类里同时装着:
- 单轴铁磁体的居里点,
- 液–气临界点(水在 \(647\,\mathrm K\)、\(22.1\,\mathrm{MPa}\)),
- 二元合金的相分离临界点。
它们的临界指数是同一套:\(\beta \approx 0.326\),\(\nu \approx 0.630\),\(\gamma \approx 1.237\)。 水分子和铁原子毫无共同之处,但它们在临界点附近服从同一个数。 Wilson 因为这套东西拿了 1982 年诺贝尔物理学奖。
这是本文最重要的一个概念。 RG 说的是:宏观理论之所以能不管微观,不是因为我们偷懒, 而是因为微观信息在粗粒化下被证明是指数衰减的。 涌现是可推导的,只是推导的方向是"往上"而不是"往下"。
2.5 顺便:为什么量子系统没有被指数爆炸压垮
\(N\) 个自旋的希尔伯特空间维度是 \(2^N\)。\(N = 300\) 就超过了宇宙原子数。 但我们能算、能模拟、能理解真实材料。为什么?
因为有能隙的局域哈密顿量的基态满足纠缠面积律: 一个区域和外界的纠缠熵正比于边界面积而不是体积。 面积律意味着基态住在 \(2^N\) 维空间里一个维度低得多的流形上, 可以被矩阵乘积态(MPS)/ 张量网络高效表示——DMRG 就是靠这个跑起来的。
这一点在 §5 会再出现一次,因为它是三个领域最深的共同点。
2.6 量子涌现的机制模板
抽出来是四条:
- 大 \(N\) + 局域非线性耦合;
- 一个选择原则(自由能极小)挑出实际出现的宏观态;
- 一个尺度分离(能隙 / 关联长度),使粗粒化描述自我闭合;
- 结果是新的自由度 + 新的有效定律,且对微观细节不敏感(普适性)。
3. 大模型的"涌现能力":一个被证伪了一半的说法
3.1 2022 年的主张
Wei et al. 2022(TMLR)报告:在三位数加法、MMLU、词语重排等任务上, 模型在某个规模之前几乎是随机水平,越过某个规模后突然跳到高分。 论文列了 100 多个这样的任务,图上全是折角。
这个结论传播极广,也直接催生了"规模就是一切""GPT-4 里可能已经涌现了某种理解"这类说法。
3.2 2023 年:尖锐是度量造出来的
Schaeffer、Miranda、Koyejo 的 Are Emergent Abilities of Large Language Models a Mirage? (NeurIPS 2023 最佳论文之一)给出了一个极其简单的解释。
考虑一个需要输出 \(k\) 个 token 才算对的任务,用 exact match 打分。 设模型每个 token 正确的概率是 \(p\)(\(p\) 随规模平滑上升),那么
\(k = 5\)、\(p\) 从 \(0.3\) 平滑升到 \(0.9\) 时,准确率从 \(0.002\) 升到 \(0.59\)—— 在对数横轴上画出来就是一个陡峭的台阶。 底层能力是平滑的,台阶是 \((\cdot)^k\) 这个不连续度量制造的。
他们做了三件事,逐条钉死:
- 把 exact match 换成连续指标(token edit distance、Brier score、log-prob), 同一批模型、同一批任务,台阶消失,曲线变平滑;
- 统计发现"涌现"高度集中在少数几个不连续指标上 (Multiple Choice Grade、Exact String Match), 而在连续指标上几乎不出现——如果涌现是模型的性质,它不该挑指标;
- 反向构造:在一个完全没有任何"涌现"的浅层视觉自编码器上, 人为换用一个苛刻的阈值指标,硬生生造出了教科书式的涌现曲线。
第 3 条是关键的对照实验。它证明这套曲线形状不需要模型里发生任何事情就能产生。
这和 §2.1 的结论完全一致:有限系统的自由能是解析的, 你不可能在一个 \(10^{11}\) 参数的有限模型里得到数学意义上的非解析性。
3.3 那什么是真的:scaling law 光滑得惊人
真正稳健的经验事实不是台阶,是没有台阶。
Kaplan et al. 2020、Hoffmann et al. 2022(Chinchilla)发现, 交叉熵损失对参数量 \(N\)、数据量 \(D\)、算力 \(C\) 是干净的幂律:
跨 7 个数量级都成立,而且对深宽比、具体架构细节相当不敏感—— 只要是 Transformer 家族,指数就在那个附近。
这种"对微观细节不敏感"的性质,才是和 RG 普适类真正对应的东西。 而且这条类比不只是修辞:
- Bahri、Dyer、Kaplan、Lee、Sharma 的 Explaining Neural Scaling Laws(PNAS 2024) 把幂律指数和数据流形的内蕴维数 \(d\) 联系起来,给出 \(\alpha \approx 4/d\) 这类关系;
- Maloney、Roberts、Sully 2022 给了一个可解模型,用随机矩阵理论推出幂律;
- Roberts、Yaida、Hanin 的《The Principles of Deep Learning Theory》 直接用 \(1/\text{width}\) 展开做微扰场论:无穷宽是"自由理论"(NNGP / NTK), 有限宽修正就是"相互作用"。
这是物理方法在深度学习里字面意义上的应用,不是比喻。
讽刺的地方在于:大模型身上真正像物理的部分,是光滑的那一半(普适的幂律), 而不是被到处宣传的尖锐的那一半(能力台阶)。
3.4 真的相变在训练时间轴上
但如果就此说"大模型没有任何相变",那是过头了。有两个反例,而且都有机制。
(a)Induction head 的形成(Olsson et al. 2022,Anthropic)
训练早期,损失曲线上有一个可见的凸起(bump),发生在很窄的一段步数里。 在这个窗口内:
- 模型内部形成了 induction head——一种两层注意力电路,
它做的事是"在上文里找到上一次出现
A的地方,看它后面跟的是B, 于是预测这次A后面也是B"; - 上下文学习(in-context learning)能力同时出现,两条曲线在时间上重合;
- 消融掉这些头,in-context learning 大幅退化。
这是目前最接近"真相变"的东西:有尖锐的转变、有明确的序参量(电路的存在与否)、 有因果验证(消融)。而且它发生在训练步数这根轴上,不是参数规模那根轴上。
(b)Grokking(Power et al. 2022)
在模加法这类任务上,模型先记住训练集(训练准确率 100%,测试准确率仍随机), 然后在过拟合之后又训练很久,测试准确率突然跳到 100%。
Nanda et al. 2023 把这个过程逆向工程了:模型学到的是一个离散傅里叶算法—— 把数字嵌入到单位圆上的若干频率,用三角恒等式做加法,再读出。 关键是他们定义了"进度度量"(progress measure), 发现在这些度量下转变是渐进的:电路早就在悄悄形成, 只是测试准确率这个指标在电路完成前一直读作 0。
又是同一个故事:底层连续,指标离散。 但和 §3.2 不同的是,这里底层确实发生了结构性的变化—— 不是能力线性变强,而是一个新的算法被装配起来了。
3.5 这一节的结论
| 说法 | 判定 |
|---|---|
| 参数规模到某个阈值会突然涌现新能力 | 大部分是度量假象 |
| 损失随规模平滑幂律下降 | 稳健事实,跨 7 个数量级 |
| 训练过程中会形成新的内部电路,且转变很快 | 真的,且有因果证据 |
| 这些转变在数学上是相变(非解析) | 不是,有限系统不可能 |
| 大模型的涌现是"量子的" | 完全错误,见 §6 |
4. 蛋白质与 DNA:分子层面有没有智能
这是本文最容易失控的一节,所以先划一条线: 单个蛋白质、单条 DNA 没有智能。但它们确实在做计算,而且是可以精确定义的计算。
4.1 Levinthal 佯谬:和梯度下降是同一个解法
1969 年 Levinthal 提出了这个佯谬。一条 100 残基的多肽, 每个骨架二面角粗略取 3 个构象,总状态数
即使每 \(10^{-13}\,\mathrm s\) 试一个,穷举也要 \(10^{27}\) 年——远超宇宙年龄。 可实际折叠只需要微秒到秒。
解决方案是 Bryngelson & Wolynes(1987)的漏斗地形与最小挫败原理: 能量地形不是随机崎岖的,而是整体向天然态倾斜的漏斗。 蛋白质不"搜索"构象空间,它沿着地形往下滚。 局域的、贪心的移动就足够了,因为地形本身被进化雕刻成了有全局偏置的形状。
把这段话里的"构象"换成"参数"、"天然态"换成"低损失区"、 "进化雕刻"换成"架构 + 数据分布",你得到的就是深度学习为什么能训得动的标准解释。 参见 高中背到头秃的排列组合…: 两个领域面对的是同一个组合爆炸,用的是同一个逃生口——地形不是随机的。
这是本文里我认为最扎实的一条跨领域对应。它不是比喻, 两边的数学对象都是"高维空间上的非凸地形 + 一阶局域下降"。
4.2 折叠是自发的,但不可推导
Anfinsen(1961,1972 年诺贝尔化学奖)证明: 核糖核酸酶变性后去掉变性剂,能自发折回天然构象且恢复活性。 结论是热力学假说:天然构象所需的全部信息都编码在氨基酸序列里。
这是标准的弱涌现:信息全在微观里,但你盯着序列看一辈子也推不出结构。
有意思的是 2020 年之后的事:AlphaFold2(Jumper et al., Nature 2021) 在 CASP14 上把预测精度做到了实验级(中位 GDT_TS 92.4),AlphaFold3(2024)扩展到复合物。 但它没有解出折叠的物理——它是从 PDB 里的十几万个结构学出来的统计映射。
这本身是一个关于涌现的数据点: 当微观推导不可行时,宏观规律仍然可能是可学的。 这恰好是大模型在做的事——不推导,只拟合, 参见 万能函数模拟器。
而"一个残基改变可以彻底废掉功能"这件事(比如镰刀型贫血症只是 β 珠蛋白第 6 位 谷氨酸换成缬氨酸),说明功能是整体折叠的性质,不属于任何单个残基。 这是教科书级的 more is different。
4.3 分子确实在计算:三个具体机制
(a)别构效应 = 逻辑门。 Monod、Wyman、Changeux 1965 的 MWC 模型: 蛋白在两个构象态之间平衡,配体结合改变平衡。 血红蛋白结合氧的曲线是 S 形(Hill 系数约 2.8)而不是双曲线—— 这是协同性,四个亚基互相"通气"。一个 S 形响应函数就是一个软阈值门。
(b)lac 操纵子 = 一个真实的布尔电路。 Jacob & Monod 1961(1965 年诺奖):
阻遏蛋白实现 \(\lnot\),CAP–cAMP 实现另一个输入,两者组合出 AND-NOT。 这不是类比,这就是一个物理实现的逻辑门。
(c)动力学校对(kinetic proofreading)——本文最好的一个巧合。
DNA 复制的错误率约 \(10^{-8} \sim 10^{-10}\),翻译的错误率约 \(10^{-4}\)。 但正确与错误底物的结合自由能差只够支撑 \(10^{-2}\) 量级的区分。 平衡态热力学根本给不出这个精度。
1974 年 J.J. Hopfield 在 PNAS 上给出了解答(Ninio 1975 独立提出): 在识别和产物形成之间插入一个不可逆的、耗 ATP 的中间步骤, 让错误底物有额外的机会解离。代价是能量,收益是错误率被平方:
这是分子在用能量换信息,是一个严格的非平衡计算过程。
而这个 J.J. Hopfield,就是 1982 年提出 Hopfield 网络、 2024 年和 Hinton 一起拿诺贝尔物理学奖的那个人。 同一个人,先在分子层面定义了"生物如何用耗散换取精度", 八年后在网络层面定义了"能量地形如何存储记忆"。 这条线本站另有一篇专门讲:从玻尔兹曼到辛顿。
4.4 DNA 不是蓝图:C 值悖论
如果复杂度写在序列里,那么基因组越大越复杂。事实完全不是这样。
| 物种 | 基因组大小 | 蛋白编码基因数 |
|---|---|---|
| 人 | \(\approx 3.1\) Gb | \(\approx 20{,}000\) |
| 秀丽隐杆线虫(959 个体细胞) | \(\approx 100\) Mb | \(\approx 20{,}000\) |
| Paris japonica(一种重楼) | \(\approx 149\) Gb | — |
人和线虫的蛋白编码基因数基本一样。一株植物的基因组是人的 50 倍。 这就是 C 值悖论:基因组大小与生物复杂度不相关。
复杂度不在序列长度里,在调控网络里:
- 同一段 DNA 在不同细胞里被读成完全不同的东西;
- 你身上每一个细胞的基因组完全相同,但有几百种细胞类型;
- 差别来自基因调控网络(GRN)落在了不同的吸引子上。
Waddington 1957 年的"表观遗传地形"就是这个图像:小球从山顶滚下, 分岔选择决定它最终落进哪条沟。Kauffman 的随机布尔网络把它形式化为 "细胞类型 = 动力系统的吸引子"(这仍是一个有影响力的假说,不是定论)。
这是最干净的涌现例子:微观规格完全相同(同一份 DNA), 宏观状态有几百种(细胞类型),由动力学和历史选择。 信息不在参数里,在参数决定的那个动力系统的相空间结构里。
4.5 Turing 1952:生物学里真正的对称破缺
图灵最后一篇论文 The Chemical Basis of Morphogenesis(1952)问的是: 一个完全均匀的受精卵,怎么长出有花纹、有手指、有前后轴的东西?
他的答案是反应–扩散方程:
反直觉的地方在于:扩散通常抹平差异,但在这里它制造差异。 当"激活剂扩散慢、抑制剂扩散快"(\(D_v \gg D_u\))时, 均匀态对某个波长的扰动变得不稳定,系统自发长出周期性图案。
这是货真价实的自发对称破缺——平移对称的初态, 自发选出了一个特征波长 \(\lambda\) 和一个相位。它有分岔点,有序参量, 数学结构和 §2.1 的铁磁相变是同一类。
实验上也被证实了:Castets 等 1990 年在 CIMA 反应里第一次做出了真正的 Turing 斑图; Sheth 等 2012 年在 Science 上给出证据,小鼠的指头就是一个 Turing 图案, Hox 基因的作用是调节它的波长(敲掉后指头变多变细)。
4.6 直接回答:分子层面有没有智能涌现
分开回答:
| 问题 | 回答 |
|---|---|
| 单个蛋白质会思考吗? | 不会。 |
| 分子在做信息处理吗? | 是,而且可精确定义:逻辑门、放大器、纠错、阈值 |
| 有没有"超出编码信息"的东西冒出来? | 没有(Anfinsen);有的是"无法从编码推导"的东西 |
| 细胞层面呢? | 细胞有记忆、有决策、有适应,这些有明确机制 |
| 有人主张细胞有"基础认知" | 是(Levin 等的生物电研究),这是活跃但有争议的领域,别当定论引用 |
| 那智能在哪一层冒出来? | 目前有证据的最低层级是神经网络,不是分子 |
我的判断是:分子层面有计算,没有智能。 计算和智能之间隔着的东西,正是这篇文章反复在说的那三样—— 大 \(N\)、可塑的耦合、以及一个持续施加的选择压力。 核糖体是一台读带子的机器,它精确、可靠、可编程,但它没有目标函数。
5. 三者共有的四个零件
把 §2.6 的模板套到三个领域上:
| 零件 | 量子多体 | 生物 | 大模型 |
|---|---|---|---|
| ① 大 \(N\) | \(10^{23}\) 个电子 | \(10^2\) 残基 / \(10^{10}\) 碱基 | \(10^{11}\) 参数 |
| ② 非线性耦合 | 交换作用、库仑 | 疏水塌缩、别构、调控 | 注意力(token 之间乘性耦合) |
| ③ 尺度分离 | 能隙 / 关联长度 | 折叠时标 vs 化学时标 | ?这一条最弱 |
| ④ 选择原则 | 自由能极小 | 自然选择 | SGD 极小化交叉熵 |
5.1 ② 必须是"乘性"的,否则什么也不会发生
如果单元之间只是相加,那么 \(N\) 再大也只得到统计涨落(中心极限定理), 不会有新东西。涌现需要耦合项。
值得注意的是三个领域的耦合都是成对乘性的:
注意力做的事情,在结构上就是"让第 \(i\) 个位置的表示依赖于它和第 \(j\) 个位置的乘积"。 这是 Transformer 相比 MLP 的关键差异,也是它能表达长程组合结构的原因。
5.2 ④ 是最被忽略的那个,也是最重要的
科普文章讲涌现时几乎只讲 ①:"规模大了就会涌现"。这是错的。
把 \(10^{23}\) 个原子随机堆在一起,你得到的是一团气体,不是超导体。 超导需要的是自由能极小这个选择原则,把系统推到 BCS 基态上去。 随机初始化一个 \(10^{11}\) 参数的 Transformer,你得到的是噪声。
规模提供的是可能性空间,选择原则决定你实际落在哪。
而三个领域的选择原则强度差别巨大:
| 选择原则 | 作用时长 | 目标 | |
|---|---|---|---|
| 物理 | 自由能极小 | 瞬时(弛豫时间) | 由哈密顿量给定,不可改 |
| 生物 | 差异化繁殖 | \(\approx 4 \times 10^9\) 年 | 无显式目标,只有"活下来" |
| 大模型 | SGD 极小化 CE | \(10^5 \sim 10^6\) 步 | 人写的,显式的 |
最后一格是大模型和另外两者最本质的分歧: 它的宏观行为是被"设计"出来的,不是被"发现"的。 物理学家发现超导,生物学家发现折叠, 而大模型的能力是我们写下一个损失函数,然后去优化它得到的。
顺带说,进化和 SGD 的差别可以说得更精确: 进化没有梯度,它是零阶方法(类似进化策略), 每一代只能靠采样估计改进方向,所以样本效率比 SGD 差若干个数量级。 SGD 有反向传播,能一次拿到全部参数的偏导。 这就是为什么 40 亿年才做出人脑,而我们几个月能训一个模型。
5.3 ③ 是大模型最缺的一环,也是最值得做的方向
物理学之所以能把涌现讲清楚,全靠 RG 提供的尺度分离(§2.4)。 生物学有部分的尺度分离(分子 → 通路 → 细胞 → 组织)。
大模型目前没有。我们没有一个"粗粒化 Transformer"的操作, 没有算符相关/无关的分类,没有不动点。 机械可解释性(mechanistic interpretability)在做的事—— 从权重里找出电路、特征、叠加(superposition)—— 本质上就是在手工寻找那个粗粒化描述。
§2.5 那个面积律的伏笔在这里收:
- 量子多体:希尔伯特空间是 \(2^N\) 维,但物理态因为面积律住在低维流形上;
- 语言:长度 \(T\) 的 token 序列有 \(V^T\) 种,但合法的自然语言住在极小的一角;
- 蛋白质:\(20^{L}\) 条序列,但能稳定折叠的只是极小一撮。
三个领域都在对抗同一个指数爆炸,都靠"真实态只占一个低维子集"逃生。 量子那边这件事有定理(面积律、MPS 表示定理); 另外两边目前只有经验证据。谁把后两者的"面积律"证出来, 谁就拿到了这个领域的 RG。
6. 类比在哪里断掉
前面五节建立了对应关系,这一节负责拆掉不成立的部分。不说清楚就会变成玄学。
1. 大模型和量子力学没有任何关系。 Transformer 是纯经典的浮点运算。没有叠加、没有纠缠、没有 \(\hbar\)、没有波函数坍缩。 "大模型的涌现是量子效应""意识来自量子相干"这类说法,在大模型这一侧是明确错误的。 本文借用的是量子多体物理发展出的涌现方法论(对称破缺、序参量、RG、普适类), 不是量子力学本身。这两件事必须分开。
2. 大模型没有热力学极限,所以不可能有数学意义上的相变。 §2.1 已经证明:有限 \(N\) 的配分函数是解析的。 \(10^{12}\) 参数在数学上和 \(10\) 参数一样是"有限"。 所谓"涌现临界点"没有非解析性,只有陡峭。
3. 大模型没有哈密顿量,没有能量守恒,没有平衡态。 训练是一个非平衡的、有外部驱动的优化过程, 不是系统弛豫到自由能极小。唯一严格成立的对应在推理端: \(\operatorname{softmax}(\ell/T)\) 精确等于 \(e^{-E/T}/Z\)(取 \(E_i = -\ell_i\))—— 这条已经在 从玻尔兹曼到辛顿 里讲透了, 但那是分布形式的同构,不是物理过程的同构。
4. 大模型里没有 Landau 意义上的序参量。 权重空间确实有对称性(神经元置换、缩放不变),但那是规范冗余, 不是物理自由度,破缺它不产生任何可观测后果。 induction head 的"有 / 无"勉强算一个序参量,但它没有对应的守恒律或 Goldstone 模式。
5. "蛋白质折叠 = 梯度下降"这条类比有边界。 两者都是高维非凸地形上的局域下降,这部分成立。 但蛋白质的地形是固定的(由物理和序列决定), 而神经网络的损失地形随数据分布变化,且训练同时在改变地形本身的有效形状(如 BN、残差)。 另外蛋白质折叠是布朗动力学 + 热噪声,天然带温度; SGD 的"噪声"来自 minibatch 采样,其协方差结构和热噪声不同(各向异性、与梯度相关)。
6. C 值悖论不能推出"参数量不重要"。 生物学的教训是"复杂度在调控结构里而不在序列长度里", 但这不等于"大模型的参数量不重要"——scaling law 是硬的经验事实。 正确的类比是:基因组 ≈ 参数,调控网络 ≈ 架构 + 训练过程。 两者都重要,但生物学告诉我们不要只看第一个数字。
7. 别把 Wei 2022 和 Schaeffer 2023 讲成"谁赢了"。 Schaeffer 等证明的是"尖锐性是度量假象", 不是"大模型没有随规模变强"。能力确实随规模上升, 只是上升是平滑的、可外推的——这对安全和预测其实是好消息。
8. 分子计算 ≠ 分子智能。 §4.3 里所有例子都是固定电路:lac 操纵子不会学习新的逻辑, 核糖体不会改变自己的读码方式。可塑性发生在进化的时间尺度上,不在个体分子上。 把"会计算"说成"有智能",是这个领域最常见的滑坡。
7. 一张对照表
| 层次 | 量子多体 | 蛋白质 / DNA | 大模型 |
|---|---|---|---|
| 微观定律 | 薛定谔方程 | 分子力场、化学动力学 | 前向传播 + 反向传播 |
| 组合爆炸 | \(2^N\) 维希尔伯特空间 | \(3^{99}\) 构象 / \(20^L\) 序列 | \(V^T\) token 序列 |
| 逃生口 | 纠缠面积律 → MPS | 漏斗地形(最小挫败) | 数据流形低内蕴维数 |
| 有没有定理 | 有 | 无,只有经验 | 无,只有经验 |
| 选择原则 | 自由能极小 | 自然选择 | SGD 极小化交叉熵 |
| 宏观新变量 | 序参量、准粒子 | 折叠态、细胞类型 | 电路、特征方向 |
| 对称破缺 | Ising / BCS / Higgs | Turing 失稳(1952) | 无(只有规范冗余) |
| 粗粒化理论 | RG,有不动点 | 部分(层级模块化) | 没有(mech interp 在手工找) |
| 普适性证据 | 临界指数跨物质相同 | 折叠速率与接触序相关 | scaling law 跨架构稳定 |
| 真·相变 | 有(\(N\to\infty\)) | 有(Turing 分岔) | 无(参数轴)/ 有(训练轴,induction head) |
| 尖锐性来源 | 自由能非解析 | 动力系统分岔 | 多数来自不连续度量 |
| 关键人物 | Anderson、Wilson | Anfinsen、Hopfield(1974) | Kaplan、Olsson、Schaeffer |
8. 如果只记三句话
1. 涌现的强度由 \(N\) 和"选择原则"共同决定,不是只由 \(N\) 决定。 规模给的是可能性空间,选择原则(自由能 / 自然选择 / 损失函数)决定你落在哪。 "参数量到了就会涌现"是把四个零件里的一个当成了全部。
2. 严格意义上的相变要求 \(N \to \infty\),所以大模型不可能有。 你在指标曲线上看到的台阶,先检查是不是 exact match 之类的不连续度量造出来的。 换成 log-prob 再看一次——多数情况下它会变平。 真正的结构性转变发生在训练时间轴上(induction head、grokking),那些是真的。
3. 分子层面有计算,没有智能;而"计算"这件事在分子层面是精确的,不是比喻。 lac 操纵子是逻辑门,血红蛋白是阈值函数,动力学校对是用 ATP 换错误率的平方下降。 但它们都是固定电路。智能需要的是可塑的耦合 + 持续的选择压力, 目前有证据的最低层级是神经网络,不是蛋白质。
最后一句题外话。这三个领域里,物理学是唯一一个把涌现讲清楚的—— 因为它有 RG,能证明微观细节在粗粒化下指数衰减。 生物学和深度学习都还没有自己的 RG。 机械可解释性在做的,本质上就是手工去找那个粗粒化描述; 如果哪天有人给出了 Transformer 的重整化群流和不动点, "涌现"这个词在 AI 里才会第一次有它在物理学里那样的分量。
参考文献
涌现与凝聚态
- P.W. Anderson, More Is Different, Science 177, 393 (1972)
- C.N. Yang & T.D. Lee, Statistical Theory of Equations of State and Phase Transitions, Phys. Rev. 87, 404 (1952)
- R.B. Laughlin, Phys. Rev. Lett. 50, 1395 (1983);de-Picciotto et al., Nature 389, 162 (1997)(\(e/3\) 散粒噪声)
- X.-G. Wen, Quantum Field Theory of Many-Body Systems(拓扑序)
- K.G. Wilson, Nobel Lecture 1982(重整化群与普适类)
- J. Eisert, M. Cramer, M.B. Plenio, Area laws for the entanglement entropy, RMP 82, 277 (2010)
大模型的涌现与 scaling
- J. Wei et al., Emergent Abilities of Large Language Models, TMLR (2022)
- R. Schaeffer, B. Miranda, S. Koyejo, Are Emergent Abilities of Large Language Models a Mirage?, NeurIPS (2023)
- J. Kaplan et al., Scaling Laws for Neural Language Models (2020)
- J. Hoffmann et al., Training Compute-Optimal Large Language Models(Chinchilla, 2022)
- Y. Bahri, E. Dyer, J. Kaplan, J. Lee, U. Sharma, Explaining Neural Scaling Laws, PNAS 121 (2024)
- A. Maloney, D.A. Roberts, J. Sully, A Solvable Model of Neural Scaling Laws (2022)
- D.A. Roberts, S. Yaida, B. Hanin, The Principles of Deep Learning Theory, CUP (2022)
- C. Olsson et al., In-context Learning and Induction Heads, Anthropic (2022)
- A. Power et al., Grokking (2022);N. Nanda et al., Progress Measures for Grokking via Mechanistic Interpretability, ICLR (2023)
生物
- C. Levinthal, How to Fold Graciously (1969)
- C.B. Anfinsen, Principles that Govern the Folding of Protein Chains, Science 181, 223 (1973)
- J.D. Bryngelson & P.G. Wolynes, PNAS 84, 7524 (1987)(漏斗地形 / 最小挫败)
- J.J. Hopfield, Kinetic Proofreading, PNAS 71, 4135 (1974);J. Ninio, Biochimie 57, 587 (1975)
- J. Monod, J. Wyman, J.-P. Changeux, JMB 12, 88 (1965)(MWC 别构模型)
- F. Jacob & J. Monod, JMB 3, 318 (1961)(lac 操纵子)
- A.M. Turing, The Chemical Basis of Morphogenesis, Phil. Trans. R. Soc. B 237, 37 (1952)
- V. Castets et al., PRL 64, 2953 (1990)(首个实验 Turing 斑图)
- R. Sheth et al., Hox Genes Regulate Digit Patterning, Science 338, 1476 (2012)
- S.A. Kauffman, The Origins of Order (1993)(随机布尔网络与吸引子)
- J. Jumper et al., Highly accurate protein structure prediction with AlphaFold, Nature 596, 583 (2021)
本站相关
- 从玻尔兹曼到辛顿 — softmax 就是 1877 年那个 \(e^{-E/T}/Z\)
- 高中背到头秃的排列组合… — 组合爆炸与泛化
- 万能函数模拟器 — 不推导、只拟合
- 随机性不是噪声,是搜索工具 — 地形上的随机搜索