涌现的三副面孔:超导、蛋白质、大模型,只有一个是真正的相变

2026-09-02 · Steve Chan

"涌现"是过去三年被滥用得最厉害的词。它同时指着三样不同的东西: 凝聚态物理里一个有严格定义、能被证明的数学事实; 生物学里一套有具体分子机制、可实验干预的过程; 以及大模型圈里一个2022 年提出、2023 年被证明有一半是度量假象的经验观察。

这三样东西共用一个词,但强度差了不止一个量级。本文把它们并排放好, 说清楚各自的机制是什么、哪些地方真的同构、哪些地方只是修辞。

结论先说:在严格意义上,三者里只有量子多体系统真的有"相变"—— 因为只有它取了 \(N \to \infty\) 的极限。大模型的"能力跃升"大部分是度量造出来的台阶, 但训练过程中确实有真的相变(induction head 的形成),只是不在参数规模那根轴上。 蛋白质和 DNA 里没有"智能涌现",但有货真价实的分子计算—— 而且提出它的人,和 1982 年提出 Hopfield 网络的是同一个人。


目录


0. 先把结论摆出来

量子多体 生物分子 大模型
微观单元 电子、自旋 氨基酸、碱基 参数、token
数量级 \(N\) \(10^{23}\) \(10^2 \sim 10^9\) \(10^9 \sim 10^{12}\)
耦合 库仑力、交换作用 氢键、疏水作用 注意力、矩阵乘
选择原则 自由能极小 自然选择(40 亿年) SGD 极小化交叉熵
宏观新变量 序参量、准粒子 折叠构象、细胞类型 电路(circuit)、特征
有没有真·相变 有,\(N\to\infty\) 时自由能非解析 有(Turing 失稳是真分岔) 参数轴上基本没有;训练轴上有
尖锐性来自 热力学极限 动力学分岔 大部分来自度量的不连续
可否从微观推出宏观 原则上可以,实际不可行 原则上可以,实际不可行 原则上可以,实际不可行

最后一行三个"实际不可行"是这篇文章唯一无争议的共同点。 Anderson 1972 年那篇文章的整个论点就是这一行: 还原论成立,并不意味着建构论成立(reductionism ≠ constructionism)。


1. "涌现"这个词被用坏了

1.1 Anderson 1972:More Is Different

1972 年 P.W. Anderson 在 Science 上发表 More Is Different, 这是"涌现"作为一个物理概念的奠基文献。他的论证只有一句话:

把一切还原为简单基本定律的能力,并不蕴含从这些定律出发重建宇宙的能力。

他给的技术例子不是哲学,是自发对称破缺: 氨分子 \(\mathrm{NH_3}\) 的哈密顿量有空间反演对称性,它的基态是两个金字塔构型的对称叠加, 所以单个氨分子没有电偶极矩。但一块糖(手性分子晶体)会旋转偏振光, 它的基态破坏了原本哈密顿量具有的对称性。

差别在哪?在 \(N\)。分子越大,两个构型之间的隧穿劈裂越小, 到宏观尺度时劈裂小于任何实验能分辨的能标,对称态在物理上不再可及。

这是全文的起点:涌现的强度由 \(N\) 控制,而且这句话可以写成公式。

1.2 三种被混为一谈的"涌现"

名称 含义 谁在用 是否有争议
弱涌现(认识论) 原则上可从微观推出,实际算不动 物理、生物、ML 都在用 无争议
强涌现(本体论) 宏观有新的、不可还原的因果力 哲学、少数科普 物理学界基本不接受
度量涌现 指标曲线上出现了台阶 ML 论文(2022 后) 这是争议的全部来源

大模型圈说的"涌现",Wei et al. 2022 的原始定义是第三种:

一种能力如果在小模型上不存在、在大模型上存在,且无法通过外推小模型的表现来预测, 就称为 emergent。

注意这个定义里没有任何机制,它完全是关于曲线形状的。 而物理学里的涌现有机制、有序参量、有可以证明的定理。 把两者用同一个词说出来,是绝大多数混乱的源头。

1.3 一个能用的判据

判断"这里是不是真有涌现",我用三个问题:

  1. 宏观描述能不能自我闭合? 也就是:不引用微观量,能不能写出宏观量的完整演化方程? (超导:能,Ginzburg–Landau 方程;蛋白质:部分能,反应坐标;大模型:目前不能。)
  2. 新变量是不是微观变量的简单函数? 如果只是求和平均,那是统计,不是涌现。
  3. 尖锐性经得起换指标吗? 如果换一个连续指标台阶就没了,那台阶是你画上去的。

第 3 条会在 §3 直接干掉大模型"涌现能力"的大半江山。


2. 量子涌现:机制到底是什么

这一节讲物理,但目的是提取机制模板,后面两节要反复用它。

2.1 自发对称破缺:有限系统里根本没有相变

取最简单的例子,横场 Ising 模型:

\[H = -J\sum_{i} \sigma^z_i \sigma^z_{i+1} - h\sum_i \sigma^x_i\]

\(H\) 对全局翻转 \(\sigma^z \to -\sigma^z\) 是对称的。当 \(h < J\) 时, 系统"应该"选择全部朝上或全部朝下——磁化 \(m = \langle \sigma^z\rangle \ne 0\)。

但对任何有限的 \(N\),真正的基态是两者的对称叠加:

\[|\text{GS}\rangle = \frac{1}{\sqrt2}\left(|{\uparrow\uparrow\cdots\uparrow}\rangle + |{\downarrow\downarrow\cdots\downarrow}\rangle\right), \qquad \langle \text{GS}|\,m\,|\text{GS}\rangle = 0\]

对称态和反对称态之间的能隙随 \(N\) 指数衰减:\(\Delta E \sim e^{-cN}\)。

所以:

  • \(N\) 有限 → 基态不破缺对称性,\(m = 0\),没有铁磁相。
  • \(N \to \infty\) → 隧穿时间超过宇宙年龄,两个态成为独立的世界,\(m \ne 0\)。

对称破缺不是"\(N\) 很大时近似成立",它是"\(N\) 无穷时精确成立、\(N\) 有限时精确不成立"。

这一点还有更硬的版本。配分函数

\[Z_N(\beta) = \sum_{s} e^{-\beta E(s)}\]

对有限 \(N\) 是有限多个正指数函数之和,因此 \(\log Z_N\) 是 \(\beta\) 的解析函数—— 解析函数没有奇点,没有折角,没有台阶。 自由能的非解析性(也就是相变的数学定义)只能在 \(N \to \infty\) 时出现。 这是 Yang–Lee 1952 年的结果:相变对应配分函数零点在热力学极限下逼近实轴。

记住这句话,它是全文最锋利的一刀: 真正的相变要求 \(N \to \infty\)。任何有限系统的曲线都是光滑的。 大模型的参数量是有限的,所以它的损失曲线在数学上必然是光滑的。 你看到的台阶只可能来自两个地方:度量,或者训练动力学。

2.2 元激发:没有一个电子带 1/3 电荷

分数量子霍尔效应(Laughlin 1983)里,二维电子气在强磁场下的低能激发 带有 \(e/3\) 的电荷。而构成它的每一个电子都带 \(e\)。

\(e/3\) 不是"平均下来"的,它是可测的:1997 年两组独立的散粒噪声实验 (de-Picciotto 等;Saminadayar 等)直接测出了 \(e/3\) 的电荷量子。

这是"more is different"最干净的实验证据: 宏观的自由度不是微观自由度的重新排列,它是新的东西。 准粒子(声子、磁振子、Cooper 对、任意子)是涌现出的"新粒子", 它们只在集体态里存在,把系统拆开就找不到。

2.3 拓扑序:连序参量都没有

Landau 范式说:相变 = 对称破缺 = 出现一个局域序参量。 拓扑序(文小刚,1989 起)是这个范式外的东西:

  • 基态简并度依赖于系统所在流形的拓扑(环面上 \(\nu=1/3\) 的 Laughlin 态是 3 重简并);
  • 没有任何局域算符能区分这些简并基态;
  • 特征是长程纠缠,用拓扑纠缠熵 \(S = \alpha L - \gamma\) 里的 \(\gamma\) 刻画。

意义在于:涌现出的性质可以完全没有局域的对应物。 你在任何有限区域内做任何测量,都读不出这个"序"。

2.4 重整化群:为什么宏观可以不管微观

前面三节讲的是"涌现存在"。RG 讲的是"涌现为什么是科学而不是玄学"—— 它给出了宏观描述可以脱离微观的推导。

粗粒化的操作:把短波长自由度积掉,再把尺度重标回去。 在这个过程中,哈密顿量里的耦合常数会"流动":

\[\frac{d g_i}{d \ell} = \beta_i(\{g\})\]

关键在于流的不动点附近,算符分成三类: 相关(relevant,越流越大)、无关(irrelevant,指数衰减到零)、边缘。

微观细节几乎全都是无关算符。 粗粒化几步之后它们就死了。 留下来的只有几个相关方向——它们决定宏观行为。

结果是普适类:微观上毫不相干的系统,宏观上完全一样。 三维 Ising 普适类里同时装着:

  • 单轴铁磁体的居里点,
  • 液–气临界点(水在 \(647\,\mathrm K\)、\(22.1\,\mathrm{MPa}\)),
  • 二元合金的相分离临界点。

它们的临界指数是同一套:\(\beta \approx 0.326\),\(\nu \approx 0.630\),\(\gamma \approx 1.237\)。 水分子和铁原子毫无共同之处,但它们在临界点附近服从同一个数。 Wilson 因为这套东西拿了 1982 年诺贝尔物理学奖。

这是本文最重要的一个概念。 RG 说的是:宏观理论之所以能不管微观,不是因为我们偷懒, 而是因为微观信息在粗粒化下被证明是指数衰减的。 涌现是可推导的,只是推导的方向是"往上"而不是"往下"。

2.5 顺便:为什么量子系统没有被指数爆炸压垮

\(N\) 个自旋的希尔伯特空间维度是 \(2^N\)。\(N = 300\) 就超过了宇宙原子数。 但我们能算、能模拟、能理解真实材料。为什么?

因为有能隙的局域哈密顿量的基态满足纠缠面积律: 一个区域和外界的纠缠熵正比于边界面积而不是体积。 面积律意味着基态住在 \(2^N\) 维空间里一个维度低得多的流形上, 可以被矩阵乘积态(MPS)/ 张量网络高效表示——DMRG 就是靠这个跑起来的。

这一点在 §5 会再出现一次,因为它是三个领域最深的共同点。

2.6 量子涌现的机制模板

抽出来是四条:

  1. 大 \(N\) + 局域非线性耦合;
  2. 一个选择原则(自由能极小)挑出实际出现的宏观态;
  3. 一个尺度分离(能隙 / 关联长度),使粗粒化描述自我闭合;
  4. 结果是新的自由度 + 新的有效定律,且对微观细节不敏感(普适性)。

3. 大模型的"涌现能力":一个被证伪了一半的说法

3.1 2022 年的主张

Wei et al. 2022(TMLR)报告:在三位数加法、MMLU、词语重排等任务上, 模型在某个规模之前几乎是随机水平,越过某个规模后突然跳到高分。 论文列了 100 多个这样的任务,图上全是折角。

这个结论传播极广,也直接催生了"规模就是一切""GPT-4 里可能已经涌现了某种理解"这类说法。

3.2 2023 年:尖锐是度量造出来的

Schaeffer、Miranda、Koyejo 的 Are Emergent Abilities of Large Language Models a Mirage? (NeurIPS 2023 最佳论文之一)给出了一个极其简单的解释。

考虑一个需要输出 \(k\) 个 token 才算对的任务,用 exact match 打分。 设模型每个 token 正确的概率是 \(p\)(\(p\) 随规模平滑上升),那么

\[\text{Accuracy} \approx p^{\,k}\]

\(k = 5\)、\(p\) 从 \(0.3\) 平滑升到 \(0.9\) 时,准确率从 \(0.002\) 升到 \(0.59\)—— 在对数横轴上画出来就是一个陡峭的台阶。 底层能力是平滑的,台阶是 \((\cdot)^k\) 这个不连续度量制造的。

他们做了三件事,逐条钉死:

  1. 把 exact match 换成连续指标(token edit distance、Brier score、log-prob), 同一批模型、同一批任务,台阶消失,曲线变平滑;
  2. 统计发现"涌现"高度集中在少数几个不连续指标上 (Multiple Choice Grade、Exact String Match), 而在连续指标上几乎不出现——如果涌现是模型的性质,它不该挑指标;
  3. 反向构造:在一个完全没有任何"涌现"的浅层视觉自编码器上, 人为换用一个苛刻的阈值指标,硬生生造出了教科书式的涌现曲线。

第 3 条是关键的对照实验。它证明这套曲线形状不需要模型里发生任何事情就能产生。

这和 §2.1 的结论完全一致:有限系统的自由能是解析的, 你不可能在一个 \(10^{11}\) 参数的有限模型里得到数学意义上的非解析性。

3.3 那什么是真的:scaling law 光滑得惊人

真正稳健的经验事实不是台阶,是没有台阶。

Kaplan et al. 2020、Hoffmann et al. 2022(Chinchilla)发现, 交叉熵损失对参数量 \(N\)、数据量 \(D\)、算力 \(C\) 是干净的幂律:

\[L(N, D) = E + \frac{A}{N^{\alpha}} + \frac{B}{D^{\beta}}\]

跨 7 个数量级都成立,而且对深宽比、具体架构细节相当不敏感—— 只要是 Transformer 家族,指数就在那个附近。

这种"对微观细节不敏感"的性质,才是和 RG 普适类真正对应的东西。 而且这条类比不只是修辞:

  • Bahri、Dyer、Kaplan、Lee、Sharma 的 Explaining Neural Scaling Laws(PNAS 2024) 把幂律指数和数据流形的内蕴维数 \(d\) 联系起来,给出 \(\alpha \approx 4/d\) 这类关系;
  • Maloney、Roberts、Sully 2022 给了一个可解模型,用随机矩阵理论推出幂律;
  • Roberts、Yaida、Hanin 的《The Principles of Deep Learning Theory》 直接用 \(1/\text{width}\) 展开做微扰场论:无穷宽是"自由理论"(NNGP / NTK), 有限宽修正就是"相互作用"。

这是物理方法在深度学习里字面意义上的应用,不是比喻。

讽刺的地方在于:大模型身上真正像物理的部分,是光滑的那一半(普适的幂律), 而不是被到处宣传的尖锐的那一半(能力台阶)。

3.4 真的相变在训练时间轴上

但如果就此说"大模型没有任何相变",那是过头了。有两个反例,而且都有机制。

(a)Induction head 的形成(Olsson et al. 2022,Anthropic)

训练早期,损失曲线上有一个可见的凸起(bump),发生在很窄的一段步数里。 在这个窗口内:

  • 模型内部形成了 induction head——一种两层注意力电路, 它做的事是"在上文里找到上一次出现 A 的地方,看它后面跟的是 B, 于是预测这次 A 后面也是 B";
  • 上下文学习(in-context learning)能力同时出现,两条曲线在时间上重合;
  • 消融掉这些头,in-context learning 大幅退化。

这是目前最接近"真相变"的东西:有尖锐的转变、有明确的序参量(电路的存在与否)、 有因果验证(消融)。而且它发生在训练步数这根轴上,不是参数规模那根轴上。

(b)Grokking(Power et al. 2022)

在模加法这类任务上,模型先记住训练集(训练准确率 100%,测试准确率仍随机), 然后在过拟合之后又训练很久,测试准确率突然跳到 100%。

Nanda et al. 2023 把这个过程逆向工程了:模型学到的是一个离散傅里叶算法—— 把数字嵌入到单位圆上的若干频率,用三角恒等式做加法,再读出。 关键是他们定义了"进度度量"(progress measure), 发现在这些度量下转变是渐进的:电路早就在悄悄形成, 只是测试准确率这个指标在电路完成前一直读作 0。

又是同一个故事:底层连续,指标离散。 但和 §3.2 不同的是,这里底层确实发生了结构性的变化—— 不是能力线性变强,而是一个新的算法被装配起来了。

3.5 这一节的结论

说法 判定
参数规模到某个阈值会突然涌现新能力 大部分是度量假象
损失随规模平滑幂律下降 稳健事实,跨 7 个数量级
训练过程中会形成新的内部电路,且转变很快 真的,且有因果证据
这些转变在数学上是相变(非解析) 不是,有限系统不可能
大模型的涌现是"量子的" 完全错误,见 §6

4. 蛋白质与 DNA:分子层面有没有智能

这是本文最容易失控的一节,所以先划一条线: 单个蛋白质、单条 DNA 没有智能。但它们确实在做计算,而且是可以精确定义的计算。

4.1 Levinthal 佯谬:和梯度下降是同一个解法

1969 年 Levinthal 提出了这个佯谬。一条 100 残基的多肽, 每个骨架二面角粗略取 3 个构象,总状态数

\[3^{99} \approx 1.7 \times 10^{47}\]

即使每 \(10^{-13}\,\mathrm s\) 试一个,穷举也要 \(10^{27}\) 年——远超宇宙年龄。 可实际折叠只需要微秒到秒。

解决方案是 Bryngelson & Wolynes(1987)的漏斗地形与最小挫败原理: 能量地形不是随机崎岖的,而是整体向天然态倾斜的漏斗。 蛋白质不"搜索"构象空间,它沿着地形往下滚。 局域的、贪心的移动就足够了,因为地形本身被进化雕刻成了有全局偏置的形状。

把这段话里的"构象"换成"参数"、"天然态"换成"低损失区"、 "进化雕刻"换成"架构 + 数据分布",你得到的就是深度学习为什么能训得动的标准解释。 参见 高中背到头秃的排列组合…: 两个领域面对的是同一个组合爆炸,用的是同一个逃生口——地形不是随机的。

这是本文里我认为最扎实的一条跨领域对应。它不是比喻, 两边的数学对象都是"高维空间上的非凸地形 + 一阶局域下降"。

4.2 折叠是自发的,但不可推导

Anfinsen(1961,1972 年诺贝尔化学奖)证明: 核糖核酸酶变性后去掉变性剂,能自发折回天然构象且恢复活性。 结论是热力学假说:天然构象所需的全部信息都编码在氨基酸序列里。

这是标准的弱涌现:信息全在微观里,但你盯着序列看一辈子也推不出结构。

有意思的是 2020 年之后的事:AlphaFold2(Jumper et al., Nature 2021) 在 CASP14 上把预测精度做到了实验级(中位 GDT_TS 92.4),AlphaFold3(2024)扩展到复合物。 但它没有解出折叠的物理——它是从 PDB 里的十几万个结构学出来的统计映射。

这本身是一个关于涌现的数据点: 当微观推导不可行时,宏观规律仍然可能是可学的。 这恰好是大模型在做的事——不推导,只拟合, 参见 万能函数模拟器。

而"一个残基改变可以彻底废掉功能"这件事(比如镰刀型贫血症只是 β 珠蛋白第 6 位 谷氨酸换成缬氨酸),说明功能是整体折叠的性质,不属于任何单个残基。 这是教科书级的 more is different。

4.3 分子确实在计算:三个具体机制

(a)别构效应 = 逻辑门。 Monod、Wyman、Changeux 1965 的 MWC 模型: 蛋白在两个构象态之间平衡,配体结合改变平衡。 血红蛋白结合氧的曲线是 S 形(Hill 系数约 2.8)而不是双曲线—— 这是协同性,四个亚基互相"通气"。一个 S 形响应函数就是一个软阈值门。

(b)lac 操纵子 = 一个真实的布尔电路。 Jacob & Monod 1961(1965 年诺奖):

\[\text{转录} = (\text{有乳糖}) \wedge \lnot(\text{有葡萄糖})\]

阻遏蛋白实现 \(\lnot\),CAP–cAMP 实现另一个输入,两者组合出 AND-NOT。 这不是类比,这就是一个物理实现的逻辑门。

(c)动力学校对(kinetic proofreading)——本文最好的一个巧合。

DNA 复制的错误率约 \(10^{-8} \sim 10^{-10}\),翻译的错误率约 \(10^{-4}\)。 但正确与错误底物的结合自由能差只够支撑 \(10^{-2}\) 量级的区分。 平衡态热力学根本给不出这个精度。

1974 年 J.J. Hopfield 在 PNAS 上给出了解答(Ninio 1975 独立提出): 在识别和产物形成之间插入一个不可逆的、耗 ATP 的中间步骤, 让错误底物有额外的机会解离。代价是能量,收益是错误率被平方:

\[f_{\text{校对后}} \approx f_{\text{平衡}}^{\,2}\]

这是分子在用能量换信息,是一个严格的非平衡计算过程。

而这个 J.J. Hopfield,就是 1982 年提出 Hopfield 网络、 2024 年和 Hinton 一起拿诺贝尔物理学奖的那个人。 同一个人,先在分子层面定义了"生物如何用耗散换取精度", 八年后在网络层面定义了"能量地形如何存储记忆"。 这条线本站另有一篇专门讲:从玻尔兹曼到辛顿。

4.4 DNA 不是蓝图:C 值悖论

如果复杂度写在序列里,那么基因组越大越复杂。事实完全不是这样。

物种 基因组大小 蛋白编码基因数
人 \(\approx 3.1\) Gb \(\approx 20{,}000\)
秀丽隐杆线虫(959 个体细胞) \(\approx 100\) Mb \(\approx 20{,}000\)
Paris japonica(一种重楼) \(\approx 149\) Gb —

人和线虫的蛋白编码基因数基本一样。一株植物的基因组是人的 50 倍。 这就是 C 值悖论:基因组大小与生物复杂度不相关。

复杂度不在序列长度里,在调控网络里:

  • 同一段 DNA 在不同细胞里被读成完全不同的东西;
  • 你身上每一个细胞的基因组完全相同,但有几百种细胞类型;
  • 差别来自基因调控网络(GRN)落在了不同的吸引子上。

Waddington 1957 年的"表观遗传地形"就是这个图像:小球从山顶滚下, 分岔选择决定它最终落进哪条沟。Kauffman 的随机布尔网络把它形式化为 "细胞类型 = 动力系统的吸引子"(这仍是一个有影响力的假说,不是定论)。

这是最干净的涌现例子:微观规格完全相同(同一份 DNA), 宏观状态有几百种(细胞类型),由动力学和历史选择。 信息不在参数里,在参数决定的那个动力系统的相空间结构里。

4.5 Turing 1952:生物学里真正的对称破缺

图灵最后一篇论文 The Chemical Basis of Morphogenesis(1952)问的是: 一个完全均匀的受精卵,怎么长出有花纹、有手指、有前后轴的东西?

他的答案是反应–扩散方程:

\[\partial_t u = f(u,v) + D_u \nabla^2 u, \qquad \partial_t v = g(u,v) + D_v \nabla^2 v\]

反直觉的地方在于:扩散通常抹平差异,但在这里它制造差异。 当"激活剂扩散慢、抑制剂扩散快"(\(D_v \gg D_u\))时, 均匀态对某个波长的扰动变得不稳定,系统自发长出周期性图案。

这是货真价实的自发对称破缺——平移对称的初态, 自发选出了一个特征波长 \(\lambda\) 和一个相位。它有分岔点,有序参量, 数学结构和 §2.1 的铁磁相变是同一类。

实验上也被证实了:Castets 等 1990 年在 CIMA 反应里第一次做出了真正的 Turing 斑图; Sheth 等 2012 年在 Science 上给出证据,小鼠的指头就是一个 Turing 图案, Hox 基因的作用是调节它的波长(敲掉后指头变多变细)。

4.6 直接回答:分子层面有没有智能涌现

分开回答:

问题 回答
单个蛋白质会思考吗? 不会。
分子在做信息处理吗? 是,而且可精确定义:逻辑门、放大器、纠错、阈值
有没有"超出编码信息"的东西冒出来? 没有(Anfinsen);有的是"无法从编码推导"的东西
细胞层面呢? 细胞有记忆、有决策、有适应,这些有明确机制
有人主张细胞有"基础认知" 是(Levin 等的生物电研究),这是活跃但有争议的领域,别当定论引用
那智能在哪一层冒出来? 目前有证据的最低层级是神经网络,不是分子

我的判断是:分子层面有计算,没有智能。 计算和智能之间隔着的东西,正是这篇文章反复在说的那三样—— 大 \(N\)、可塑的耦合、以及一个持续施加的选择压力。 核糖体是一台读带子的机器,它精确、可靠、可编程,但它没有目标函数。


5. 三者共有的四个零件

把 §2.6 的模板套到三个领域上:

零件 量子多体 生物 大模型
① 大 \(N\) \(10^{23}\) 个电子 \(10^2\) 残基 / \(10^{10}\) 碱基 \(10^{11}\) 参数
② 非线性耦合 交换作用、库仑 疏水塌缩、别构、调控 注意力(token 之间乘性耦合)
③ 尺度分离 能隙 / 关联长度 折叠时标 vs 化学时标 ?这一条最弱
④ 选择原则 自由能极小 自然选择 SGD 极小化交叉熵

5.1 ② 必须是"乘性"的,否则什么也不会发生

如果单元之间只是相加,那么 \(N\) 再大也只得到统计涨落(中心极限定理), 不会有新东西。涌现需要耦合项。

值得注意的是三个领域的耦合都是成对乘性的:

\[\underbrace{-J\, s_i s_j}_{\text{Ising}} \qquad \underbrace{\text{配体结合改变另一个位点的亲和力}}_{\text{别构}} \qquad \underbrace{\operatorname{softmax}(q_i^{\mathsf T} k_j / \sqrt{d})}_{\text{注意力}}\]

注意力做的事情,在结构上就是"让第 \(i\) 个位置的表示依赖于它和第 \(j\) 个位置的乘积"。 这是 Transformer 相比 MLP 的关键差异,也是它能表达长程组合结构的原因。

5.2 ④ 是最被忽略的那个,也是最重要的

科普文章讲涌现时几乎只讲 ①:"规模大了就会涌现"。这是错的。

把 \(10^{23}\) 个原子随机堆在一起,你得到的是一团气体,不是超导体。 超导需要的是自由能极小这个选择原则,把系统推到 BCS 基态上去。 随机初始化一个 \(10^{11}\) 参数的 Transformer,你得到的是噪声。

规模提供的是可能性空间,选择原则决定你实际落在哪。

而三个领域的选择原则强度差别巨大:

选择原则 作用时长 目标
物理 自由能极小 瞬时(弛豫时间) 由哈密顿量给定,不可改
生物 差异化繁殖 \(\approx 4 \times 10^9\) 年 无显式目标,只有"活下来"
大模型 SGD 极小化 CE \(10^5 \sim 10^6\) 步 人写的,显式的

最后一格是大模型和另外两者最本质的分歧: 它的宏观行为是被"设计"出来的,不是被"发现"的。 物理学家发现超导,生物学家发现折叠, 而大模型的能力是我们写下一个损失函数,然后去优化它得到的。

顺带说,进化和 SGD 的差别可以说得更精确: 进化没有梯度,它是零阶方法(类似进化策略), 每一代只能靠采样估计改进方向,所以样本效率比 SGD 差若干个数量级。 SGD 有反向传播,能一次拿到全部参数的偏导。 这就是为什么 40 亿年才做出人脑,而我们几个月能训一个模型。

5.3 ③ 是大模型最缺的一环,也是最值得做的方向

物理学之所以能把涌现讲清楚,全靠 RG 提供的尺度分离(§2.4)。 生物学有部分的尺度分离(分子 → 通路 → 细胞 → 组织)。

大模型目前没有。我们没有一个"粗粒化 Transformer"的操作, 没有算符相关/无关的分类,没有不动点。 机械可解释性(mechanistic interpretability)在做的事—— 从权重里找出电路、特征、叠加(superposition)—— 本质上就是在手工寻找那个粗粒化描述。

§2.5 那个面积律的伏笔在这里收:

  • 量子多体:希尔伯特空间是 \(2^N\) 维,但物理态因为面积律住在低维流形上;
  • 语言:长度 \(T\) 的 token 序列有 \(V^T\) 种,但合法的自然语言住在极小的一角;
  • 蛋白质:\(20^{L}\) 条序列,但能稳定折叠的只是极小一撮。

三个领域都在对抗同一个指数爆炸,都靠"真实态只占一个低维子集"逃生。 量子那边这件事有定理(面积律、MPS 表示定理); 另外两边目前只有经验证据。谁把后两者的"面积律"证出来, 谁就拿到了这个领域的 RG。


6. 类比在哪里断掉

前面五节建立了对应关系,这一节负责拆掉不成立的部分。不说清楚就会变成玄学。

1. 大模型和量子力学没有任何关系。 Transformer 是纯经典的浮点运算。没有叠加、没有纠缠、没有 \(\hbar\)、没有波函数坍缩。 "大模型的涌现是量子效应""意识来自量子相干"这类说法,在大模型这一侧是明确错误的。 本文借用的是量子多体物理发展出的涌现方法论(对称破缺、序参量、RG、普适类), 不是量子力学本身。这两件事必须分开。

2. 大模型没有热力学极限,所以不可能有数学意义上的相变。 §2.1 已经证明:有限 \(N\) 的配分函数是解析的。 \(10^{12}\) 参数在数学上和 \(10\) 参数一样是"有限"。 所谓"涌现临界点"没有非解析性,只有陡峭。

3. 大模型没有哈密顿量,没有能量守恒,没有平衡态。 训练是一个非平衡的、有外部驱动的优化过程, 不是系统弛豫到自由能极小。唯一严格成立的对应在推理端: \(\operatorname{softmax}(\ell/T)\) 精确等于 \(e^{-E/T}/Z\)(取 \(E_i = -\ell_i\))—— 这条已经在 从玻尔兹曼到辛顿 里讲透了, 但那是分布形式的同构,不是物理过程的同构。

4. 大模型里没有 Landau 意义上的序参量。 权重空间确实有对称性(神经元置换、缩放不变),但那是规范冗余, 不是物理自由度,破缺它不产生任何可观测后果。 induction head 的"有 / 无"勉强算一个序参量,但它没有对应的守恒律或 Goldstone 模式。

5. "蛋白质折叠 = 梯度下降"这条类比有边界。 两者都是高维非凸地形上的局域下降,这部分成立。 但蛋白质的地形是固定的(由物理和序列决定), 而神经网络的损失地形随数据分布变化,且训练同时在改变地形本身的有效形状(如 BN、残差)。 另外蛋白质折叠是布朗动力学 + 热噪声,天然带温度; SGD 的"噪声"来自 minibatch 采样,其协方差结构和热噪声不同(各向异性、与梯度相关)。

6. C 值悖论不能推出"参数量不重要"。 生物学的教训是"复杂度在调控结构里而不在序列长度里", 但这不等于"大模型的参数量不重要"——scaling law 是硬的经验事实。 正确的类比是:基因组 ≈ 参数,调控网络 ≈ 架构 + 训练过程。 两者都重要,但生物学告诉我们不要只看第一个数字。

7. 别把 Wei 2022 和 Schaeffer 2023 讲成"谁赢了"。 Schaeffer 等证明的是"尖锐性是度量假象", 不是"大模型没有随规模变强"。能力确实随规模上升, 只是上升是平滑的、可外推的——这对安全和预测其实是好消息。

8. 分子计算 ≠ 分子智能。 §4.3 里所有例子都是固定电路:lac 操纵子不会学习新的逻辑, 核糖体不会改变自己的读码方式。可塑性发生在进化的时间尺度上,不在个体分子上。 把"会计算"说成"有智能",是这个领域最常见的滑坡。


7. 一张对照表

层次 量子多体 蛋白质 / DNA 大模型
微观定律 薛定谔方程 分子力场、化学动力学 前向传播 + 反向传播
组合爆炸 \(2^N\) 维希尔伯特空间 \(3^{99}\) 构象 / \(20^L\) 序列 \(V^T\) token 序列
逃生口 纠缠面积律 → MPS 漏斗地形(最小挫败) 数据流形低内蕴维数
有没有定理 有 无,只有经验 无,只有经验
选择原则 自由能极小 自然选择 SGD 极小化交叉熵
宏观新变量 序参量、准粒子 折叠态、细胞类型 电路、特征方向
对称破缺 Ising / BCS / Higgs Turing 失稳(1952) 无(只有规范冗余)
粗粒化理论 RG,有不动点 部分(层级模块化) 没有(mech interp 在手工找)
普适性证据 临界指数跨物质相同 折叠速率与接触序相关 scaling law 跨架构稳定
真·相变 有(\(N\to\infty\)) 有(Turing 分岔) 无(参数轴)/ 有(训练轴,induction head)
尖锐性来源 自由能非解析 动力系统分岔 多数来自不连续度量
关键人物 Anderson、Wilson Anfinsen、Hopfield(1974) Kaplan、Olsson、Schaeffer

8. 如果只记三句话

1. 涌现的强度由 \(N\) 和"选择原则"共同决定,不是只由 \(N\) 决定。 规模给的是可能性空间,选择原则(自由能 / 自然选择 / 损失函数)决定你落在哪。 "参数量到了就会涌现"是把四个零件里的一个当成了全部。

2. 严格意义上的相变要求 \(N \to \infty\),所以大模型不可能有。 你在指标曲线上看到的台阶,先检查是不是 exact match 之类的不连续度量造出来的。 换成 log-prob 再看一次——多数情况下它会变平。 真正的结构性转变发生在训练时间轴上(induction head、grokking),那些是真的。

3. 分子层面有计算,没有智能;而"计算"这件事在分子层面是精确的,不是比喻。 lac 操纵子是逻辑门,血红蛋白是阈值函数,动力学校对是用 ATP 换错误率的平方下降。 但它们都是固定电路。智能需要的是可塑的耦合 + 持续的选择压力, 目前有证据的最低层级是神经网络,不是蛋白质。

最后一句题外话。这三个领域里,物理学是唯一一个把涌现讲清楚的—— 因为它有 RG,能证明微观细节在粗粒化下指数衰减。 生物学和深度学习都还没有自己的 RG。 机械可解释性在做的,本质上就是手工去找那个粗粒化描述; 如果哪天有人给出了 Transformer 的重整化群流和不动点, "涌现"这个词在 AI 里才会第一次有它在物理学里那样的分量。


参考文献

涌现与凝聚态

  • P.W. Anderson, More Is Different, Science 177, 393 (1972)
  • C.N. Yang & T.D. Lee, Statistical Theory of Equations of State and Phase Transitions, Phys. Rev. 87, 404 (1952)
  • R.B. Laughlin, Phys. Rev. Lett. 50, 1395 (1983);de-Picciotto et al., Nature 389, 162 (1997)(\(e/3\) 散粒噪声)
  • X.-G. Wen, Quantum Field Theory of Many-Body Systems(拓扑序)
  • K.G. Wilson, Nobel Lecture 1982(重整化群与普适类)
  • J. Eisert, M. Cramer, M.B. Plenio, Area laws for the entanglement entropy, RMP 82, 277 (2010)

大模型的涌现与 scaling

  • J. Wei et al., Emergent Abilities of Large Language Models, TMLR (2022)
  • R. Schaeffer, B. Miranda, S. Koyejo, Are Emergent Abilities of Large Language Models a Mirage?, NeurIPS (2023)
  • J. Kaplan et al., Scaling Laws for Neural Language Models (2020)
  • J. Hoffmann et al., Training Compute-Optimal Large Language Models(Chinchilla, 2022)
  • Y. Bahri, E. Dyer, J. Kaplan, J. Lee, U. Sharma, Explaining Neural Scaling Laws, PNAS 121 (2024)
  • A. Maloney, D.A. Roberts, J. Sully, A Solvable Model of Neural Scaling Laws (2022)
  • D.A. Roberts, S. Yaida, B. Hanin, The Principles of Deep Learning Theory, CUP (2022)
  • C. Olsson et al., In-context Learning and Induction Heads, Anthropic (2022)
  • A. Power et al., Grokking (2022);N. Nanda et al., Progress Measures for Grokking via Mechanistic Interpretability, ICLR (2023)

生物

  • C. Levinthal, How to Fold Graciously (1969)
  • C.B. Anfinsen, Principles that Govern the Folding of Protein Chains, Science 181, 223 (1973)
  • J.D. Bryngelson & P.G. Wolynes, PNAS 84, 7524 (1987)(漏斗地形 / 最小挫败)
  • J.J. Hopfield, Kinetic Proofreading, PNAS 71, 4135 (1974);J. Ninio, Biochimie 57, 587 (1975)
  • J. Monod, J. Wyman, J.-P. Changeux, JMB 12, 88 (1965)(MWC 别构模型)
  • F. Jacob & J. Monod, JMB 3, 318 (1961)(lac 操纵子)
  • A.M. Turing, The Chemical Basis of Morphogenesis, Phil. Trans. R. Soc. B 237, 37 (1952)
  • V. Castets et al., PRL 64, 2953 (1990)(首个实验 Turing 斑图)
  • R. Sheth et al., Hox Genes Regulate Digit Patterning, Science 338, 1476 (2012)
  • S.A. Kauffman, The Origins of Order (1993)(随机布尔网络与吸引子)
  • J. Jumper et al., Highly accurate protein structure prediction with AlphaFold, Nature 596, 583 (2021)

本站相关