随机性不是噪声,是搜索工具:从 GPT 的高维搜索到物理世界的状态空间
“随机性不是噪声,是搜索工具。”这句话并不是说噪声总是有用,也不是说随机乱试比推理更高级。它说的是一件更精确的事:当系统不知道最优路径、梯度不可靠,或者容易困在局部最优时,受约束的随机扰动可以把它带到原本到不了的区域。 上一篇文章《GPT 是更高级的“万能谷歌搜索”:从关键词到高维空间的搜索进化史》把 GPT 放进了一条搜索技术的演化线上:关键词搜索在文档库里找已有页面,语义搜索在向量空间里找相近意义,GPT 则根据上下文,在高维表示空间中逐步生成一个答案。
这篇文章补上那条线缺少的一半:搜索空间从哪里来,搜索又是怎样发生的?
答案分成两部分:
- 神经网络学习出一个有结构的高维空间,决定“哪里更可能有好答案”;
- 概率分布与随机采样决定“这一次沿哪条路走”。 前者提供地图,后者提供探索。
1. 先把“搜索”说清楚
我们平常把很多不同的过程都叫搜索:Google 查网页、A* 找路径、梯度下降找参数、GPT 写下一句话、分子折叠成稳定结构、生物演化出眼睛。它们并不完全相同,但都可以用四个问题描述:
| 要素 | 问题 | 例子 |
|---|---|---|
| 状态空间 | 有哪些可能状态? | 网页、棋局、token 序列、蛋白质构象 |
| 评价或偏置 | 哪些状态更可能、代价更低或适应度更高? | 排名分数、能量、损失、奖励、繁殖成功率 |
| 转移规则 | 怎样从当前状态到下一个状态? | 点击链接、落子、采样 token、分子碰撞、突变 |
| 探索机制 | 怎样避免永远走同一条路? | 随机采样、温度、重启、扩散、突变与重组 |
这四项齐了,一个过程才具有“搜索”的结构。
但还要加一个重要限定:搜索不一定意味着搜索者心里有目标。 工程算法通常有显式目标,比如最小化损失;动物觅食也有功能性目标。物理系统却未必“想找到”任何东西。气体趋于平衡,不是分子知道平衡在哪里,而是微观动力学、能量约束和状态数共同造成了宏观结果。
所以,把物理过程称为搜索,最好理解为一种观察者语言:
系统在可达状态空间中演化;某些状态因为能量、熵、动力学或边界条件而更容易被访问、更常停留,或者更稳定。
它有搜索的数学结构,却不必有搜索的主观意图。
2. 随机性什么时候是噪声,什么时候是工具
随机性本身没有价值。关键在于它与结构如何配合。
2.1 只有随机,没有评价:漫无目的
如果在一个巨大空间里均匀乱试,而没有任何反馈,随机性只是随机游走。让猴子敲键盘当然最终可能写出莎士比亚,但等待时间大到没有实际意义。
2.2 只有评价,没有随机:容易困住
如果系统永远选择眼前最优的一步,它会很快下降,却可能停在局部最低点。Hopfield 网络的确定性更新就是这样:能量单调下降,但一旦落入伪记忆,就再也出不来。
2.3 结构加随机:探索与利用
真正有用的是有偏的随机性:
- 好方向获得更高概率;
- 坏方向不是绝对禁止,只是概率较低;
- 随着搜索推进,可以逐渐降低随机程度。
玻尔兹曼分布正是这种机制:
低能量状态概率高,但只要温度 \(T>0\),较高能量状态仍有机会被访问。系统因此可以暂时“上山”,跨过能垒,再落进更深的谷底。
这就是模拟退火的核心:
- 高温时广泛探索;
- 降温时逐步偏向好状态;
- 低温时稳定在少数候选上。
所以更准确的表述不是“随机性不是噪声”,而是:
未经约束的随机性通常是噪声;被评价函数塑形、被温度调节、能扩展可达范围的随机性,才是搜索工具。
3. Google、语义搜索与 GPT:搜索对象发生了什么变化
传统搜索引擎和 GPT 的共同点,是都在从巨大候选空间中压缩不确定性;区别在于候选空间的单位不同。
3.1 关键词搜索:在已有文档中检索
Google 的经典问题是:给定查询 \(q\),从已索引文档集合 \(D\) 中找出排序靠前的文档:
候选答案必须预先存在。搜索返回的是位置或引用。
3.2 语义搜索:在表示空间中找邻居
嵌入模型把查询和文档映射到向量空间,搜索变成寻找邻近点:
关键词可以不同,只要语义方向相近,仍能被找到。这里升级的是坐标系,但候选仍是已有文档。
3.3 GPT:在序列空间中生成路径
GPT 面对的候选不是一批现成文档,而是所有可能的 token 序列。给定上下文 \(x_{<t}\),模型为下一个 token 计算条件分布:
$$ p(x_t\mid x_{<t})=\operatorname{softmax}!\left(\frac{\ell_t}{T}\right). $$ 整段回答的概率由逐步条件概率相乘得到:
因此 GPT 的“搜索”不是一次性在数据库中命中答案,而是在序列空间中一步一步修建路径。每生成一个 token,前缀改变,下一步的概率地形也随之改变。
这也是“万能谷歌搜索”这个比喻成立和失效的地方:
- 成立:两者都在巨大候选空间中利用学习到的相关性压缩搜索范围;
- 失效:Google 返回已存在的对象,GPT 会组合出训练集中从未完整出现过的新序列;
- 更精确的说法:GPT 是一个学习了条件概率地形的序列生成器,生成过程可以被看作受概率引导的路径搜索。
4. 两篇文章的连接点:表示空间是地图,随机性是走法
“高维空间搜索”容易让人误以为,GPT 在回答时真的运行了某个传统搜索算法,维护候选队列、回溯分支、比较完整答案。普通自回归采样并不是这样。
一次标准生成只有两步:
- 前向计算得到 logits;
- 从 softmax 分布中选择下一个 token。 但训练把海量语言结构压进了模型参数,使一次前向计算就能给出局部概率地形。于是大量“搜索工作”已经被摊销到了训练阶段。推理时不需要重新遍历全部文本,也不需要显式枚举所有句子。
可以把二者的关系概括成:
| 层次 | 作用 |
|---|---|
| 训练 | 从数据中学习一张高维概率地图 |
| logits | 给当前位置附近的方向打分 |
| softmax | 把分数变成可采样的概率 |
| 温度、top-k、top-p | 调节探索范围 |
| 采样 | 选择一条具体生成路径 |
若每一步都取最大概率 token:
$$ x_t=\arg\max_i \ell_{t,i}, $$ 模型只有“利用”,没有“探索”。输出稳定,但容易过早锁定一种措辞、结构或推理方向。
若按分布采样:
次优方向获得有限机会。同一个问题可以产生不同类比、不同证明路线和不同程序结构。这种差异不是模型忘了答案,而是模型从同一张概率地图上走了不同路径。
温度控制这种探索的强弱:
- \(T\to0\):接近贪心,只走最陡的下坡路;
- 适中的 \(T\):保留少量分支,兼顾稳定性与新颖性;
- \(T\to\infty\):趋向均匀,地图的结构被抹平,输出退化为噪声。
5.2 Beam search:显式保留多条路径
Beam search 同时保留若干高分前缀,再逐步扩展和淘汰。这已经接近传统图搜索:有候选集、有累计分数、有剪枝。
但 beam 太窄会错过好答案,太宽又代价高;而且最高概率文本不一定是最有用、最真实或最有创造力的文本。
5.3 推理时扩展:搜索候选答案并验证
当系统生成多条思路、调用工具、执行代码、检查结果、根据反馈修改答案时,搜索就变得更显式:
$$ \text{提出候选}\rightarrow\text{执行或验证}\rightarrow\text{打分}\rightarrow\text{扩展或淘汰}. $$ 因此,随机性与高维搜索不是两个比喻,而是同一机制的两层:
模型参数塑造搜索空间中的地形;随机采样决定一次运行穿过这片地形的轨迹。
5. GPT 真的在“搜索答案”吗
要分三种情况。
5.1 普通采样:隐式、局部、单向的搜索
普通 GPT 生成通常不回头。某一步选错后,后续只能在错误前缀上继续。这更像有概率偏置的单向行走,而不是完整的全局搜索。
称它为搜索,是因为它在候选序列空间中逐步选择;称它为严格的搜索算法,则容易夸大。 插队 这时随机性负责制造多样候选,验证器负责提供选择压力。只有前者是胡思乱想,只有后者则无物可选。两者结合才形成有效搜索。
这与进化算法的结构非常接近:变异产生差异,选择积累改进。
6. 物理世界里的“搜索”对应什么
对于物理世界,最一般的答案是:
搜索对应系统在相空间或状态空间中的时间演化;所谓“找到”,对应进入高概率、低自由能、动力学稳定或能长期存续的区域。
这里至少有四类不同机制,不能混为一谈。
6.1 热运动:在能量地形上探索
微观粒子不停碰撞,热涨落使系统不只停在一个构型。若系统与热库平衡,状态概率由玻尔兹曼因子决定:
温度越高,系统越容易越过能垒;温度越低,越集中于低能态。化学反应、磁性材料翻转、晶体缺陷迁移,都可以用“在能量地形上探索”来理解。
但这不是纯随机。运动受守恒律、相互作用和边界条件约束;随机性只是来自我们对巨大微观自由度的粗粒化描述,或者来自量子测量等更基础层面。
6.2 扩散:用随机游走覆盖空间
花粉颗粒的布朗运动、气味分子的传播、细胞内分子的输运,都可近似为随机游走。单个粒子的路径杂乱无章,但群体尺度上服从稳定的扩散方程:
随机性在这里产生覆盖能力:没有中央规划,粒子却能逐渐探索可达空间。许多生物觅食策略也利用类似机制,在局部信息不足时通过随机移动发现资源。
6.3 自组织与能量最小化:找到稳定结构
蛋白质折叠、晶体生长、分子自组装常被描述为寻找低自由能结构。这个说法有用,但不能理解成系统穷举了所有构象。
真实过程受到动力学路径限制:
- 有些低能态因能垒太高而到不了;
- 有些亚稳态会停留很久;
- 局部相互作用会把搜索空间强烈剪枝;
- 环境持续供能时,系统甚至不趋于热平衡。
所以物理世界的“搜索算法”不是枚举,而是动力学本身。自然定律决定哪些转移可达,热涨落决定偶尔跨越哪些障碍,耗散决定哪些结构能够稳定下来。
6.4 生物演化:随机变异加非随机选择
演化是最接近算法搜索的自然过程之一:
| 搜索要素 | 演化中的对应物 |
|---|---|
| 状态空间 | 基因型、表型及生态关系 |
| 变异算子 | 突变、重组、基因流动 |
| 评价 | 在具体环境中的繁殖成功率 |
| 保留机制 | 遗传与选择 |
常见误解是“进化是随机的”。更准确地说:变异包含随机成分,选择并不随机。 变异负责提供新候选,环境负责让某些候选留下更多后代。 不过演化没有预先设定的全局终点。适应度地形会随环境、其他物种和种群自身变化;它寻找的是当下可延续的局部解,而不是宇宙给定的最终最优解。
7. 物理世界、演化与 GPT 的同构
把三者并排,可以看出“随机性作为搜索工具”的共同结构:
| 系统 | 状态 | 地形或偏置 | 随机来源 | 保留机制 |
|---|---|---|---|---|
| 热力学系统 | 微观构型 | 能量与熵 | 热涨落 | 平衡分布、亚稳态 |
| 生物演化 | 基因型与表型 | 环境相关适应度 | 突变与重组 | 遗传和自然选择 |
| GPT 生成 | token 前缀 | 条件概率 logits | 概率采样 | 前缀被写入上下文 |
| 带验证器的 AI | 候选解与推理轨迹 | 奖励、测试、证明检查 | 多次采样与分支 | 选择、回溯、更新 |
共同模板是:
但差异同样重要:
- 物理系统遵循动力学,不以“解题”为目的;
- 演化有局部选择压力,但没有预见和终极目标;
- GPT 的概率地形来自人类数据与训练目标;
- AI 系统可以外接显式验证器,主动回溯,而普通自然过程没有统一的全局裁判。
因此不能说“宇宙就是一个 GPT”,也不能说“GPT 复刻了自然”。更克制也更准确的结论是:它们在数学上反复使用同一种解决巨大组合空间的策略:不穷举全部可能,而让局部规则、概率偏置和选择压力共同塑造访问路径。
8. 为什么随机性会带来创造性
创造性经常被误解为无约束的新奇。真正有价值的创造通常满足两个条件:
- 候选必须偏离最常见答案;
- 偏离后仍要满足语义、逻辑、审美或功能约束。
低温贪心只会反复走概率最高的道路,容易正确却平庸。高温均匀采样能制造新奇,却容易失去连贯性。创造性位于两者之间:在模型已经学会的结构内,给低概率但合理的组合一次出现机会,再用评价机制筛选。
这也是为什么“多采样一次”有时比“把同一个答案想得更久”更有效。第一次输出可能落在一个常见局部模式;重新采样相当于从同一问题出发,访问另一个吸引域。 不过随机性不会自动产生真理。对于代码、数学和事实问题,候选多样性之后必须接验证:
- 代码要运行测试;
- 数学要检查推导或用形式化工具验证;
- 事实要查询可靠来源;
- 规划要在环境中执行并观察反馈。
一句话:
随机性负责提出“也许”,验证负责决定“是不是”。
9. 随机性不是万能药
“随机性是搜索工具”成立,需要满足几个条件。
9.1 地形必须有信息
如果所有候选奖励都相同,随机采样只能在平面上乱走。奖励恒为零时,策略梯度的 advantage 也恒为零:
这时需要先设计能区分进展的反馈,而不是提高温度。
9.2 随机尺度必须合适
扰动太小,跨不过能垒;扰动太大,已有结构被破坏。模拟退火、Langevin dynamics、进化策略和 token 采样都在处理同一个问题:探索尺度如何随阶段变化。
9.3 必须有保留好结果的机制
随机变化若不能被记忆、选择或验证,成功也会立即丢失。自然选择依靠遗传,优化算法依靠参数更新,搜索算法依靠候选队列,智能体依靠外部记忆和环境反馈。
9.4 搜索空间的表示比搜索次数更重要
在错误坐标系里随机一万亿次,可能不如换一个表示。蛋白质若逐原子任意乱动,空间大得不可处理;真实物理约束让大部分运动相关联。GPT 也不是在所有字符序列中均匀乱试,而是在训练形成的语言流形附近采样。
真正强大的不是“更随机”,而是:
10. 一个统一视角:智能是对可能性的管理
从这个角度看,Google、GPT、物理系统和生物演化都在处理同一个根本困难:可能性太多,无法穷举。 - Google 用索引和排序压缩文档空间; - 向量搜索用表示学习压缩语义空间; - GPT 用条件概率压缩序列空间; - 热力学用能量与熵塑造状态分布; - 演化用变异产生候选,用选择积累适应; - 科学研究用猜想扩展空间,用实验淘汰错误。
它们都不是“知道全部答案后再挑一个”。它们依赖结构,让少数路径比其他路径更值得走;又保留一定随机性,使系统不会永远被当前知识封闭。
因此,“随机性不是噪声,是搜索工具”真正值得保留的含义是:
当未知空间大到无法枚举时,理性不等于消灭随机性。更高级的理性,是给随机性一张有结构的地图、一个可调的尺度和一套能保留好结果的选择机制。
上一篇文章讲的是地图如何从关键词升级为高维表示;这篇文章讲的是有了地图之后,系统如何真正走起来。
物理世界里的对应物,不是某个藏在宇宙背后的搜索框,而是状态空间中的演化本身:热涨落提供探索,能量与熵提供偏置,动力学决定可达路径,稳定性与选择决定什么能够留下。 GPT 里的对应物则更直接:logits 是局部地形,softmax 是玻尔兹曼形式,temperature 是探索尺度,采样是一条具体路径,而验证器决定这条路径只是新奇,还是确实通向答案。
随机性单独存在时是噪声。
随机性被结构引导、被反馈筛选、被记忆积累时,才成为搜索。
延伸阅读
- Ludwig Boltzmann, Über die Beziehung zwischen dem zweiten Hauptsatze der mechanischen Wärmetheorie und der Wahrscheinlichkeitsrechnung, 1877.
- N. Metropolis et al., “Equation of State Calculations by Fast Computing Machines,” 1953.
- S. Kirkpatrick, C. D. Gelatt, M. P. Vecchi, “Optimization by Simulated Annealing,” 1983.
- D. E. Goldberg, Genetic Algorithms in Search, Optimization, and Machine Learning, 1989.
- D. Silver et al., “Mastering the Game of Go without Human Knowledge,” 2017.
- 站内相关文章:《GPT 是更高级的“万能谷歌搜索”:从关键词到高维空间的搜索进化史》;《从玻尔兹曼到辛顿:从 \(S=k\log W\) 到 softmax 的一条线》。