为什么AI,数学家顶尖的人才总是出现在欧美?原因出现在这!

2026-07-13 · Steve Chan

"教育不是灌输,而是点燃火焰。" —— 苏格拉底

"我们的应试教育最大的失败,不是学生记不住公式,而是从不告诉他们:这个公式是哪个孤独的灵魂、在哪个动荡的世纪、为了回答什么真实的问题,呕心沥血几十年才写下的。"

一个用 Python + PyTorch + Matplotlib/Manim 来"重走数学发现之路"的可视化项目。 不是再背一遍公式,而是沿着历史的脚印,亲手推导一次:从古巴比伦的泥板,到牛顿写下 \(\dot{x}\),到伽罗瓦决斗前夜的手稿,到工业革命蒸汽机背后的傅里叶级数。


🎯 项目动机:为什么我们学了 12 年数学却讨厌数学?

中学数学老师最常见的一句话是:

"你以后买菜会用求根公式吗?"

这是数学教育最惨烈的一次自我背叛。它把人类两千年最壮丽的智识冒险,矮化成了"加减乘除买菜论"。

真实的数学史不是这样的:

  • 二次方程的求根公式刻在公元前 1800 年的巴比伦泥板上 —— 那是为了分配土地计算粮仓
  • 三次方程的解法引发了 16 世纪意大利数学家之间的公开决斗(Cardano vs Tartaglia),赌注是名誉和饭碗。
  • 五次方程没有根式解 —— 这个结论让 20 岁的阿贝尔贫病而死,让 21 岁的伽罗瓦在决斗前夜写下了群论,开启了整个现代代数。
  • 微积分不是牛顿一个人在苹果树下发明的 —— 它是两千年的接力赛:阿基米德的穷竭法、印度喀拉拉学派的级数、开普勒算酒桶体积、费马求切线、巴罗(牛顿的老师)证出微积分基本定理的几何雏形……牛顿和莱布尼茨只是在 1666 年前后同时收尾,接着两人为了优先权互相指控剽窃了三十年,把英国数学和欧陆数学撕裂了一个世纪。
  • 傅里叶级数诞生于 1807 年,是为了解决蒸汽机金属部件的热传导问题 —— 直接服务于工业革命。
  • 矩阵和线性代数也是跨越两千年的合作:中国《九章算术》在公元前就用消元法解五元一次方程组(比高斯早 1500 年),日本关孝和(1683)比莱布尼茨更早写下行列式,高斯为了找回失踪的小行星谷神星发明了最小二乘法,凯莱和西尔维斯特在 1850 年代才把"矩阵"作为一种代数对象正式命名 —— 而这一切,最后成了量子力学、Google PageRank 和深度学习的共同语言。

马斯克在清华的演讲里说过类似的话:物理教育的失败,是没有教学生第一性原理真实世界的物理意义,只让他们背公式应付考试。数学也一样。

这个项目的目标:用代码和动画,把数学还原成它本来的样子 —— 一部带血带肉的人类思想史


🗺️ 学习路线图(按历史时间线)

前 1800 ── 前 250 ── 263 ── 1545 ── 1666 ── 1801 ── 1807 ── 1832 ── 1858 ── 1925 ── 现代
   │         │       │      │       │       │       │       │       │       │       │
 巴比伦   阿基米德  刘徽   卡尔达诺 牛顿/   高斯    傅里叶  伽罗瓦  凯莱   海森堡  PyTorch
 二次方程  穷竭法  九章   三次决斗 莱布尼兹 找回    热方程  群论    矩阵   矩阵    自动微分
           圆周率  算术            微积分   谷神星   工业革命 五次无解 代数   力学    深度学习

灰色的横线背后,是七十多代人接力奔跑的两千年。本项目的目的,就是把这条河的每一个弯都走一遍。

Chapter 0 · 视角即解法:为什么"换个角度看,难题瞬间消失"

"数学家不解决问题,他们改写问题。" —— 笛卡尔式的精神

1787 年,9 岁的高斯被老师罚算 \(1+2+\cdots+100\)。他几秒钟交卷:5050。 他不是算得快,而是看到了别人看不到的对称性

  1 +   2 +   3 + ... +  98 +  99 + 100
100 +  99 +  98 + ... +   3 +   2 +   1
─────────────────────────────────────────
101 + 101 + 101 + ... + 101 + 101 + 101    =  100 × 101 = 10100,  ÷2 = 5050

这不是"小聪明",而是视角的革命 —— 他把"加法"看成了"配对的对称"。 几乎所有被罗列在教辅书上的"解题技巧",本质上都是同一件事:换一个表征,让原来藏起来的结构暴露出来。 难和易的差异,不在题目本身,而在你戴的那副结构眼镜

0.1 历史上反复出现的"换视角"母题

技巧 它在偷偷利用的结构 历史源头 现代化身
配对求和(高斯 1787) 对称群 \(\mathbb{Z}/2\) 的作用 巴比伦泥板已用 闭式数列、生成函数
消元法(《九章算术》前 200) 线性方程组的行空间 刘徽注、高斯 1810 LU 分解、Gauss–Jordan
裂项相消(莱布尼茨 1672) 离散版"微积分基本定理" \(\sum (a_{n+1}-a_n) = a_N - a_0\) 数列差分演算 Stokes 定理、上同调
合并同类项 商环 / 等价类 花拉子米 al-Jabr (820) 群环、张量收缩
配方法(巴比伦 前 1800) 二次型的正交对角化 巴比伦泥板 BM 13901 主成分分析、SDP
换元法(费马 1630s、欧拉 1750s) 坐标变换 / 流形局部图 笛卡尔解析几何 微分同胚、归一化流
构造辅助线(欧几里得 前 300) 把不可见的对称显式化 《几何原本》 范畴论的伴随函子
数学归纳法(帕斯卡 1654) 自然数良序原理 欧几里得已有实质用法 递归、不动点定理
生成函数(欧拉 1740) 把序列编码成解析函数 《无穷分析引论》 \(z\) 变换、母函数法
对偶变换(庞色列 1822) 点 ↔ 线的射影对称 射影几何 凸优化对偶、傅里叶变换
不变量法(克莱因 1872) 群作用下的不变量 埃尔朗根纲领 李群、规范场论

0.2 为什么是高斯"一下知道"?—— 直觉是历史的浓缩

把"高斯一下看出 \(1+\cdots+n=\frac{n(n+1)}{2}\)"归功于天赋,是教育学上最便宜的偷懒。事实是:

  1. 对称即简化这条母题,从巴比伦人切土地、毕达哥拉斯排石子("三角形数")开始,就在数学传统中流淌。高斯只是继承了这条直觉
  2. 教辅书把这些技巧罗列成几十个独立的招式,掩盖了它们其实都是同一件事的不同投影。学生背招式 → 永远只是"做过的题会、没做过的不会";看清结构 → "没见过的题也能换个角度试试看"。
  3. 这条直觉可以被训练:每当你遇到一个能"换视角变简单"的瞬间,就在脑里给它打上标签 —— 是哪种对称?哪种不变量?哪种同构? 几年下来,你也会"一下看出"。

一句话总结:所有"灵感"的背后,都是某种对称性、不变性、或同构。

0.3 可视化与代码

  • 可视化
  • 高斯配对求和的"两端向中间收拢"动画
  • 《九章算术》原文 → 矩阵行变换的同步动画
  • 裂项 \(\sum \frac{1}{n(n+1)} = \sum(\frac{1}{n}-\frac{1}{n+1})\) 与连续版 \(\int f' = f(b)-f(a)\) 并排呈现
  • 高斯积分 \(\int_{-\infty}^{\infty} e^{-x^2} dx = \sqrt{\pi}\) 的极坐标换元几何
  • 欧几里得"三角形内角和 = 180°"的辅助线 = 借来的平移对称
  • 射影对偶:点动 ⇔ 线动 的同步动画
  • 代码ch00_perspectives/
  • gauss_pairing_sum.py —— 配对求和的对称动画 + 用 torch 验证 \(n\)\(10^6\)
  • jiuzhang_elimination_anim.py —— 方程章"遍乘直除"与现代矩阵消元同步演示
  • telescoping_as_calculus.py —— 离散裂项 vs 连续基本定理
  • gaussian_integral_polar.py —— 极坐标换元算 \(\sqrt{\pi}\)
  • generating_function_fib.py —— 用 \(\frac{x}{1-x-x^2}\) 一行解出斐波那契通项(SymPy)
  • auxiliary_line_euclid.py —— 欧几里得辅助线 = 隐藏的平移
  • duality_point_line.py —— 射影对偶的实时联动

教育学意义:本章是贯穿全书的元章节。读完后,每学一个新概念都自动问一句: "这背后是哪种对称、哪种不变量?" —— 这是数学家和做题家的真正分水岭。

Chapter 0.5 · 公式即直觉的化石:为什么数学反复出现平方、\(1/r^2\)\(\log\)

"数学家偷懒的方式,是同一个直觉用一辈子。"

为什么方差是 \(\mathbb{E}[(X-\mu)^2]\) 而不是 \(\mathbb{E}|X-\mu|\)?为什么万有引力是 \(1/r^2\) 而不是 \(1/r\)\(1/r^3\)?为什么信息量、熵、似然估计、声音响度、地震烈度,全都拿 \(\log\) 来度量?

这些不是巧合,也不是数学家的审美偏好 —— 它们是几何 / 物理 / 概率三条河流在同一个河床上汇流留下的痕迹。看穿这些反复出现的母题,就拿到了"读公式"的钥匙:当你看到一个新公式里出现 \((\cdot)^2\)\(1/r^2\)\(\log(\cdot)\)\(e^{(\cdot)}\),应该立刻问 —— 它在偷偷利用哪个空间结构?哪个守恒律?哪种同构?

0.5.1 为什么是平方?—— 几何、能量、概率三处汇流

平方(\(x^2\))几乎是数学里最频繁出现的算子,它同时承担了至少五种角色:

出现场所 表达式 平方的真正含义
勾股定理(前 1800,巴比伦泥板) \(a^2 + b^2 = c^2\) 欧氏度量:把两个正交方向上的长度合成
动能(莱布尼茨 1686,vis viva \(E = \tfrac{1}{2}mv^2\) 守恒量必须是速度的偶函数(向左 = 向右)
方差(高斯 1809) \(\mathrm{Var} = \mathbb{E}[(X-\mu)^2]\) \(L^2\) 范数 → 唯一可微 + 满足勾股分解
最小二乘(高斯 1801,找谷神星) \(\min \sum (y_i - \hat{y}_i)^2\) 误差在残差空间的正交投影
量子振幅(玻恩 1926) \(P = \|\psi\|^2\) 概率守恒要求 \(L^2\) 归一化

为什么不用绝对值 \(|x|\)?事实上拉普拉斯 1774 年(更早还有博斯科维奇 1755)真的试过"最小绝对偏差法",比高斯的最小二乘早 30 年。结果是 —— \(|x|\) 在零点不可导,没有解析解;而 \(x^2\) 求导后线性、有闭式解、让正交投影定理成立。数学不是选了"最好"的度量,是选了"能算"的度量 —— 然后整个分析学(希尔伯特空间、傅里叶、量子力学、PCA、深度学习的 MSE 损失)都建立在这个偶然便利之上。

一句话:\(x^2\) = "正交分解 + 可微"的双通行证。

0.5.2 为什么是 \(1/r^2\)?—— 三维空间的几何必然

牛顿万有引力 \(F \propto 1/r^2\)、库仑定律、点光源照度、声波强度衰减 —— 全是 \(1/r^2\)。这不是物理巧合,而是三维空间几何的直接后果

半径为 r 的球面面积 = 4πr²
点源发出的总通量守恒 → 单位面积上的通量 ∝ 1/r²

这是高斯散度定理的直观版本(高斯 1813、格林 1828、奥斯特罗格拉茨基 1839)。所以:

维度 几何 力的衰减 后果
1D(弦上的波) "球面" = 两个点 不衰减 信号无损传播
2D(水面涟漪) 圆周长 \(\propto r\) \(\propto 1/r\)(强度 \(\propto 1/r\) 没有稳定有界轨道
3D(我们的世界) 球面 \(\propto r^2\) \(\propto 1/r^2\) 行星轨道稳定
4D 以上 超球面 \(\propto r^{n-1}\) \(\propto 1/r^{n-1}\) 任何微扰都让原子坍缩

埃伦费斯特 1917 年用纯维度论证证明:稳定的束缚态轨道(行星、原子)只存在于 3 维空间。如果指数偏离 2 哪怕一点,太阳系或氢原子在第一次扰动里就瓦解了。

一句话:\(1/r^2\) 是三维空间向你展示它的维度。

0.5.3 为什么是 \(\log\)?—— 把乘法变成加法的字典

\(\log\) 在数学中无处不在,但它做的其实只有一件事:把乘法关系压扁成加法关系

\[\log(ab) = \log a + \log b\]

这一行公式背后是整个对数史: - 1614,纳皮尔(苏格兰):发明对数,目的是把天文学家的"乘法噩梦"变成加法。开普勒算行星轨道用了 4 年;纳皮尔表出来后,3 个月就够了。 - 1620s–1970s,对数计算尺:电子计算器普及前,所有工程师都在用对数尺做乘法 —— 因为对数把 × 变成了 +。 - 1948,香农:定义信息量为 \(-\log p\)。原因是"两个独立事件的信息量应该相加"→ 概率应该相乘 → 必须取 log

现象 表达式 \(\log\) 在干嘛
信息熵(香农 1948) \(H = -\sum p_i \log p_i\) 把"独立 → 相乘"变成"相加"
极大似然(费舍尔 1922) \(\log L = \sum \log p(x_i\mid\theta)\) 同上:独立样本概率相乘,取 log 变求和
玻尔兹曼熵(1877,墓碑) \(S = k \log W\) 同上:微观状态数相乘 → 熵相加
韦伯-费希纳定律(1860) 感觉 \(\propto \log\) 刺激 人耳人眼对比例而非绝对值敏感
分贝、星等、pH、里氏震级 都是 \(\log\) 度量 同上:跨数量级的比例感知
Sigmoid / Softmax / 交叉熵 内含 \(\log\) 把概率比变成线性可加的"logit"

\(\log\) 的"自然底" \(e\) 不是为了好看 —— 它是唯一一个使 \(\frac{d}{dx} a^x = a^x\) 成立的底数。换句话说,\(e^x\) 是导数算子的特征函数:求导不改变它。这就是为什么微分方程、复利、放射性衰变、神经网络激活函数,全部跟 \(e\) 缠绕在一起。

一句话:\(\log\) = 把乘法世界翻译成加法世界的字典;\(e^x\) = 让微分原地踏步的不动点。

0.5.4 一张表:数学反复出现的"惯用语"

习语 数学含义 物理 / 概率含义 不出现时世界会怎样
\(x^2\) \(L^2\) 范数、正交投影、可微 动能、方差、量子概率 没有最小二乘,没有希尔伯特空间
\(1/r^2\) 3D 球面面积反比 引力、电场、辐射 行星轨道与原子结构都不稳定
\(\log\) 群同态 \((\mathbb{R}^+, \times) \to (\mathbb{R}, +)\) 熵、似然、感觉强度 独立性无法被加性度量
\(e^x\) \(\frac{d}{dx}\) 的特征函数 复利、衰变、谐振子 没有线性 ODE 的闭式解
\(\sqrt{\cdot}\) \(L^2\) 范数最后一步、几何均值的孪生 距离、RMS、标准差 \(\mathrm{Var}\)\(X\) 量纲不同
内积 \(\langle u,v\rangle\) 投影、相似度 \(= F\cdot d\)、相关系数 失去"角度"的概念
行列式 \(\det\) \(n\) 维体积的有向倍率 雅可比、相空间体积 微积分换元失语
复数 \(e^{i\theta}\) 旋转 = 频率 量子相位、交流电 傅里叶变换不复存在
高斯函数 \(e^{-x^2/2}\) 傅里叶变换的不动点 \(\hat{f}=f\) 中心极限定理、热核 概率论失去其极限定理

0.5.5 数学思维的三条习惯

读到这里你应该看出一个模式:数学不是公式的堆砌,而是少数几条"母题"被反复折射。一旦养成下面三条习惯,公式就从"要背"变成"要看穿":

  1. 看到平方,先问"在哪个内积空间里做正交分解?" 方差、动能、损失函数、量子振幅 —— 都在某个 \(L^2\) 空间里量"距离"。
  2. 看到 \(1/r^k\),先问"这是几维空间的守恒律?" 通量在 \(n\) 维球面上守恒就给出 \(1/r^{n-1}\)。库仑、引力、热扩散都是同一件事的不同面。
  3. 看到 \(\log\)\(e\),先问"哪种乘法被偷偷变成了加法?" 独立事件的概率相乘、熵的可加性、感官的比例敏感 —— \(\log\) 总在打通"积性"和"加性"两个世界。

把"为什么是这个公式"问到底,最后你会发现答案永远是其中之一:对称性、守恒律、或同构。这正好接续 Chapter 0 的母题 —— 视角即解法。

本文小结:欧美优秀的数学,AI等书籍很多,但最终能启发人思考的“点燃火焰”,寻求其根源的力量,才是教育最重要的事情之一。敬请关注下期文章更新:更多数学思想,数学直觉,有趣故事对AI发展的重大影响~