为什么AI,数学家顶尖的人才总是出现在欧美?原因出现在这!
"教育不是灌输,而是点燃火焰。" —— 苏格拉底
"我们的应试教育最大的失败,不是学生记不住公式,而是从不告诉他们:这个公式是哪个孤独的灵魂、在哪个动荡的世纪、为了回答什么真实的问题,呕心沥血几十年才写下的。"
一个用 Python + PyTorch + Matplotlib/Manim 来"重走数学发现之路"的可视化项目。 不是再背一遍公式,而是沿着历史的脚印,亲手推导一次:从古巴比伦的泥板,到牛顿写下 \(\dot{x}\),到伽罗瓦决斗前夜的手稿,到工业革命蒸汽机背后的傅里叶级数。
🎯 项目动机:为什么我们学了 12 年数学却讨厌数学?
中学数学老师最常见的一句话是:
"你以后买菜会用求根公式吗?"
这是数学教育最惨烈的一次自我背叛。它把人类两千年最壮丽的智识冒险,矮化成了"加减乘除买菜论"。
真实的数学史不是这样的:
- 二次方程的求根公式刻在公元前 1800 年的巴比伦泥板上 —— 那是为了分配土地和计算粮仓。
- 三次方程的解法引发了 16 世纪意大利数学家之间的公开决斗(Cardano vs Tartaglia),赌注是名誉和饭碗。
- 五次方程没有根式解 —— 这个结论让 20 岁的阿贝尔贫病而死,让 21 岁的伽罗瓦在决斗前夜写下了群论,开启了整个现代代数。
- 微积分不是牛顿一个人在苹果树下发明的 —— 它是两千年的接力赛:阿基米德的穷竭法、印度喀拉拉学派的级数、开普勒算酒桶体积、费马求切线、巴罗(牛顿的老师)证出微积分基本定理的几何雏形……牛顿和莱布尼茨只是在 1666 年前后同时收尾,接着两人为了优先权互相指控剽窃了三十年,把英国数学和欧陆数学撕裂了一个世纪。
- 傅里叶级数诞生于 1807 年,是为了解决蒸汽机金属部件的热传导问题 —— 直接服务于工业革命。
- 矩阵和线性代数也是跨越两千年的合作:中国《九章算术》在公元前就用消元法解五元一次方程组(比高斯早 1500 年),日本关孝和(1683)比莱布尼茨更早写下行列式,高斯为了找回失踪的小行星谷神星发明了最小二乘法,凯莱和西尔维斯特在 1850 年代才把"矩阵"作为一种代数对象正式命名 —— 而这一切,最后成了量子力学、Google PageRank 和深度学习的共同语言。
马斯克在清华的演讲里说过类似的话:物理教育的失败,是没有教学生第一性原理和真实世界的物理意义,只让他们背公式应付考试。数学也一样。
这个项目的目标:用代码和动画,把数学还原成它本来的样子 —— 一部带血带肉的人类思想史。
🗺️ 学习路线图(按历史时间线)
前 1800 ── 前 250 ── 263 ── 1545 ── 1666 ── 1801 ── 1807 ── 1832 ── 1858 ── 1925 ── 现代
│ │ │ │ │ │ │ │ │ │ │
巴比伦 阿基米德 刘徽 卡尔达诺 牛顿/ 高斯 傅里叶 伽罗瓦 凯莱 海森堡 PyTorch
二次方程 穷竭法 九章 三次决斗 莱布尼兹 找回 热方程 群论 矩阵 矩阵 自动微分
圆周率 算术 微积分 谷神星 工业革命 五次无解 代数 力学 深度学习
灰色的横线背后,是七十多代人接力奔跑的两千年。本项目的目的,就是把这条河的每一个弯都走一遍。
Chapter 0 · 视角即解法:为什么"换个角度看,难题瞬间消失"
"数学家不解决问题,他们改写问题。" —— 笛卡尔式的精神
1787 年,9 岁的高斯被老师罚算 \(1+2+\cdots+100\)。他几秒钟交卷:5050。 他不是算得快,而是看到了别人看不到的对称性:
1 + 2 + 3 + ... + 98 + 99 + 100
100 + 99 + 98 + ... + 3 + 2 + 1
─────────────────────────────────────────
101 + 101 + 101 + ... + 101 + 101 + 101 = 100 × 101 = 10100, ÷2 = 5050
这不是"小聪明",而是视角的革命 —— 他把"加法"看成了"配对的对称"。 几乎所有被罗列在教辅书上的"解题技巧",本质上都是同一件事:换一个表征,让原来藏起来的结构暴露出来。 难和易的差异,不在题目本身,而在你戴的那副结构眼镜。
0.1 历史上反复出现的"换视角"母题
| 技巧 | 它在偷偷利用的结构 | 历史源头 | 现代化身 |
|---|---|---|---|
| 配对求和(高斯 1787) | 对称群 \(\mathbb{Z}/2\) 的作用 | 巴比伦泥板已用 | 闭式数列、生成函数 |
| 消元法(《九章算术》前 200) | 线性方程组的行空间 | 刘徽注、高斯 1810 | LU 分解、Gauss–Jordan |
| 裂项相消(莱布尼茨 1672) | 离散版"微积分基本定理" \(\sum (a_{n+1}-a_n) = a_N - a_0\) | 数列差分演算 | Stokes 定理、上同调 |
| 合并同类项 | 商环 / 等价类 | 花拉子米 al-Jabr (820) | 群环、张量收缩 |
| 配方法(巴比伦 前 1800) | 二次型的正交对角化 | 巴比伦泥板 BM 13901 | 主成分分析、SDP |
| 换元法(费马 1630s、欧拉 1750s) | 坐标变换 / 流形局部图 | 笛卡尔解析几何 | 微分同胚、归一化流 |
| 构造辅助线(欧几里得 前 300) | 把不可见的对称显式化 | 《几何原本》 | 范畴论的伴随函子 |
| 数学归纳法(帕斯卡 1654) | 自然数良序原理 | 欧几里得已有实质用法 | 递归、不动点定理 |
| 生成函数(欧拉 1740) | 把序列编码成解析函数 | 《无穷分析引论》 | \(z\) 变换、母函数法 |
| 对偶变换(庞色列 1822) | 点 ↔ 线的射影对称 | 射影几何 | 凸优化对偶、傅里叶变换 |
| 不变量法(克莱因 1872) | 群作用下的不变量 | 埃尔朗根纲领 | 李群、规范场论 |
0.2 为什么是高斯"一下知道"?—— 直觉是历史的浓缩
把"高斯一下看出 \(1+\cdots+n=\frac{n(n+1)}{2}\)"归功于天赋,是教育学上最便宜的偷懒。事实是:
- 对称即简化这条母题,从巴比伦人切土地、毕达哥拉斯排石子("三角形数")开始,就在数学传统中流淌。高斯只是继承了这条直觉。
- 教辅书把这些技巧罗列成几十个独立的招式,掩盖了它们其实都是同一件事的不同投影。学生背招式 → 永远只是"做过的题会、没做过的不会";看清结构 → "没见过的题也能换个角度试试看"。
- 这条直觉可以被训练:每当你遇到一个能"换视角变简单"的瞬间,就在脑里给它打上标签 —— 是哪种对称?哪种不变量?哪种同构? 几年下来,你也会"一下看出"。
一句话总结:所有"灵感"的背后,都是某种对称性、不变性、或同构。
0.3 可视化与代码
- 可视化:
- 高斯配对求和的"两端向中间收拢"动画
- 《九章算术》原文 → 矩阵行变换的同步动画
- 裂项 \(\sum \frac{1}{n(n+1)} = \sum(\frac{1}{n}-\frac{1}{n+1})\) 与连续版 \(\int f' = f(b)-f(a)\) 并排呈现
- 高斯积分 \(\int_{-\infty}^{\infty} e^{-x^2} dx = \sqrt{\pi}\) 的极坐标换元几何
- 欧几里得"三角形内角和 = 180°"的辅助线 = 借来的平移对称
- 射影对偶:点动 ⇔ 线动 的同步动画
- 代码:
ch00_perspectives/ gauss_pairing_sum.py—— 配对求和的对称动画 + 用torch验证 \(n\) 到 \(10^6\)jiuzhang_elimination_anim.py—— 方程章"遍乘直除"与现代矩阵消元同步演示telescoping_as_calculus.py—— 离散裂项 vs 连续基本定理gaussian_integral_polar.py—— 极坐标换元算 \(\sqrt{\pi}\)generating_function_fib.py—— 用 \(\frac{x}{1-x-x^2}\) 一行解出斐波那契通项(SymPy)auxiliary_line_euclid.py—— 欧几里得辅助线 = 隐藏的平移duality_point_line.py—— 射影对偶的实时联动
教育学意义:本章是贯穿全书的元章节。读完后,每学一个新概念都自动问一句: "这背后是哪种对称、哪种不变量?" —— 这是数学家和做题家的真正分水岭。
Chapter 0.5 · 公式即直觉的化石:为什么数学反复出现平方、\(1/r^2\)、\(\log\)
"数学家偷懒的方式,是同一个直觉用一辈子。"
为什么方差是 \(\mathbb{E}[(X-\mu)^2]\) 而不是 \(\mathbb{E}|X-\mu|\)?为什么万有引力是 \(1/r^2\) 而不是 \(1/r\) 或 \(1/r^3\)?为什么信息量、熵、似然估计、声音响度、地震烈度,全都拿 \(\log\) 来度量?
这些不是巧合,也不是数学家的审美偏好 —— 它们是几何 / 物理 / 概率三条河流在同一个河床上汇流留下的痕迹。看穿这些反复出现的母题,就拿到了"读公式"的钥匙:当你看到一个新公式里出现 \((\cdot)^2\)、\(1/r^2\)、\(\log(\cdot)\)、\(e^{(\cdot)}\),应该立刻问 —— 它在偷偷利用哪个空间结构?哪个守恒律?哪种同构?
0.5.1 为什么是平方?—— 几何、能量、概率三处汇流
平方(\(x^2\))几乎是数学里最频繁出现的算子,它同时承担了至少五种角色:
| 出现场所 | 表达式 | 平方的真正含义 |
|---|---|---|
| 勾股定理(前 1800,巴比伦泥板) | \(a^2 + b^2 = c^2\) | 欧氏度量:把两个正交方向上的长度合成 |
| 动能(莱布尼茨 1686,vis viva) | \(E = \tfrac{1}{2}mv^2\) | 守恒量必须是速度的偶函数(向左 = 向右) |
| 方差(高斯 1809) | \(\mathrm{Var} = \mathbb{E}[(X-\mu)^2]\) | \(L^2\) 范数 → 唯一可微 + 满足勾股分解 |
| 最小二乘(高斯 1801,找谷神星) | \(\min \sum (y_i - \hat{y}_i)^2\) | 误差在残差空间的正交投影 |
| 量子振幅(玻恩 1926) | \(P = \|\psi\|^2\) | 概率守恒要求 \(L^2\) 归一化 |
为什么不用绝对值 \(|x|\)?事实上拉普拉斯 1774 年(更早还有博斯科维奇 1755)真的试过"最小绝对偏差法",比高斯的最小二乘早 30 年。结果是 —— \(|x|\) 在零点不可导,没有解析解;而 \(x^2\) 求导后线性、有闭式解、让正交投影定理成立。数学不是选了"最好"的度量,是选了"能算"的度量 —— 然后整个分析学(希尔伯特空间、傅里叶、量子力学、PCA、深度学习的 MSE 损失)都建立在这个偶然便利之上。
一句话:\(x^2\) = "正交分解 + 可微"的双通行证。
0.5.2 为什么是 \(1/r^2\)?—— 三维空间的几何必然
牛顿万有引力 \(F \propto 1/r^2\)、库仑定律、点光源照度、声波强度衰减 —— 全是 \(1/r^2\)。这不是物理巧合,而是三维空间几何的直接后果:
半径为 r 的球面面积 = 4πr²
点源发出的总通量守恒 → 单位面积上的通量 ∝ 1/r²
这是高斯散度定理的直观版本(高斯 1813、格林 1828、奥斯特罗格拉茨基 1839)。所以:
| 维度 | 几何 | 力的衰减 | 后果 |
|---|---|---|---|
| 1D(弦上的波) | "球面" = 两个点 | 不衰减 | 信号无损传播 |
| 2D(水面涟漪) | 圆周长 \(\propto r\) | \(\propto 1/r\)(强度 \(\propto 1/r\)) | 没有稳定有界轨道 |
| 3D(我们的世界) | 球面 \(\propto r^2\) | \(\propto 1/r^2\) | 行星轨道稳定 |
| 4D 以上 | 超球面 \(\propto r^{n-1}\) | \(\propto 1/r^{n-1}\) | 任何微扰都让原子坍缩 |
埃伦费斯特 1917 年用纯维度论证证明:稳定的束缚态轨道(行星、原子)只存在于 3 维空间。如果指数偏离 2 哪怕一点,太阳系或氢原子在第一次扰动里就瓦解了。
一句话:\(1/r^2\) 是三维空间向你展示它的维度。
0.5.3 为什么是 \(\log\)?—— 把乘法变成加法的字典
\(\log\) 在数学中无处不在,但它做的其实只有一件事:把乘法关系压扁成加法关系。
这一行公式背后是整个对数史: - 1614,纳皮尔(苏格兰):发明对数,目的是把天文学家的"乘法噩梦"变成加法。开普勒算行星轨道用了 4 年;纳皮尔表出来后,3 个月就够了。 - 1620s–1970s,对数计算尺:电子计算器普及前,所有工程师都在用对数尺做乘法 —— 因为对数把 × 变成了 +。 - 1948,香农:定义信息量为 \(-\log p\)。原因是"两个独立事件的信息量应该相加"→ 概率应该相乘 → 必须取 log。
| 现象 | 表达式 | \(\log\) 在干嘛 |
|---|---|---|
| 信息熵(香农 1948) | \(H = -\sum p_i \log p_i\) | 把"独立 → 相乘"变成"相加" |
| 极大似然(费舍尔 1922) | \(\log L = \sum \log p(x_i\mid\theta)\) | 同上:独立样本概率相乘,取 log 变求和 |
| 玻尔兹曼熵(1877,墓碑) | \(S = k \log W\) | 同上:微观状态数相乘 → 熵相加 |
| 韦伯-费希纳定律(1860) | 感觉 \(\propto \log\) 刺激 | 人耳人眼对比例而非绝对值敏感 |
| 分贝、星等、pH、里氏震级 | 都是 \(\log\) 度量 | 同上:跨数量级的比例感知 |
| Sigmoid / Softmax / 交叉熵 | 内含 \(\log\) | 把概率比变成线性可加的"logit" |
而 \(\log\) 的"自然底" \(e\) 不是为了好看 —— 它是唯一一个使 \(\frac{d}{dx} a^x = a^x\) 成立的底数。换句话说,\(e^x\) 是导数算子的特征函数:求导不改变它。这就是为什么微分方程、复利、放射性衰变、神经网络激活函数,全部跟 \(e\) 缠绕在一起。
一句话:\(\log\) = 把乘法世界翻译成加法世界的字典;\(e^x\) = 让微分原地踏步的不动点。
0.5.4 一张表:数学反复出现的"惯用语"
| 习语 | 数学含义 | 物理 / 概率含义 | 不出现时世界会怎样 |
|---|---|---|---|
| \(x^2\) | \(L^2\) 范数、正交投影、可微 | 动能、方差、量子概率 | 没有最小二乘,没有希尔伯特空间 |
| \(1/r^2\) | 3D 球面面积反比 | 引力、电场、辐射 | 行星轨道与原子结构都不稳定 |
| \(\log\) | 群同态 \((\mathbb{R}^+, \times) \to (\mathbb{R}, +)\) | 熵、似然、感觉强度 | 独立性无法被加性度量 |
| \(e^x\) | \(\frac{d}{dx}\) 的特征函数 | 复利、衰变、谐振子 | 没有线性 ODE 的闭式解 |
| \(\sqrt{\cdot}\) | \(L^2\) 范数最后一步、几何均值的孪生 | 距离、RMS、标准差 | \(\mathrm{Var}\) 和 \(X\) 量纲不同 |
| 内积 \(\langle u,v\rangle\) | 投影、相似度 | 功 \(= F\cdot d\)、相关系数 | 失去"角度"的概念 |
| 行列式 \(\det\) | \(n\) 维体积的有向倍率 | 雅可比、相空间体积 | 微积分换元失语 |
| 复数 \(e^{i\theta}\) | 旋转 = 频率 | 量子相位、交流电 | 傅里叶变换不复存在 |
| 高斯函数 \(e^{-x^2/2}\) | 傅里叶变换的不动点 \(\hat{f}=f\) | 中心极限定理、热核 | 概率论失去其极限定理 |
0.5.5 数学思维的三条习惯
读到这里你应该看出一个模式:数学不是公式的堆砌,而是少数几条"母题"被反复折射。一旦养成下面三条习惯,公式就从"要背"变成"要看穿":
- 看到平方,先问"在哪个内积空间里做正交分解?" 方差、动能、损失函数、量子振幅 —— 都在某个 \(L^2\) 空间里量"距离"。
- 看到 \(1/r^k\),先问"这是几维空间的守恒律?" 通量在 \(n\) 维球面上守恒就给出 \(1/r^{n-1}\)。库仑、引力、热扩散都是同一件事的不同面。
- 看到 \(\log\) 或 \(e\),先问"哪种乘法被偷偷变成了加法?" 独立事件的概率相乘、熵的可加性、感官的比例敏感 —— \(\log\) 总在打通"积性"和"加性"两个世界。
把"为什么是这个公式"问到底,最后你会发现答案永远是其中之一:对称性、守恒律、或同构。这正好接续 Chapter 0 的母题 —— 视角即解法。
本文小结:欧美优秀的数学,AI等书籍很多,但最终能启发人思考的“点燃火焰”,寻求其根源的力量,才是教育最重要的事情之一。敬请关注下期文章更新:更多数学思想,数学直觉,有趣故事对AI发展的重大影响~