___ __ ____ ___ ____ / _ \(_ ) (_ _)/ __)( _ \ ( (_) )/ /_ _)(_ \__ \ )___/ \___/(____)(____)(___/(__)
Steve Chan
Clojure / Emacs / Python — Lisp hacker
About
My name is Steve Chan and I'm a Clojure / Emacs / Python Lisp hacker. I currently focus on Machine Learning and Deep Learning, with special interest in Reinforcement Learning and Large Language Models.
Projects
-
hulunote/hulunoteA note-taking system for thinkers and hackers — capture, link, and grow your knowledge graph.
-
hackerlibs/code-hackerA toolbox of hacker-grade utilities and experiments for code wranglers.
-
xlisp/CodeChatChat with your codebase — pair-program with LLMs over real source trees.
Writing
- 2026-08-07 建模:把数学当工具用 —— 从托勒密的本轮到 GPT 的权重,一条四千年没断过的线 微信
- 2026-08-06 从玻尔兹曼到辛顿: 从 \(S = k \log W\) 到 gpt.py:145 的一条线
- 2026-08-06 程序 → 公式:把你已经会的 for 循环,翻译成 \(\Sigma\) —— 程序员逆袭数学的诚意手册 微信
- 2026-08-06 英语考试的完形填空,就是大模型Tab写代码的全部方法 微信
- 2026-08-05 菲尔兹奖照出中国教育最大的短板:为什么两位数学天才,都去了欧美? 微信
- 2026-08-05 从"保护天才"到"滋养创新":邓煜、王虹的成长路径带来的一点思考 微信
- 2026-08-04 为什么语言规律可以被学习:从梵语到 CodeChat 的 8B 权重 微信
- 2026-08-01 把磁场掰斜一点点,你的位置就变成了一个角度
- 2026-07-31 为什么AI,物理学家顶尖的人才总是出现在欧美?原因出现在这! 微信
- 2026-07-31 为什么 AI、数学、物理的底层理论,总是诞生在欧美?原因出现在这! 微信
- 2026-07-31 为什么 AI 论文全是天书?因为每一个数学符号,其实都是一句人话 微信
- 2026-07-30 大学4年没讲明白的神经网络数学,被一段 PyTorch 代码讲透了 微信
- 2026-07-30 95% 的 LangGraph 教程,都没告诉你它真正解决了什么 微信
- 2026-07-30 AI圈突然都在聊 Loop、Graph Engineering,炒作还是新东西? 微信
- 2026-07-27 医院那台核磁共振,和大模型的位置编码、多模态,是同一件事 微信
- 2026-07-23 训练写权重,推理用权重 + 脚手架:SFT / RL 训完之后到底是怎么生效的 微信
- 2026-07-22 Mask、三角矩阵与因果掩码:历史、起源与原理
- 2026-07-17 Claude 的暗黑科技:把垃圾代码炼成黄金训练数据 微信
- 2026-07-13 为什么AI,数学家顶尖的人才总是出现在欧美?原因出现在这! 微信
- 2026-07-09 ChatGPT 会推理的秘密,藏在一款游戏身上 微信
- 2026-07-09 训一条狗,和训出会"思考"的 DeepSeek,用的是同一套办法 微信
- 2026-07-08 为什么大模型能堆到几十层还训得动?答案藏在一个最不起眼的动作里 微信
- 2026-07-07 高中觉得最没用的"虚数 i",其实是大模型旋转位置编码最优雅的写法 微信
- 2026-07-05 高中觉得最没用的 log,其实是大模型判断"自己错得有多离谱"的唯一标尺 微信
- 2026-07-05 高中觉得只是"带箭头的线段"的向量,其实是大模型把"意思"变成"方向"的地基 微信
- 2026-07-05 高中背到头秃的排列组合,其实解释了大模型为什么"不可能靠背、只能靠学" 微信
- 2026-07-05 高中觉得最玄乎的"极限",其实是大模型"从犹豫到笃定"的那个旋钮 微信
- 2026-07-05 高中最容易被忽略的数学归纳法,其实就是大模型"逐字生成"的骨架 微信
- 2026-07-03 高中背了三年的数列,原来是 GPT 一个字一个字蹦出来的秘密 微信
- 2026-07-01 大学4年没讲明白的信息论,被一段 PyTorch 代码讲透了 微信
- 2026-07-01 高中背了三年的 sin 和 cos,原来是大模型记住"谁先谁后"的秘密 微信
- 2026-06-28 Mythos、Fable 5 的背后,其实是一条 70 年没人讲透的 AI 主线 微信
- 2026-06-27 大学4年没讲明白的概率论,被一段 PyTorch 代码讲透了 微信
- 2026-06-25 高中老师说"买菜用得上求根公式吗"——可这条公式,是整个大模型的祖宗 微信
- 2026-06-23 大学4年没讲明白的线性代数,被一段 PyTorch 代码讲透了 微信
- 2026-06-21 用最小作用原理写一个 MCP:模型的那双手,该怎么造 微信
- 2026-06-20 把提示词当代码写:Prompt Engineering 的第一性原理 微信
- 2026-06-17 从 CoT 到 ReAct,再到"会自己思考"的模型 微信
- 2026-06-15 AI 最大的缺陷不是智商,而是失忆:我们做了一个 AI 的海马体 微信
- 2026-05-21 Harness 即一切:模型不是不够聪明,而是是否有足够有用的tools 微信
- 2026-05-13 万能函数模拟器:大模型就是用微积分从数据里"积分"出来的函数 P 微信
- 2026-05-06 从代码语义搜索到 GPT 写代码:五代范式、三次质变与一条贯穿始终的"搜索维度提升"主线 微信
- 2026-05-06 GPT 是更高级的"万能谷歌搜索":从关键词到高维空间的搜索进化史 微信
- 2026-05-06 EDA、符号主义与 LLM 的交汇 微信
- 2026-05-06 Why You Not Student? 微信
- 2026-05-04 概率就是面积,矩阵就是映射:大模型最底层的两块拼图 微信
- 2026-04-28 深度学习是可微分编程:从 y = wx + b 讲到 CodeGPT 微信
- 2026-04-26 物理学的影子:量子力学与统计力学如何塑造了深度学习 微信
- 2026-04-25 同一个 Transformer,吃掉一切:为什么语音、图像、自动驾驶、大模型都在用它 微信
- 2026-04-25 从图像视角理解 Transformer 微信
- 2026-04-20 RAG 还是 SFT:面对一堆私有数据,该怎么选? 微信
- 2026-04-20 Transformer Debugger:把大模型从黑盒拆成白盒
- 2026-04-19 多次 SFT 的灾难性遗忘:SFT 的本质、MoE 的本质、以及它们各自解决什么问题 微信
- 2026-04-16 混合 SFT vs MoE:同一思路吗?
- 2026-04-14 从单卡到多卡:分布式训练原理与 FSDP 实战
- 2026-04-11 GRPO on SWE-bench Train: Docker-in-the-Loop RL
- 2026-04-08 CodeChat RL 算法选型
- 2026-04-02 LLM 训练技术详解:从 SFT 到 GRPO
- 2026-03-12 压缩即智能:从自编码器到 GPT 的认知哲学 微信
- 2026-03-12 从 RNN 到 CodeGPT:序列建模的进化史 微信
- 2026-03-12 强化学习对齐与柏拉图表征:ChatGPT 成功的另外两块拼图 微信