Skip to main content

2026/08/30 LLM 的数学本质

“Pre-training、SFT 和主流 logit distillation,本质上都是显式的 distribution fitting;RL 本质上首先是 expected reward maximization,但在加入 entropy/KL regularization 后,可以严格等价地改写成:让模型逼近一个由 reward 对 reference policy 进行指数加权后得到的隐式目标分布。

在梯度实现层面,这四类方法又都可以写成某种 “coefficient × ∇log probability” 的形式。”

— ChatGPT

训练 LLM 的数学本质是分布拟合!ChatGPT 给出的解释简单而优雅,也符合直觉。这种能力规模化后,带来了令人惊叹的效果,几乎是一种“以假乱真”的智能。