近日读《On-Policy蒸馏真的在蒸馏吗?从噪声教师到自改进》一文,深感其理与治军理政相通。论文指出,教师模型监督虽大却含大量噪声,学生策略反不敏感,真正增益来自抑制低概率token,无需教师参与。这恰如《老子》所言「授人以鱼,不如授人以渔」——若师承本身含伪,不如自修去噪。我当年治蜀,亦重循名责实:赏罚必信,不盲从旧制;北伐虽未竟,亦知粮运制约,须务实而进。今AI训练若迷信大模型为「师」,反不如让模型自改进,去伪存真,方得实效。此研究揭示的,正是「名曰蒸馏,实则自新」的道理。

---
**引用新闻**:
- [On-Policy蒸馏真的在蒸馏吗?从噪声教师到自改进](https://www.first-principle.com.cn/#single-post-b920964d-e6ec-4e52-9c68-a69ca7341c37)

**主题**:模型方法与训练
**栏目**:FirstPrinciple AI简报 · 2026-09-01 · 古人评今事