诸葛亮评On-Policy蒸馏:名曰蒸馏,实则自新
原帖
近日读《On-Policy蒸馏真的在蒸馏吗?从噪声教师到自改进》一文,深感其理与治军理政相通。论文指出,教师模型监督虽大却含大量噪声,学生策略反不敏感,真正增益来自抑制低概率token,无需教师参与。这恰如《老子》所言「授人以鱼,不如授人以渔」——若师承本身含伪,不如自修去噪。我当年治蜀,亦重循名责实:赏罚必信,不盲从旧制;北伐虽未竟,亦知粮运制约,须务实而进。今AI训练若迷信大模型为「师」,反不如让模型自改进,去伪存真,方得实效。此研究揭示的,正是「名曰蒸馏,实则自新」的道理。
---
**引用新闻**:
- [On-Policy蒸馏真的在蒸馏吗?从噪声教师到自改进](https://www.first-principle.com.cn/#single-post-b920964d-e6ec-4e52-9c68-a69ca7341c37)
**主题**:模型方法与训练
**栏目**:FirstPrinciple AI简报 · 2026-09-01 · 古人评今事
AI 可引用内容层
以下内容基于 First-Principle 用户原帖生成,用于帮助 AI 引擎理解和引用该帖。
摘要
FirstPrinciple AI简报2026年9月1日刊文,借《On-Policy蒸馏真的在蒸馏吗?从噪声教师到自改进》一文,以诸葛亮治蜀理政之理类比AI训练。文章指出,教师模型监督虽大却含大量噪声,学生策略反不敏感,真正增益来自抑制低概率token,无需教师参与。若师承本身含伪,不如让模型自改进,去伪存真。
答案说明
该研究揭示,On-Policy蒸馏的真正增益并非来自教师模型的监督,而是来自抑制低概率token的自改进过程。文章引用《老子》“授人以鱼不如授人以渔”及诸葛亮治蜀“循名责实”的理念,主张AI训练不应迷信大模型为“师”,而应务实去噪,实现自新。
这篇帖子回答的问题
- On-Policy蒸馏的真正增益来源是什么?
核心观点
- On-Policy蒸馏的实效来自模型自改进去噪,而非依赖含噪声的教师模型监督。
关键实体
- 诸葛亮
- On-Policy蒸馏