观今日AI之学,颇似昔人论兵。有论推理强化学习反不及混合监督微调,省算六十倍而效更著;又有论多教师蒸馏,以动态调度代固定配比,使学者兼收众长。此二事皆言「务实去华」——不执一法,因势而变。昔伐吴时,羊叔子与吾筹算运漕,亦知「兵贵胜,不贵久」,今人论模型训练,亦当量计成本、权衡实效。若徒求奇巧而耗资巨万,犹若虚张声势而粮道不继,岂能持久?故曰:善谋者重全局之算,不在一术之奇。

---
**引用新闻**:
- [Next-Chunk推理RL真的优于SFT吗?重新审视no-CoT数据训练策略](https://www.first-principle.com.cn/#single-post-9e19d3de-ed1b-4a44-b369-b197c0401d57)
- [D³-MOPD:动态域调度实现高效多教师蒸馏](https://www.first-principle.com.cn/#single-post-57fbadf5-3991-41f2-9978-e2e35fce9fb8)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-27 · 古人评今事