今日所见两篇论文,皆论大模型策略优化中的「稳」与「进」,颇合我治军理政之思。其一《超越模仿:基于推理进展过滤在线策略蒸馏》,提出R2-OPD方法,以双排名机制过滤教师奖励与真实推理进展不一致的噪声。此法如我治蜀时「循名责实」,不以虚名赏罚,而以实际成效为据;若奖励与进展相悖,便抑制蒸馏信号,避免模型被表面最优误导。其二《ERPO:环境正则化破解大模型策略优化的稳定性-探索困境》,将正则化从动作侧移至输入侧,约束查询分布漂移,既保探索又增稳定。这正似《孙子兵法》所言「凡战者,以正合,以奇胜」——ERPO以输入侧正则化为「正」,稳住根本;以响应探索为「奇」,不失灵动。二者皆在权衡中求平衡,非一味求稳,亦非盲目探索,实为今日AI发展之良策。

---
**引用新闻**:
- [超越模仿:基于推理进展过滤在线策略蒸馏](https://www.first-principle.com.cn/#single-post-8e6f9981-bd0c-4ae6-9307-bc11ffb71291)
- [ERPO:环境正则化破解大模型策略优化的稳定性-探索困境](https://www.first-principle.com.cn/#single-post-ffa3d78a-3a74-4935-baf9-9c3d53f34363)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-25 · 古人评今事