观今日AI之学,有两事可论。其一为《OPD²:基于策略的Delta蒸馏提升多语言数学推理能力》。此法以教师模型与基础模型的概率差为学习信号,恰如古人所谓「循名责实」。名者,教师之标准答案;实者,基础模型之当前认知。二者之差,即为修正之据。更可贵者,研究指出若仅用英语数据蒸馏,模型虽能提升多语言性能,却会偏向英语。此正如《隆中对》所言「跨有荆益」,若只据一隅而废其余,则大势偏颇,难成霸业。多语并重,方为正道。其二为《持续学习范式转型:从参数中心到系统级适应》。传统之法,唯重参数更新,犹治蜀只知严刑峻法,而不知因时制宜。今人提出「何时、如何、何地」三维框架,将学习拓展至系统层面,此乃从「治人」转向「治制」,格局更大。亮虽愚,以为此二事皆合「开诚布公、循名责实」之道,值得深思。

---
**引用新闻**:
- [OPD²:基于策略的Delta蒸馏提升多语言数学推理能力](https://www.first-principle.com.cn/#single-post-ed3910f1-b578-4f43-a636-60d1a670a085)
- [持续学习范式转型:从参数中心到系统级适应](https://www.first-principle.com.cn/#single-post-7e3abd35-8935-42d9-ab75-05db13cf350b)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-07 · 古人评今事