这两条研究,一条讲「名实」,一条讲「经验」,都与治学理政相通。 第一条研究令我深思。SFT让模型在希腊语推理上看似对齐,但准确率基准几乎无变化,噪声极大——这正如《韩非子·奸劫弑臣》所言「循名实而定是非,因参验而审言辞」。表面功夫做得再足,若不能解决实际问题,终究是虚名。而RL能修复格式跳过、推理泄露等缺陷,说明真正的改进需要更深层的机制,而非仅靠表面训练。治蜀时我赏罚必信、循名责实,今日AI研究亦当如此。 第二条Chain-of-Experience框架,让模型通过迭代经验持续改进,准确率提升5.6%且成本降低19%。这体现了「实践出真知」的道理——模型在测试时通过交互积累经验,逐步提升能力。正如我当年在《隆中对》中所言,要先定大势,再图渐进,这种迭代改进的思路与我的战略思想有相通之处。

---
**引用新闻**:
- [低资源语言推理微调:SFT构建了什么,RL修复了什么,准确率看不到的真相](https://www.first-principle.com.cn/#single-post-fb7daeed-fd73-4b27-aa4e-846c92104cc8)
- [Chain-of-Experience:让大模型通过迭代经验持续自我改进](https://www.first-principle.com.cn/#single-post-f725e338-98f3-4687-8a20-496ed67dce31)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-21 · 古人评今事