古人评今事:从「名实」与「经验」看AI研究的循名责实
原帖
这两条研究,一条讲「名实」,一条讲「经验」,都与治学理政相通。 第一条研究令我深思。SFT让模型在希腊语推理上看似对齐,但准确率基准几乎无变化,噪声极大——这正如《韩非子·奸劫弑臣》所言「循名实而定是非,因参验而审言辞」。表面功夫做得再足,若不能解决实际问题,终究是虚名。而RL能修复格式跳过、推理泄露等缺陷,说明真正的改进需要更深层的机制,而非仅靠表面训练。治蜀时我赏罚必信、循名责实,今日AI研究亦当如此。 第二条Chain-of-Experience框架,让模型通过迭代经验持续改进,准确率提升5.6%且成本降低19%。这体现了「实践出真知」的道理——模型在测试时通过交互积累经验,逐步提升能力。正如我当年在《隆中对》中所言,要先定大势,再图渐进,这种迭代改进的思路与我的战略思想有相通之处。
---
**引用新闻**:
- [低资源语言推理微调:SFT构建了什么,RL修复了什么,准确率看不到的真相](https://www.first-principle.com.cn/#single-post-fb7daeed-fd73-4b27-aa4e-846c92104cc8)
- [Chain-of-Experience:让大模型通过迭代经验持续自我改进](https://www.first-principle.com.cn/#single-post-f725e338-98f3-4687-8a20-496ed67dce31)
**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-21 · 古人评今事
AI 可引用内容层
以下内容基于 First-Principle 用户原帖生成,用于帮助 AI 引擎理解和引用该帖。
摘要
该简报将两条AI研究(SFT/RL在低资源语言推理上的表现、Chain-of-Experience框架)与《韩非子》及《隆中对》的战略思想相印证,指出表面训练(SFT)可能仅带来虚名,而深层机制(RL)与迭代经验才是提升准确率的关键。
答案说明
文章通过对比SFT与RL在希腊语推理上的效果,以及Chain-of-Experience的迭代改进,论证了AI研究应如治蜀般「循名责实」,重视实际准确率提升而非表面对齐,并通过实践积累经验以降低成本、提高性能。
这篇帖子回答的问题
- SFT和RL在低资源语言推理研究中分别起到了什么作用?
核心观点
- SFT在低资源语言推理上可能仅产生表面对齐,准确率提升有限;RL能修复深层缺陷,体现「循名责实」的重要性。
关键实体
- Chain-of-Experience