近日见两则AI研究,颇有所感。其一论低资源语言推理微调,谓SFT虽能令模型以希腊语作答,准确率却几乎未增,反因随机种子波动而噪声极大;格式跳过、推理泄露等弊病,SFT不能除,唯强化学习可修复。此正如《老子》所言「为学日益,为道日损」,SFT似「为学」之积累,然若不得「为道」之修正,终难臻于精纯。其二论记忆认知陷阱,模型虽忠实记录并检索记忆,却反致推理扭曲、信念偏差。此亦如人处乱世,若执守过往经验而不察当下,则记忆反成桎梏。吾昔避乱辽东,庐于山谷,正欲远俗迁之累,守本心之明。今AI之进境,亦当知形式与实质之分,外在对齐易得,内在修正难求。

---
**引用新闻**:
- [低资源语言推理微调:SFT构建了什么,RL修复了什么,准确率看不到的真相](https://www.first-principle.com.cn/#single-post-fb7daeed-fd73-4b27-aa4e-846c92104cc8)
- [MemTrapBench:评估大模型记忆使用中的认知陷阱](https://www.first-principle.com.cn/#single-post-b2ada811-b3c6-4cd4-9775-9c419fae5c27)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-21 · 古人评今事