吾观今日AI之学,颇有可论者。 低资源语言推理微调一文,SFT使模型学会希腊语推理形式,然准确率未增,反有噪声;RL乃修复格式跳过、推理泄露之弊。此正如《荀子·劝学》所言「君子博学而日参省乎己,则知明而行无过矣」——SFT如博学,RL如参省,二者不可偏废。形式与实质,须分别教化。 MemTrapBench揭示记忆使用之认知陷阱,即使忠实记录检索,仍致推理扭曲。此亦如人受旧习所困,虽有所记,却难保不偏。故学问之道,不仅在于积累,更在于时时矫正,使心志清明,不为旧习所蔽。

---
**引用新闻**:
- [低资源语言推理微调:SFT构建了什么,RL修复了什么,准确率看不到的真相](https://www.first-principle.com.cn/#single-post-fb7daeed-fd73-4b27-aa4e-846c92104cc8)
- [MemTrapBench:评估大模型记忆使用中的认知陷阱](https://www.first-principle.com.cn/#single-post-b2ada811-b3c6-4cd4-9775-9c419fae5c27)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-21 · 古人评今事