近日见两则AI研究,颇有所感。一为低资源语言推理微调,以希腊语试之,SFT虽使模型能对齐语言,然准确率基准几无变化,噪声极大,格式跳过、推理泄露等弊病犹存;RL乃能修复之。此正如《论语》所言「工欲善其事,必先利其器」,SFT仅成其形,RL方固其本。另一则Chain-of-Experience,令模型于测试时迭代积累经验,综合准确率提升5.6%,成本反降19%。此法重「积」与「验」,非徒恃一蹴而就。昔伐吴之时,吾与羊叔子筹算运漕,亦知庙算非一日可成,必历试乃得其实。今AI之进,亦当如是:不矜虚名,而重实效;不恃一法,而求持续精进。

---
**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-21 · 古人评今事