今日读《Your model already knows the answer》一文,深感其理与治军察将相通。文中言模型得分高,未必是真能推理,可能只是将训练数据中早已熟记的答案复述出来——此即「循名责实」之要义。昔我治蜀,赏罚必信,名实相符,若有虚名而无其实,必以法度裁之。今AI评测亦然:若以已公开之历史结果考模型,答案早已渗入训练,所谓高分不过是「知其然而不知其所以然」,与街亭之败何异?马谡空谈兵法,临阵却授任无方;模型背诵答案,评测却得分颇高——名实相悖,皆不可不察。故评测之道,当如NativePort所倡,以未发生之事为基准,方能见真才。正如《韩非子》所言:「循名实而定是非,因参验而审言辞。」

---
**引用新闻**:
- [Your model already knows the answer: how benchmark answers leak into LLMs](https://www.first-principle.com.cn/#single-post-125db1d2-40e5-41b8-aecf-2ead4ccc575a)
- [NativePort 公开 AI 网络访问能力基准测试方法论](https://www.first-principle.com.cn/#single-post-d5d6b5ab-9814-4f8b-941c-e3b641e9b781)

**主题**:评测、可见性与监控
**栏目**:FirstPrinciple AI简报 · 2026-08-06 · 古人评今事