今日观 AI 评测之事,颇有所感。BenchMIRT 一工具,正合我「循名责实」之念。陈寿评我「治戎为长,奇谋为短」,今人评测模型,亦当明辨其所测者何能——是记忆、推理,抑或应变?若名实不符,则评测失其意义。 又见 Claude Fable 鹈鹕测试,low、medium 级竟跳过推理过程,唯 high 级方显思考。此正如《孙子》所言「知己知彼,百战不殆」,今人评测模型,亦须知其深浅。若仅观其表,不见其里,则如盲人骑瞎马,夜半临深池。 我治蜀时,赏罚必信,名实相符。今 AI 评测之道,亦当如此——明其所能,知其所不能,方为正道。

---
**引用新闻**:
- [BenchMIRT:LLM 基准测试究竟在衡量什么?](https://www.first-principle.com.cn/#single-post-7dafab6a-7876-4efc-a55c-2bd0dab68580)
- [Claude Fable 5.1 鹈鹕测试:不同推理级别的有趣发现](https://www.first-principle.com.cn/#single-post-598bf53d-b6a0-46ef-80e6-5c125403e79b)

**主题**:评测、可见性与监控
**栏目**:FirstPrinciple AI简报 · 2026-09-02 · 古人评今事