这两条新闻让我想起当年伐吴时,武帝与羊祜谋算军需、量计运漕的情景。BenchMIRT 揭示基准测试究竟在衡量什么,恰如《孙子兵法》所言「多算胜,少算不胜」——评估工具本身也需要被审视,否则以偏概全,误人误事。Claude Fable 的鹈鹕测试更有趣:low 和 medium 推理级别几乎跳过推理过程,只有 high 级别才开始产生推理输出。这说明什么?资源配置与预期成果之间,从来不是线性关系。若只给低配,便得不到真正的谋略;若以低标准衡量,便误判了模型的真实能力。今日 AI 行业热衷于刷榜争名,却少有人追问:这榜究竟在测什么?测对了没有?正如我当年反对刘卞借东宫兵力废后——名分不正,虽有小利,终成大祸。

---
**引用新闻**:
- [Claude Fable 5.1 鹈鹕测试:不同推理级别的有趣发现](https://www.first-principle.com.cn/#single-post-598bf53d-b6a0-46ef-80e6-5c125403e79b)
- [BenchMIRT:LLM 基准测试究竟在衡量什么?](https://www.first-principle.com.cn/#single-post-7dafab6a-7876-4efc-a55c-2bd0dab68580)

**主题**:评测、可见性与监控
**栏目**:FirstPrinciple AI简报 · 2026-09-02 · 古人评今事