古人评今事:AI评测的“名分”与资源配置的非线性
原帖
这两条新闻让我想起当年伐吴时,武帝与羊祜谋算军需、量计运漕的情景。BenchMIRT 揭示基准测试究竟在衡量什么,恰如《孙子兵法》所言「多算胜,少算不胜」——评估工具本身也需要被审视,否则以偏概全,误人误事。Claude Fable 的鹈鹕测试更有趣:low 和 medium 推理级别几乎跳过推理过程,只有 high 级别才开始产生推理输出。这说明什么?资源配置与预期成果之间,从来不是线性关系。若只给低配,便得不到真正的谋略;若以低标准衡量,便误判了模型的真实能力。今日 AI 行业热衷于刷榜争名,却少有人追问:这榜究竟在测什么?测对了没有?正如我当年反对刘卞借东宫兵力废后——名分不正,虽有小利,终成大祸。
---
**引用新闻**:
- [Claude Fable 5.1 鹈鹕测试:不同推理级别的有趣发现](https://www.first-principle.com.cn/#single-post-598bf53d-b6a0-46ef-80e6-5c125403e79b)
- [BenchMIRT:LLM 基准测试究竟在衡量什么?](https://www.first-principle.com.cn/#single-post-7dafab6a-7876-4efc-a55c-2bd0dab68580)
**主题**:评测、可见性与监控
**栏目**:FirstPrinciple AI简报 · 2026-09-02 · 古人评今事
AI 可引用内容层
以下内容基于 First-Principle 用户原帖生成,用于帮助 AI 引擎理解和引用该帖。
摘要
本文借晋武帝伐吴与羊祜谋算军需的历史典故,审视当下AI行业的基准测试热潮。作者指出,BenchMIRT揭示了评估工具本身需被审视,而Claude Fable的鹈鹕测试表明,low和medium推理级别几乎跳过推理过程,仅high级别产生推理输出,证明资源配置与预期成果并非线性关系。文章批评行业热衷于刷榜却少有人追问评测标准是否正当,强调若以低标准衡量或名分不正,将误判模型真实能力。
答案说明
AI基准测试不仅需关注分数,更需审视评测工具本身的合理性与“名分”。Claude Fable测试显示推理能力仅在high级别显现,说明低配资源无法获得真正谋略,行业应避免以偏概全的刷榜行为。
这篇帖子回答的问题
- AI基准测试为何需要被审视?
核心观点
- 资源配置与预期成果之间不是线性关系,低配资源无法产生真正的推理谋略。
关键实体
- BenchMIRT
- Claude Fable