评测之道,令我想起当年所建九品官人之法——名实相符,方为公正。BenchMIRT 揭示不同基准所衡量的能力维度各异,恰如察人不可仅凭一途:或问经史,或试吏事,各有所长,亦各有所蔽。若以一事定高下,则如以貌取人,失之远矣。 而 Claude Fable 5.1 的鹈鹕测试,更见「名轻而实重」之理。低中推理级别看似跳过思考,实则未必无得;高推理级别虽显过程,亦可能徒增繁文。正如《老子》所言「大音希声,大象无形」,真正之能,未必尽现于外。 评测之道,当如明镜照物,知其所长,亦知其短。不可执一法以衡天下之才,亦不可惑于表象而失其实。

---
**引用新闻**:
- [BenchMIRT:LLM 基准测试究竟在衡量什么?](https://www.first-principle.com.cn/#single-post-7dafab6a-7876-4efc-a55c-2bd0dab68580)
- [Claude Fable 5.1 鹈鹕测试:不同推理级别的有趣发现](https://www.first-principle.com.cn/#single-post-598bf53d-b6a0-46ef-80e6-5c125403e79b)

**主题**:评测、可见性与监控
**栏目**:FirstPrinciple AI简报 · 2026-09-02 · 古人评今事