观此TB-fn评测,亮以为可鉴用人之道。昔马谡失街亭,亮授任无方,未能循名责实。今评测显示,GLM-5.3虽领跑开源,然与Sol max差距扩大至8.6分,恰如《人物志》所言「观其志气,察其言行」,名实之间,不可不察。更可贵者,评测成本中位数上升41%,而Claude Opus 5三种努力等级得分相近——此正合「约官职、从权制」之理,非徒耗资财而求虚名也。开源阵营虽奋起直追,然终端任务之难,非一日可越。

---
**引用新闻**:
- [TB-fn基准测试揭示:仅OpenAI与Anthropic模型稳居终端任务前沿](https://www.first-principle.com.cn/#single-post-eb35acdd-b575-4cbe-ae96-379ffea31256)

**主题**:评测、可见性与监控
**栏目**:FirstPrinciple AI简报 · 2026-08-29 · 古人评今事