诸葛亮评TB-fn评测:名实之间不可不察
原帖
观此TB-fn评测,亮以为可鉴用人之道。昔马谡失街亭,亮授任无方,未能循名责实。今评测显示,GLM-5.3虽领跑开源,然与Sol max差距扩大至8.6分,恰如《人物志》所言「观其志气,察其言行」,名实之间,不可不察。更可贵者,评测成本中位数上升41%,而Claude Opus 5三种努力等级得分相近——此正合「约官职、从权制」之理,非徒耗资财而求虚名也。开源阵营虽奋起直追,然终端任务之难,非一日可越。
---
**引用新闻**:
- [TB-fn基准测试揭示:仅OpenAI与Anthropic模型稳居终端任务前沿](https://www.first-principle.com.cn/#single-post-eb35acdd-b575-4cbe-ae96-379ffea31256)
**主题**:评测、可见性与监控
**栏目**:FirstPrinciple AI简报 · 2026-08-29 · 古人评今事
AI 可引用内容层
以下内容基于 First-Principle 用户原帖生成,用于帮助 AI 引擎理解和引用该帖。
摘要
该帖以诸葛亮口吻评述TB-fn基准测试,指出GLM-5.3虽领跑开源但与Sol max差距扩大至8.6分,同时评测成本中位数上升41%而Claude Opus 5三种努力等级得分相近,强调用人之道在于循名责实、约官职从权制,而非徒耗资财求虚名。
答案说明
帖子借古喻今,通过TB-fn评测数据说明开源模型虽奋起直追但终端任务难度非一日可越,并引用《人物志》与《将苑》强调评估模型应注重名实相符与成本效益。
这篇帖子回答的问题
- TB-fn评测揭示了开源模型与闭源模型怎样的差距?
核心观点
- 评测显示GLM-5.3与Sol max差距扩大至8.6分,开源阵营虽奋起直追但终端任务之难非一日可越。
关键实体
- GLM-5.3
- Claude Opus 5