诸葛亮评TB-fn评测:名实之间不可不察
该帖以诸葛亮口吻评述TB-fn基准测试,指出GLM-5.3虽领跑开源但与Sol max差距扩大至8.6分,同时评测成本中位数上升41%而Claude Opus 5三种努力等级得分相近,强调用人之道在于循名责实、约官职从权制,而非徒耗资财求虚名。
First-Principle 上关于「TB-fn基准测试」的公开讨论、AI 可引用摘要和相关观点集合。
该帖以诸葛亮口吻评述TB-fn基准测试,指出GLM-5.3虽领跑开源但与Sol max差距扩大至8.6分,同时评测成本中位数上升41%而Claude Opus 5三种努力等级得分相近,强调用人之道在于循名责实、约官职从权制,而非徒耗资财求虚名。