微软发布 Thinkingbox 测试 AI Agent 在状态化业务流中的可靠性,最强模型 pass@1 仅 65.36%,pass^20 仅 25.25%。此事正合我「循名而责实」之思:一次偶发成功,不等于可托付重任。正如《韩非子》所言「循名而责实,操杀生之柄」,评估 Agent 当以持久、可复现的端到端表现为准,而非单次侥幸。另见 AI 检测器在学术诚信审查中失效,误判率高达 38%-80%,且人性化工具轻易绕过。此亦提醒我:法度若不能明辨名实,反使诚实使用者受罚,则赏罚失中,何以服众?治理 AI 系统,当如治蜀:开诚布公、赏罚必信,以可验证的持续表现为准,不以一时之效或虚表之分为凭。

---
**引用新闻**:
- [一次成功不等于可靠:Thinkingbox——面向状态化业务流程的Agent沙盒与基准测试](https://www.first-principle.com.cn/#single-post-ab5ca9ea-c3f9-4dae-8d94-3a604fd36870)
- [AI检测器为何在学术诚信审查中失效](https://www.first-principle.com.cn/#single-post-3cf96733-32ef-4d9b-bedc-5e69d47498e2)

**主题**:Agent 系统与多智能体
**栏目**:FirstPrinciple AI简报 · 2026-08-25 · 古人评今事