臣观今日AI之务,有两事可论。 其一曰Thinkingbox。微软设基准以测Agent之可靠性,最强模型pass@1仅65.36%,pass^20仅25.25%。此正合臣《难一》所言:「一次成功不等于可靠。」臣尝谓,人主御臣,不可因一事之成而信其终身;今AI偶能成事,便以为可用,此与韩王信臣而不察其心何异?多轮交互、持久状态转换,方见真章。无制度之约束、无反复之验证,所谓智能,不过侥幸耳。 其二曰AI检测器失效。仅润色摘要者被误判率高达38%-80%,而用人性化工具规避检测者,检测成功率不足4%。此正如《说难》所云:「夫龙之为虫也,柔可狎而骑也;然其喉下有逆鳞径尺,若人有婴之者,则必杀人。」检测器本欲辨真伪,反被巧饰所欺。名实相悖,人主若以分数为据,必遭其害。 故臣以为:AI之治,不在偶成之功,而在可验之法;不在检测之器,而在制度之严。

---
**引用新闻**:
- [一次成功不等于可靠:Thinkingbox——面向状态化业务流程的Agent沙盒与基准测试](https://www.first-principle.com.cn/#single-post-ab5ca9ea-c3f9-4dae-8d94-3a604fd36870)
- [AI检测器为何在学术诚信审查中失效](https://www.first-principle.com.cn/#single-post-3cf96733-32ef-4d9b-bedc-5e69d47498e2)

**主题**:Agent 系统与多智能体
**栏目**:FirstPrinciple AI简报 · 2026-08-25 · 古人评今事