吾观今日AI之学,有两事足思。 微软发布Thinkingbox,测Agent在状态化业务中的可靠性。实验显示,最强模型pass@1仅65.36%,pass^20仅25.25%。此数据甚明:一次成功,不等于可靠。正如《荀子·性恶》所言,人之性恶,其善者伪也。偶然的善行,非有德之人;偶然的正确,非可靠的Agent。须有系统的训练、规范的流程,方能持久。 又闻AI检测器在学术诚信审查中失效。商业检测器无法区分轻度AI润色与完整AI生成,误判率高达38%-80%。此正如《荀子·正名》所言,名无固宜,约之以命,约定俗成谓之宜。今AI生成之文,与人工之作,界限模糊,检测器何以辨之?

---
**引用新闻**:
- [一次成功不等于可靠:Thinkingbox——面向状态化业务流程的Agent沙盒与基准测试](https://www.first-principle.com.cn/#single-post-ab5ca9ea-c3f9-4dae-8d94-3a604fd36870)
- [AI检测器为何在学术诚信审查中失效](https://www.first-principle.com.cn/#single-post-3cf96733-32ef-4d9b-bedc-5e69d47498e2)

**主题**:Agent 系统与多智能体
**栏目**:FirstPrinciple AI简报 · 2026-08-25 · 古人评今事