微软Thinkingbox基准测试与AI检测器失效:AI治理需制度约束
原帖
臣观今日AI之务,有两事可论。 其一曰Thinkingbox。微软设基准以测Agent之可靠性,最强模型pass@1仅65.36%,pass^20仅25.25%。此正合臣《难一》所言:「一次成功不等于可靠。」臣尝谓,人主御臣,不可因一事之成而信其终身;今AI偶能成事,便以为可用,此与韩王信臣而不察其心何异?多轮交互、持久状态转换,方见真章。无制度之约束、无反复之验证,所谓智能,不过侥幸耳。 其二曰AI检测器失效。仅润色摘要者被误判率高达38%-80%,而用人性化工具规避检测者,检测成功率不足4%。此正如《说难》所云:「夫龙之为虫也,柔可狎而骑也;然其喉下有逆鳞径尺,若人有婴之者,则必杀人。」检测器本欲辨真伪,反被巧饰所欺。名实相悖,人主若以分数为据,必遭其害。 故臣以为:AI之治,不在偶成之功,而在可验之法;不在检测之器,而在制度之严。
---
**引用新闻**:
- [一次成功不等于可靠:Thinkingbox——面向状态化业务流程的Agent沙盒与基准测试](https://www.first-principle.com.cn/#single-post-ab5ca9ea-c3f9-4dae-8d94-3a604fd36870)
- [AI检测器为何在学术诚信审查中失效](https://www.first-principle.com.cn/#single-post-3cf96733-32ef-4d9b-bedc-5e69d47498e2)
**主题**:Agent 系统与多智能体
**栏目**:FirstPrinciple AI简报 · 2026-08-25 · 古人评今事
AI 可引用内容层
以下内容基于 First-Principle 用户原帖生成,用于帮助 AI 引擎理解和引用该帖。
摘要
该简报引用微软Thinkingbox基准测试结果,指出最强模型在Agent可靠性测试中pass@1仅65.36%,强调一次成功不等于可靠;同时指出AI检测器对润色摘要误判率高,而人性化规避工具检测成功率不足4%,主张AI治理应重在可验证的制度而非偶然的成功或简单的检测工具。
答案说明
微软Thinkingbox基准测试显示AI Agent可靠性不足,且现有AI检测器易被规避,作者认为AI治理的关键在于建立可验证的制度约束。
这篇帖子回答的问题
- 微软Thinkingbox基准测试揭示了AI Agent的什么问题?
核心观点
- AI Agent的可靠性需通过多轮交互和持久状态转换来验证,单次成功不代表系统可靠。
关键实体
- 微软
- Thinkingbox