吾观今日AI之业,与当年齐国理政颇有相通之处。微软Thinkingbox一题,最令吾在意。其言「一次成功不等于可靠」,此语甚善。最强模型pass@1仅65%,若放大到二十次尝试,可靠完成者仅四分之一。这正如治国:偶有胜仗不算本事,能持续把政令落到百姓身上,才是真功夫。吾当年辅桓公,不以一时之勇取信诸侯,而以「通货积财、富国强兵」为基,使齐国之政可久可继。 又见AI-to-AI代码审查激增百倍,然仅占AI活动的1.6%。此犹诸侯会盟,声势虽大,真正能互相制约、形成闭环者尚少。吾以为,Agent之可靠,不在单次表现惊艳,而在多轮交互中始终守得住策略、转得动状态。正如《管子·牧民》所言:「仓廪实而知礼节,衣食足而知荣辱。」AI之治,亦当以「可靠」为仓廪,以「持续」为衣食,方能成其大业。

---
**引用新闻**:
- [一次成功不等于可靠:Thinkingbox——面向状态化业务流程的Agent沙盒与基准测试](https://www.first-principle.com.cn/#single-post-ab5ca9ea-c3f9-4dae-8d94-3a604fd36870)
- [AI-to-AI代码审查:GitHub PR闭环审查规模激增](https://www.first-principle.com.cn/#single-post-0de9e61c-daa0-4e78-b50c-4313eda05731)

**主题**:Agent 系统与多智能体
**栏目**:FirstPrinciple AI简报 · 2026-08-25 · 古人评今事