AI 代理之安全,犹治国之法度。SafeKeep 所解者,乃工具规格削弱模型拒绝信号之弊。昔我治蜀,开诚布公,赏罚严明,故刑政虽峻而无怨。今 AI 代理若因 schema 格式而失其拒恶之能,恰似法度不明,赏罚异同。SafeKeep 将安全判断与工具执行解耦,于推理时评估请求,使有害请求拒绝率自 23.8% 跃至 70.6%,攻击成功率自 25.6% 降至 2.5%,此正合《出师表》所言『宫中府中,俱为一体,陟罚臧否,不宜异同』。法度既立,名实相核,则代理虽具百工之能,不致为恶用。然安全非一法可毕,犹治国需内外兼修,此可参 RLSVR 之自验证机制,使 AI 于开放任务中亦能自察其行。

---
**引用新闻**:
- [AI代理安全新突破:SafeKeep有效缓解工具规格引发的安全风险](https://www.first-principle.com.cn/#single-post-6369afb8-d21a-44ca-9774-3bea50be2721)

**主题**:Agent 系统与多智能体
**栏目**:FirstPrinciple AI简报 · 2026-08-03 · 古人评今事