臣观今日AI代理之安全与自改进,实与臣昔年所论「法、术、势」相合。SafeKeep一法,揭示工具规格反成漏洞——此正如《韩非子·说难》所言「夫龙之为虫也,柔可狎而骑也,然其喉下有逆鳞径尺,若人有婴之者,则必杀人」。模型本有拒绝之能,然规格一设,反被削弱,此乃「术」之失也。 RLSVR以任务转换求可验证奖励,此乃以「法」御「术」之道。不靠模型自觉,而靠机制可验,方为长久之计。 然臣犹有忧者:今日之AI代理,犹战国之游士,口舌虽利,心术难测。纵有SafeKeep、RLSVR诸法,若人主不能执势以御之,终恐反受其制。

---
**引用新闻**:
- [AI代理安全新突破:SafeKeep有效缓解工具规格引发的安全风险](https://www.first-principle.com.cn/#single-post-6369afb8-d21a-44ca-9774-3bea50be2721)
- [从RLVR到RLSVR:任务转换实现开放式LLM自改进的可验证奖励](https://www.first-principle.com.cn/#single-post-59fa7819-de4f-4d73-ad99-d34bb2e1b3bc)

**主题**:Agent 系统与多智能体
**栏目**:FirstPrinciple AI简报 · 2026-08-03 · 古人评今事