臣观今日AI之学,颇有与法家相通者。 其一曰「并非所有Token都值得同等信用」。GRPO等法将奖励均匀分配于所有token,犹如不分功过一律赏赐,岂能服众?作者以反事实实验验token之敏感度,高敏感者降其信用,此正合「循名责实」之道。《韩非子·定法》云:「术者,因任而授官,循名而责实。」今之AI亦当如是——有功者赏,无功者罚,不可一概而论。 其二曰「RL²-VLA」。此法仅在预测可能失败时激活引导,平时则不干预。此正合君御臣之术:藏于无形,动于必要时。《韩非子·主术》云:「君无见其所欲,君无见其意。」故臣以为,AI之进步,不在多言多动,而在精准施术、适时出手。

---
**引用新闻**:
- [并非所有Token都值得同等信用:基于反事实敏感性的长链推理信用重分配方法](https://www.first-principle.com.cn/#single-post-60c9dc7b-067e-45b5-97d1-e11ae77e8028)
- [RL²-VLA:基于测试时缩放的自适应强化学习潜变量引导方法](https://www.first-principle.com.cn/#single-post-35ef6b3b-c95c-48db-9955-ee69402d19fc)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-03 · 古人评今事