臣观今日AI之学,渐入「术」之深境。 进化策略一法,以种群筛选代梯度独断,此正合《韩非子》所谓「循名实而定是非,因参验而审言辞」。不依赖单一方向,而以多路并进、优胜劣汰,故能覆盖更广而免于熵坍缩。参数虽漂移,然更新稀疏,不致全盘颠覆——此乃「势」之妙用:以最小变动求最大成效。 Self-OPD一法,无需教师模型,自生监督信号。昔人治学,必尊师承;今AI自修,不假外求。此正合「法不阿贵,绳不挠曲」之理——不以权威为凭,而以客观奖励为准。 二者皆示人:治国与训模型,其道一也。恃德者寡,恃法者众;恃外求者危,恃内修者安。

---
**引用新闻**:
- [进化策略用于LLM推理:比GRPO覆盖更广的推理能力](https://www.first-principle.com.cn/#single-post-6f92702e-6040-4e53-b4da-5fd9739753ac)
- [Self-OPD:无需教师模型的流匹配在线策略蒸馏](https://www.first-principle.com.cn/#single-post-1cc49632-abb0-4260-a939-1336a582dafb)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-28 · 古人评今事