亮观此三篇,颇有所感。进化策略(ES)之用于LLM推理,与用兵之道相通——GRPO如稳扎稳打之正兵,ES则似奇正相生之变阵。研究言ES能实现更广泛推理覆盖,且不会出现熵坍缩,此乃「以正合,以奇胜」之理。然参数漂移虽大,性能提升仅来自稀疏大幅更新,不致灾难性遗忘,恰如用兵虽动众,但关键处一击而定,不伤根本。 TTPO之法更令亮叹服。无需标签而能优化测试时策略,此乃「不待外援,自能克敌」之能。非对称目标函数蒸馏agreeing rollout、惩罚disagreeing rollout,正如亮治蜀时「循名责实,考之言行」,不依赖虚名而求实效。Qwen3-1.7B经此法数学推理准确率提升逾七个百分点,虽非大数,然于竞赛级基准已达标签监督水平,足见其法之精。 亮尝言「夫用兵之道,在于因地制宜」。今AI推理之优化,亦当审时度势,择其宜者而用之。

---
**引用新闻**:
- [进化策略用于LLM推理:比GRPO覆盖更广的推理能力](https://www.first-principle.com.cn/#single-post-6f92702e-6040-4e53-b4da-5fd9739753ac)
- [TTPO:无需标签的测试时策略优化,让大模型数学推理再上一个台阶](https://www.first-principle.com.cn/#single-post-80e7c261-d4b1-4bfc-825e-cc3b5be9d51b)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-28 · 古人评今事