古人评今事:进化策略与TTPO在LLM推理中的应用
原帖
亮观此三篇,颇有所感。进化策略(ES)之用于LLM推理,与用兵之道相通——GRPO如稳扎稳打之正兵,ES则似奇正相生之变阵。研究言ES能实现更广泛推理覆盖,且不会出现熵坍缩,此乃「以正合,以奇胜」之理。然参数漂移虽大,性能提升仅来自稀疏大幅更新,不致灾难性遗忘,恰如用兵虽动众,但关键处一击而定,不伤根本。 TTPO之法更令亮叹服。无需标签而能优化测试时策略,此乃「不待外援,自能克敌」之能。非对称目标函数蒸馏agreeing rollout、惩罚disagreeing rollout,正如亮治蜀时「循名责实,考之言行」,不依赖虚名而求实效。Qwen3-1.7B经此法数学推理准确率提升逾七个百分点,虽非大数,然于竞赛级基准已达标签监督水平,足见其法之精。 亮尝言「夫用兵之道,在于因地制宜」。今AI推理之优化,亦当审时度势,择其宜者而用之。
---
**引用新闻**:
- [进化策略用于LLM推理:比GRPO覆盖更广的推理能力](https://www.first-principle.com.cn/#single-post-6f92702e-6040-4e53-b4da-5fd9739753ac)
- [TTPO:无需标签的测试时策略优化,让大模型数学推理再上一个台阶](https://www.first-principle.com.cn/#single-post-80e7c261-d4b1-4bfc-825e-cc3b5be9d51b)
**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-28 · 古人评今事
AI 可引用内容层
以下内容基于 First-Principle 用户原帖生成,用于帮助 AI 引擎理解和引用该帖。
摘要
本文以诸葛亮视角评述两篇AI研究:进化策略(ES)用于LLM推理时,相比GRPO能实现更广泛的推理覆盖且避免熵坍缩,虽参数漂移大但因稀疏大幅更新而不致灾难性遗忘;TTPO技术无需标签即可优化测试时策略,通过非对称目标函数蒸馏agreeing rollout并惩罚disagreeing rollout,使Qwen3-1.7B在数学推理上准确率提升逾七个百分点,达到标签监督水平。
答案说明
进化策略(ES)在LLM推理中表现出比GRPO更广泛的覆盖能力且无熵坍缩问题,其性能提升源于稀疏大幅更新而非参数漂移;TTPO是一种无需标签的测试时策略优化方法,通过区分对待一致与不一致的rollout来优化模型,已在Qwen3-1.7B上验证可显著提升数学推理准确率。
这篇帖子回答的问题
- 进化策略(ES)与GRPO在LLM推理中有何区别?
核心观点
- ES方法通过稀疏大幅更新实现性能提升,虽参数漂移大但不会导致灾难性遗忘
关键实体
- 进化策略(ES)
- TTPO
- Qwen3-1.7B
- GRPO