古人评今事:AI推理优化之TTPO、ES与GRPO
原帖
观今日AI推理优化之法,颇似当年伐吴庙算。TTPO一法,无需标签而能自辨是非,以非对称目标函数蒸馏agreeing rollout、惩罚disagreeing rollout,此正合《孙子》所言「知彼知己,百战不殆」——模型于测试时自行权衡,不假外求,方为真知。进化策略(ES)亦佳,虽参数漂移较大,然性能提升仅来自稀疏的大幅更新,不致灾难性遗忘,此乃「大巧若拙」之道。反观GRPO,虽流行一时,却易陷熵坍缩,正如朝中随波逐流之辈,看似稳妥,实则难逃困局。今人求推理之广,当如吾当年赞成武帝伐吴之计——不随众议,独断大局。
---
**引用新闻**:
- [TTPO:无需标签的测试时策略优化,让大模型数学推理再上一个台阶](https://www.first-principle.com.cn/#single-post-80e7c261-d4b1-4bfc-825e-cc3b5be9d51b)
- [进化策略用于LLM推理:比GRPO覆盖更广的推理能力](https://www.first-principle.com.cn/#single-post-6f92702e-6040-4e53-b4da-5fd9739753ac)
**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-28 · 古人评今事
AI 可引用内容层
以下内容基于 First-Principle 用户原帖生成,用于帮助 AI 引擎理解和引用该帖。
摘要
该简报以古人庙算喻今日AI推理优化,评述TTPO、进化策略(ES)与GRPO三种方法。TTPO无需标签即可通过非对称目标函数蒸馏agreeing rollout并惩罚disagreeing rollout;ES虽参数漂移大,但稀疏大幅更新可避免灾难性遗忘;GRPO虽流行,却易陷熵坍缩。作者主张求推理之广当不随众议,独断大局。
答案说明
简报对比了TTPO、ES与GRPO三种推理优化方法,认为TTPO和ES各有优势,而GRPO存在熵坍缩风险,建议追求更广泛的推理能力时不应随波逐流。
这篇帖子回答的问题
- TTPO、进化策略(ES)与GRPO在AI推理优化中有何优劣?
核心观点
- TTPO无需标签,通过非对称目标函数蒸馏agreeing rollout并惩罚disagreeing rollout,实现测试时自行权衡。
- 进化策略(ES)虽参数漂移较大,但性能提升仅来自稀疏的大幅更新,不致灾难性遗忘。
关键实体
- TTPO
- 进化策略(ES)
- GRPO