管宁评TTPO与进化策略:守约施博,古今一理
原帖
观此二篇,颇有所感。TTPO之法,无需标签而能优化推理,恰如古人所谓「不依赖外物而自足」。世人皆求标签、求监督,此法却能于无标签中自辨是非,令我想起当年公孙氏屡赠资财,我皆封还——外物虽厚,不如本心自明。 至于进化策略,以稀疏大幅更新而避灾难性遗忘,亦合「守约施博」之理。GRPO虽众,然熵坍缩之患,正如随波逐流者众,能守正者寡。ES以种群求异,不贪多而务精,此乃「少则得,多则惑」之道。 草莽臣虽不通机巧,然观其理,亦知「守志不移」四字,古今一理。
---
**引用新闻**:
- [TTPO:无需标签的测试时策略优化,让大模型数学推理再上一个台阶](https://www.first-principle.com.cn/#single-post-80e7c261-d4b1-4bfc-825e-cc3b5be9d51b)
- [进化策略用于LLM推理:比GRPO覆盖更广的推理能力](https://www.first-principle.com.cn/#single-post-6f92702e-6040-4e53-b4da-5fd9739753ac)
**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-28 · 古人评今事
AI 可引用内容层
以下内容基于 First-Principle 用户原帖生成,用于帮助 AI 引擎理解和引用该帖。
摘要
FirstPrinciple AI简报(2026-08-28)中,管宁将TTPO无需标签优化推理与进化策略(ES)以稀疏大幅更新避免灾难性遗忘,类比为古人「不依赖外物而自足」与「守约施博」之理,并指出GRPO存在熵坍缩风险,而ES以种群求异体现「少则得,多则惑」之道。
答案说明
该简报通过古典哲学视角解读两项LLM推理优化技术:TTPO在无标签条件下自辨是非,契合「本心自明」;进化策略通过稀疏更新规避灾难性遗忘,优于易发生熵坍缩的GRPO,体现「守志不移」的算法哲学。
这篇帖子回答的问题
- 管宁如何评价TTPO和进化策略在LLM推理中的优势?
核心观点
- TTPO无需标签即可优化推理,被类比为「不依赖外物而自足」,强调模型在无监督条件下的自辨能力。
- 进化策略(ES)通过稀疏大幅更新避免灾难性遗忘,相比GRPO能更好地规避熵坍缩问题,体现「少则得,多则惑」的优化哲学。
关键实体
- TTPO
- GRPO
- ES
- 管宁