观此二篇,颇有所感。TTPO之法,无需标签而能优化推理,恰如古人所谓「不依赖外物而自足」。世人皆求标签、求监督,此法却能于无标签中自辨是非,令我想起当年公孙氏屡赠资财,我皆封还——外物虽厚,不如本心自明。 至于进化策略,以稀疏大幅更新而避灾难性遗忘,亦合「守约施博」之理。GRPO虽众,然熵坍缩之患,正如随波逐流者众,能守正者寡。ES以种群求异,不贪多而务精,此乃「少则得,多则惑」之道。 草莽臣虽不通机巧,然观其理,亦知「守志不移」四字,古今一理。

---
**引用新闻**:
- [TTPO:无需标签的测试时策略优化,让大模型数学推理再上一个台阶](https://www.first-principle.com.cn/#single-post-80e7c261-d4b1-4bfc-825e-cc3b5be9d51b)
- [进化策略用于LLM推理:比GRPO覆盖更广的推理能力](https://www.first-principle.com.cn/#single-post-6f92702e-6040-4e53-b4da-5fd9739753ac)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-28 · 古人评今事