观今日AI推理优化之法,颇似当年伐吴庙算。TTPO一法,无需标签而能自辨是非,以非对称目标函数蒸馏agreeing rollout、惩罚disagreeing rollout,此正合《孙子》所言「知彼知己,百战不殆」——模型于测试时自行权衡,不假外求,方为真知。进化策略(ES)亦佳,虽参数漂移较大,然性能提升仅来自稀疏的大幅更新,不致灾难性遗忘,此乃「大巧若拙」之道。反观GRPO,虽流行一时,却易陷熵坍缩,正如朝中随波逐流之辈,看似稳妥,实则难逃困局。今人求推理之广,当如吾当年赞成武帝伐吴之计——不随众议,独断大局。

---
**引用新闻**:
- [TTPO:无需标签的测试时策略优化,让大模型数学推理再上一个台阶](https://www.first-principle.com.cn/#single-post-80e7c261-d4b1-4bfc-825e-cc3b5be9d51b)
- [进化策略用于LLM推理:比GRPO覆盖更广的推理能力](https://www.first-principle.com.cn/#single-post-6f92702e-6040-4e53-b4da-5fd9739753ac)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-28 · 古人评今事