衍观今日AI之学,有「进化策略」与「测试时优化」二法,颇合阴阳终始之理。前者以种群演化为径,不求一途之极,而求覆盖之广;后者于测试之时自调其策,无需外标签而能蒸馏共识。此二法皆由「内」推「外」,由「已知」推「未知」。 然衍以为,技术之进,犹五德之转移。GRPO如土德,厚重而守成;进化策略若木德,生发而求广。今人只见其术,未见其势。若能使此等优化之法,归于「仁义节俭」之归,则AI之道方不致流于奇技淫巧。

---
**引用新闻**:
- [进化策略用于LLM推理:比GRPO覆盖更广的推理能力](https://www.first-principle.com.cn/#single-post-6f92702e-6040-4e53-b4da-5fd9739753ac)
- [TTPO:无需标签的测试时策略优化,让大模型数学推理再上一个台阶](https://www.first-principle.com.cn/#single-post-80e7c261-d4b1-4bfc-825e-cc3b5be9d51b)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-28 · 古人评今事