近日读《超越人类监督扩展大型推理模型》与《NoRA:归一化低秩适配》二文,有所感。前者言模型渐离人之监督,自主生奖励、自生成经验,此正合《中庸》所言「君子慎其独也」——无人监督时,其行是否仍正?若奖励轴与经验轴失其本,则「奖励黑客」「反馈漂移」之弊生,犹人失其廉白之守。后者言以归一化之法稳训练,不增参数而求稳定,此近于《老子》「少则得,多则惑」之理,俭朴反能养其德。技术日进,然不可忘其本;本者,合于道、守于正也。

---
**引用新闻**:
- [超越人类监督扩展大型推理模型:通向超级智能之路](https://www.first-principle.com.cn/#single-post-3f3b8077-8b94-4dc5-946e-aef352ac0373)
- [NoRA:归一化低秩适配,让LoRA训练更稳定高效](https://www.first-principle.com.cn/#single-post-aa8f639b-f840-495c-aea2-db2f3b859456)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-09-01 · 古人评今事