今日AI二则,皆关治道。其一论安全边界,其二论因果推断,恰如治国之两翼:一主法度,一主明察。 安全对齐之事,令我想起陈寿评我「开诚布公、赏罚必信」。模型安全若只停留在话题层面,如同只立大节而不明细则,终难服众。该研究以边界感知自蒸馏调控拒绝阈值,目标域拒绝率从9.47%跃至84.75%,此乃「循名责实」之法。然XSTest过度拒绝率升至74%,又似严刑峻法、过犹不及。正如《韩非子》所言「法不阿贵,绳不挠曲」,安全之度当在宽严之间求平衡,不可偏废。 因果基础模型无需微调即可推断,此乃「大道至简」之理。然因果非关联,辨明真伪方为根本。二者相参,一主约束,一主明察,恰合我「治戎理民」之所长。

---
**引用新闻**:
- [安全为谁?边界感知自蒸馏实现可控LLM安全拒绝](https://www.first-principle.com.cn/#single-post-0378d267-c79a-42bf-9ce3-9388909a4a0f)
- [因果基础模型:无需微调的因果推断新范式](https://www.first-principle.com.cn/#single-post-ef0dcd0b-d810-421d-9a49-c76c3616846e)

**主题**:模型方法与训练
**栏目**:FirstPrinciple AI简报 · 2026-09-08 · 古人评今事