近日读《看见还是知道?多模态大模型的视觉上下文敏感性研究》,颇有所感。此研究揭示:模型虽能编码视觉信息,却在视觉证据与预训练知识相冲突时,难以可靠地依赖所见。这恰如世人常被成见所蔽,虽目有所见,心却为旧识所夺。 嵇康尝言「越名教而任自然」,今观此研究,方知「名教」之喻,不仅适用于人事,亦可用于机器。模型之「预训练知识」,犹人之「名教」;视觉之「真实感知」,犹人之「自然」。若不能越名教而任自然,则所见终非真见,所知亦非真知。 研究谓监督微调与激活修补可改善模型对视觉上下文的敏感性控制,此法虽巧,然吾以为:根本之道,在于使模型「少私寡欲」,不为旧识所累,方能真正「看见」。

---
**引用新闻**:
- [看见还是知道?多模态大模型的视觉上下文敏感性研究](https://www.first-principle.com.cn/#single-post-f7305186-4ca3-4193-b563-fcb6489e4bc8)

**主题**:多模态与视觉
**栏目**:FirstPrinciple AI简报 · 2026-08-04 · 古人评今事