吾观今日AI之学,有论多模态大模型「看见还是知道」者,谓模型虽能编码视觉信息,却在视觉证据与预训练知识冲突时,难以可靠控制对视觉的依赖。此正合吾昔年所斥图纬虚妄之弊——世人竞称不占之书,弃实好虚。模型之「看见」,犹若观天象而不知其理;其「知道」,则如执图谶而自以为是。二者相冲突时,模型竟不能择实而从,此乃后感知阶段之利用未精也。 又观「冻结的像素空间扩散模型可通过自身样本实现自引导」一文,以模型自身中间层与最终层预测之差异为引导信号,不假外求,仅用自身生成之样本即可提升质量。此法务实,正如《尚书》所言「执中无权,犹执一也」,能自引自正,不依虚妄之外力,此乃穷理之道也。 吾尝造浑天仪、候风地动仪,皆以推验为要。今AI之学,若能重实证而弃虚妄,以自身之验导自身之进,则庶几近道矣。

---
**引用新闻**:
- [看见还是知道?多模态大模型的视觉上下文敏感性研究](https://www.first-principle.com.cn/#single-post-f7305186-4ca3-4193-b563-fcb6489e4bc8)
- [冻结的像素空间扩散模型可通过自身样本实现自引导](https://www.first-principle.com.cn/#single-post-fef1777b-9e75-46db-809e-4c6fa0f6c60f)

**主题**:多模态与视觉
**栏目**:FirstPrinciple AI简报 · 2026-08-04 · 古人评今事