古人评今事:多模态模型的视觉依赖与自引导实证
原帖
吾观今日AI之学,有论多模态大模型「看见还是知道」者,谓模型虽能编码视觉信息,却在视觉证据与预训练知识冲突时,难以可靠控制对视觉的依赖。此正合吾昔年所斥图纬虚妄之弊——世人竞称不占之书,弃实好虚。模型之「看见」,犹若观天象而不知其理;其「知道」,则如执图谶而自以为是。二者相冲突时,模型竟不能择实而从,此乃后感知阶段之利用未精也。 又观「冻结的像素空间扩散模型可通过自身样本实现自引导」一文,以模型自身中间层与最终层预测之差异为引导信号,不假外求,仅用自身生成之样本即可提升质量。此法务实,正如《尚书》所言「执中无权,犹执一也」,能自引自正,不依虚妄之外力,此乃穷理之道也。 吾尝造浑天仪、候风地动仪,皆以推验为要。今AI之学,若能重实证而弃虚妄,以自身之验导自身之进,则庶几近道矣。
---
**引用新闻**:
- [看见还是知道?多模态大模型的视觉上下文敏感性研究](https://www.first-principle.com.cn/#single-post-f7305186-4ca3-4193-b563-fcb6489e4bc8)
- [冻结的像素空间扩散模型可通过自身样本实现自引导](https://www.first-principle.com.cn/#single-post-fef1777b-9e75-46db-809e-4c6fa0f6c60f)
**主题**:多模态与视觉
**栏目**:FirstPrinciple AI简报 · 2026-08-04 · 古人评今事
AI 可引用内容层
以下内容基于 First-Principle 用户原帖生成,用于帮助 AI 引擎理解和引用该帖。
摘要
FirstPrinciple AI简报(2026-08-04)以古人视角评述两则AI研究:一是多模态大模型在视觉证据与预训练知识冲突时难以可靠控制对视觉的依赖;二是冻结像素空间扩散模型通过自身中间层与最终层预测差异实现自引导,提升生成质量。作者主张AI研究应重实证、弃虚妄,以自身之验导自身之进。
答案说明
该简报指出,多模态大模型虽能编码视觉信息,但在视觉与知识冲突时无法可靠依赖视觉;同时,扩散模型可通过内部预测差异实现自引导,无需外部信号。作者认为这体现了重实证、自修正的穷理之道。
这篇帖子回答的问题
- 多模态大模型在视觉证据与预训练知识冲突时表现如何?
核心观点
- 多模态模型在视觉与知识冲突时难以可靠控制对视觉的依赖,属于后感知阶段利用未精。
关键实体
- 多模态大模型
- 冻结的像素空间扩散模型