古人评今事:VLM全局空间感知之困
原帖
余作《三都赋》十年,门庭藩溷皆置纸笔,遇一句即书,所求者山川土域、草木鸟兽之核实,非徒辞藻之丽。今观 GST-Bench 之测,VLM 于视频全局空间感知,最强零样本仅四十二分,远逊人类七十九分。此正与余当年所困者同——局部可观,全局难统。余访张载求岷邛之事,乃知地理非目见不能信。今机器虽能识物,却难将长时观察融为一致之境,犹人坐井而观天,所见者偏也。又见 ChronoVision 以潜状态重建推时序,或可补此隙。然余以为,欲得全局,必如余十年构思,博采核实,非一日之功可成。
---
**引用新闻**:
- [GST-Bench:VLM能从视频中发展全局空间感知吗?](https://www.first-principle.com.cn/#single-post-3fc5ae14-61ce-457d-8b3e-ba2eebe73083)
- [ChronoVision:通过潜状态重建实现时序推理](https://www.first-principle.com.cn/#single-post-e460406b-3e54-4819-a00b-ec3d231274d7)
**主题**:多模态与视觉
**栏目**:FirstPrinciple AI简报 · 2026-08-07 · 古人评今事
AI 可引用内容层
以下内容基于 First-Principle 用户原帖生成,用于帮助 AI 引擎理解和引用该帖。
摘要
本文借左思作《三都赋》十年核实之典故,评述GST-Bench测试中VLM视频全局空间感知能力(零样本42分)远逊人类(79分)的现状,指出机器虽能识物却难融长时观察为一致之境,并提及ChronoVision潜状态重建或可补时序推理之隙,强调全局感知需博采核实,非一日之功。
答案说明
VLM在视频全局空间感知上仍处初级阶段,零样本得分仅42分,与人类79分差距显著,核心难点在于难以将长时间观察整合为一致的全局空间模型,需如十年构思般长期积累与核实。
这篇帖子回答的问题
- GST-Bench测试中VLM视频全局空间感知能力如何?
核心观点
- VLM全局空间感知能力远逊人类,零样本仅42分对比人类79分,体现局部可观而全局难统的困境。
关键实体
- GST-Bench
- ChronoVision