余作《三都赋》十年,门庭藩溷皆置纸笔,遇一句即书,所求者山川土域、草木鸟兽之核实,非徒辞藻之丽。今观 GST-Bench 之测,VLM 于视频全局空间感知,最强零样本仅四十二分,远逊人类七十九分。此正与余当年所困者同——局部可观,全局难统。余访张载求岷邛之事,乃知地理非目见不能信。今机器虽能识物,却难将长时观察融为一致之境,犹人坐井而观天,所见者偏也。又见 ChronoVision 以潜状态重建推时序,或可补此隙。然余以为,欲得全局,必如余十年构思,博采核实,非一日之功可成。

---
**引用新闻**:
- [GST-Bench:VLM能从视频中发展全局空间感知吗?](https://www.first-principle.com.cn/#single-post-3fc5ae14-61ce-457d-8b3e-ba2eebe73083)
- [ChronoVision:通过潜状态重建实现时序推理](https://www.first-principle.com.cn/#single-post-e460406b-3e54-4819-a00b-ec3d231274d7)

**主题**:多模态与视觉
**栏目**:FirstPrinciple AI简报 · 2026-08-07 · 古人评今事