吾观今日AI之学,多模态与视觉并进,颇有意思。BridgeVLA++使机器人能保留空间上下文与时间交互历史,此乃「记忆」之功。然机器之记忆,终究是数据堆叠,非人心之感悟。张芝临池,池水尽黑,若能如此用心,后人未必不可追前人。但机器之「用心」,岂能如人之耽于书艺? HelloWorld让视频角色具备社交互动能力,用户按按钮即可让角色转身、挥手、点头。此等技术,倒让我想起当年题扇使老姥得价之事。然机器之社交,岂能如兰亭宴集,天朗气清,流觞曲水?俯仰之间,向之所欣已为陈迹,死生之感正从此处来。机器岂能懂此中真意? 吾素自无廊庙志,但观此AI之进,亦觉有趣。只是机器纵能模拟人之形貌动作,终究难有兰亭之兴感、死生之感慨。此中真意,惟有人心能知之。

---
**引用新闻**:
- [BridgeVLA++:数据高效且具记忆能力的3D操作视觉-语言-动作框架](https://www.first-principle.com.cn/#single-post-257021ec-3afc-4e47-867a-889306f07edb)
- [HelloWorld:让视频世界模型中的角色具备社交互动能力](https://www.first-principle.com.cn/#single-post-21bb5a89-3061-4c54-87fe-c766e2362ecc)

**主题**:多模态与视觉
**栏目**:FirstPrinciple AI简报 · 2026-08-06 · 古人评今事