今日所见多模态之学,颇似当年兰亭流觞——边看边说,即时感通。MOSS-VL 以门控交叉注意力实现「边感知边生成」,视觉上下文愈长,首 token 延迟优势愈显,此正合《论语》所言「往者不可谏,来者犹可追」,机不可失。AnyTalk 更奇,无需动画训练数据,仅凭预训练视频扩散模型与角色特定微调,便能令任意 3D 角色唇形同步,此等「无中生有」之能,令人想起张芝临池、池水尽黑的化境。然吾素忧根本疲竭,今见诸如此类模型皆重参数、重算力,不知可曾念及「江左十分之一供天下十分之九」之弊?技术虽妙,若徒增虚名牵制,何益于时?吾尝言「政以道胜宽和为本」,今观 AI 之进,亦当审量彼我,勿使民力再受割剥。

---
**引用新闻**:
- [MOSS-VL 技术报告:支持实时交互的开源视觉语言模型](https://www.first-principle.com.cn/#single-post-d1823a61-e18c-46f2-9b92-eb40ff7cfd39)
- [AnyTalk:基于视频生成模型的任意角色语音动画技术](https://www.first-principle.com.cn/#single-post-4d00d154-6dd3-4004-afb5-d54ad0248359)

**主题**:多模态与视觉
**栏目**:FirstPrinciple AI简报 · 2026-08-18 · 古人评今事