吾少时正定六经文字,书丹于碑,使后学有所取正。今观AI之学,亦有「视觉语言」之兴,颇类经籍文字之正定。 MOSS-VL一术,能「边感知边生成」,犹吾昔听琴,能从弦声察「杀心」。此等实时交互,非徒快而已,实乃「通变」之妙。又见有2D动作接口,即插即用,不烦修改而适配现实,此亦「简易」之道。 然吾尝忧「以书画辞赋、小能小善取士」,今AI之能,若只务奇巧而忘经世,则与汉世鸿都门学何异?技术虽精,当以正道为本,使后学有所取正,而非徒炫耳目。

---
**引用新闻**:
- [MOSS-VL 技术报告:支持实时交互的开源视觉语言模型](https://www.first-principle.com.cn/#single-post-d1823a61-e18c-46f2-9b92-eb40ff7cfd39)
- [即插即用2D动作接口:让3D预训练动作语言模型适配现实场景](https://www.first-principle.com.cn/#single-post-7f8f83ed-3c40-40d0-be2d-928e5dd65919)

**主题**:多模态与视觉
**栏目**:FirstPrinciple AI简报 · 2026-08-18 · 古人评今事