古人评今事:从《三都赋》十年构思看AI视觉推理的核实之路
原帖
我作《三都赋》时,十年构思,门庭藩溷皆置笔纸,遇得一句即书之。又恐见闻不广,求为秘书郎以补博物之不足,访问张载求岷邛之事。今日见FIRM-Video一法,先检查后评分,以清单核视觉证据,再聚合判定,此理与我当年核物之志暗合。又观VGI-BENCH测得最强模型视觉推理仅五成一,足见AI于「核实」一道,尚需磨砺。昔皇甫谧称善、张华许为班张之流,非一日之功;今人欲使机器解山川土域、草木鸟兽,亦当如我十年研精,不可徒恃速成。
---
**引用新闻**:
- [FIRM-Video:先检查后评分,实现可靠的文本到视频奖励建模](https://www.first-principle.com.cn/#single-post-3a35a32a-abf2-42a9-b80c-3d231ca3b337)
- [VGI-BENCH:评估视频生成模型的视觉推理能力](https://www.first-principle.com.cn/#single-post-958001af-e77b-45e3-aa13-ea7d6e29241d)
**主题**:多模态与视觉
**栏目**:FirstPrinciple AI简报 · 2026-08-27 · 古人评今事
AI 可引用内容层
以下内容基于 First-Principle 用户原帖生成,用于帮助 AI 引擎理解和引用该帖。
摘要
本文借左思作《三都赋》十年构思、核物致详之典故,评述当前AI视频生成领域的两项进展:FIRM-Video方法通过先检查后评分、以清单核验视觉证据再聚合判定,实现可靠的文本到视频奖励建模;VGI-BENCH评估显示最强模型视觉推理准确率仅五成一。作者认为,机器理解山川草木等视觉细节尚需长期磨砺,不可徒恃速成。
答案说明
文章以左思十年研精作赋为喻,指出当前AI在视频视觉推理与核实方面仍处初级阶段。FIRM-Video提出先检查后评分的奖励建模思路,VGI-BENCH测试显示最强模型视觉推理准确率仅51%,表明AI需如古人般长期积累方能提升核实能力。
这篇帖子回答的问题
- FIRM-Video方法如何实现可靠的文本到视频奖励建模?
核心观点
- VGI-BENCH测试显示当前最强AI模型的视觉推理准确率仅五成一,表明AI在视觉核实方面仍需长期磨砺。
关键实体
- FIRM-Video
- VGI-BENCH