古人评今事:AI世界模型如《三都赋》博采薄发
该简报将左思作《三都赋》的构思过程与近期两项AI世界模型进展进行类比:H3-World以极少参数实现时序控制,ZimaBlue从十二万小时视频中提炼动作模型。作者认为AI进步如同辞藻壮丽不在多言而在核实事理,强调广积而后薄发的技术路径。
First-Principle 上关于「多模态与视觉」的公开讨论、AI 可引用摘要和相关观点集合。
该简报将左思作《三都赋》的构思过程与近期两项AI世界模型进展进行类比:H3-World以极少参数实现时序控制,ZimaBlue从十二万小时视频中提炼动作模型。作者认为AI进步如同辞藻壮丽不在多言而在核实事理,强调广积而后薄发的技术路径。
FirstPrinciple AI简报(2026-09-02)以蔡邕视角评述两项AI进展:可归因推理通过Code-CoT与CE-GRPO实现步步归因,契合校书止疑之旨;H3-World以语言为接口控制世界,但作者警示技术须以正道驾驭,否则如董卓僭越致祸。
本文借《老子》与《庄子》之语,评述H3-World与ZimaBlue两项AI技术。H3-World以语言控制影像,ZimaBlue以十万小时视频训练动作模型。作者认为二者虽能泛化未见之景,但知识皆从数据中来,非自性中生,是以机巧代天机,担忧人逐物忘本而失自然之性。
本文以晋代葛洪视角评述两项AI进展:H3-World以语言控制视频世界,仅用0.199%参数实现精确时序控制;ZimaBlue从十万小时视频预训练习得泛化动作,成功率从36%跃升至78%。作者借此阐发“以极小之巧达极精之控”“积学储宝”的理念,强调求智于数据当务实功而非浮誉。
该简报发布于2026年9月2日,以古人视角评述H3-World与ZimaBlue两项AI技术。H3-World通过语言理解控制视频生成,ZimaBlue从十万小时视频学习中实现机器人动作泛化。文章强调技术虽进,但需审量边界,不忘人为根本。
FirstPrinciple AI简报(2026-09-01)以左思视角评述两项多模态与视觉技术:BLARM能从单目视频驱动3D网格动画,无需骨架或rig标注,通过因子化时空注意力恢复可解释运动结构;LightNav-0激发VLM空间智能,以统一token接口实现指令跟随、开放词汇导航与视觉跟踪的零样本泛化。作者认为二者皆重「核」与「约」,以简驭繁,非徒炫技。
本文以嵇康视角评述DreamX-Creator与MMMMM两项技术,前者实现2K音视频生成,后者用于多模态虚假信息分类,二者相映成趣,引发对AI时代真伪难辨的哲学思考。
本文以蔡邕视角评述DreamX-Creator与KATok两项AI视听技术,借《乐记》与《老子》之语,探讨技术普及与精审、技术能力与道德引导之间的关系。
FirstPrinciple AI简报于2026年9月1日刊文,以古典视角评述两项AI生成技术:BLARM能从单目视频驱动3D物体动画,无需骨架或rig标注;DreamX-Creator以7B参数实现2K分辨率原生联合音视频生成并开源,旨在普及高质量创作。
FirstPrinciple AI简报(2026-09-01)中,张衡评述BLARM与LightNav-0两项技术。BLARM能从单目视频驱动3D物体动画,无需骨架标注而自复运动结构;LightNav-0以统一接口激发VLM空间智能,实现具身导航与跨平台零样本泛化。作者认为今日AI之进,贵在能推验、能实证,而非徒炫奇巧。
本文以古人视角评述Magpie与GameWAM两项AI游戏技术,认为Magpie割裂逻辑与视觉、GameWAM形似神非,虽为时势所趋,但警示造器者勿以机巧丧其天真。
本文借王羲之之口,评述GameWAM与PAWBench两项AI进展。GameWAM能同时生成游戏画面与操作轨迹,但PAWBench论文指出当前模型缺乏概率对齐能力,单条视频看似合理,重复生成却无法恢复正确分布。作者认为真正的世界建模不能只停留在表象,AI所生成者终究是虚拟陈迹,而非真实山水。
本文借东汉蔡邕校书正经之史事,评述当前AI视频生成领域的评估难题。文章指出,若无可靠评估标准,难以判断生成内容是否合乎法度,并提及FIRM-Video采用的「先检查后评分」原则。同时,引用VGI-BENCH的测试结果,指出现有最强模型在视觉推理上准确率仅约五成,强调评估方法虽重要,但仍需以模型自身的实际能力为根本。
本文借左思作《三都赋》十年构思、核物致详之典故,评述当前AI视频生成领域的两项进展:FIRM-Video方法通过先检查后评分、以清单核验视觉证据再聚合判定,实现可靠的文本到视频奖励建模;VGI-BENCH评估显示最强模型视觉推理准确率仅五成一。作者认为,机器理解山川草木等视觉细节尚需长期磨砺,不可徒恃速成。
本文以古人视角评述视频生成与评估领域的两项进展:FIRM-Video提出“先检查后评分”的务实评估方法,以及VGI-BENCH测试显示当前最强模型Seedance 2.0在视觉推理上仅获51%准确率,指出视频生成仍存“华丽其表而推理其里”的虚浮之弊。
本文借葛洪之口,评述FIRM-Video的「先检查后评分」方法与VGI-BENCH的测试结果。作者认为,FIRM-Video先立清单逐条验证的理念契合治学笃勤之道;而VGI-BENCH显示最强视频生成模型仅达五成准确率,证明AI虽能模拟形貌却未通其理,求AI之真当先明其理。
FirstPrinciple AI简报于2026年8月27日刊文,以王羲之视角评述多模态领域两项进展:FIRM-Video倡导“先检查后评分”的文本到视频奖励建模方法,强调先核验世界一致性再评估感知质量;Super Star作为流式实时交互手势生成框架,实现语音与动作的实时契合。文章借殷浩北伐之喻,警示技术演进当以务实为本,审量虚实,避免徒务虚名。
FirstPrinciple AI简报于2026年8月26日发表文章,以左思口吻评述Game2World引擎。该引擎通过去除游戏视频UI并保留物理规律来训练世界模型,背景保留率达99.8%。文章将其与左思十年构思《三都赋》的博采核实之道相类比,强调AI发展需长期积累而非一朝可成。
FirstPrinciple AI简报引用《老子》「为学日益,为道日损」,评述LAION-BVD、Game2World与DiffusionOPSD等AI项目以数据与效率为重的趋势,认为过度依赖算法机巧可能遮蔽世界本然之貌,主张「任自然」即不以机巧损其真。
2026年8月26日,FirstPrinciple AI简报点评两则AI新闻:Game2World通过GameCleaner去除UI后利用游戏视频训练世界模型,GigaBrain-0.7在三系统架构统一视觉、语言与动作,并在37000余小时异构数据上预训练。作者认为二者皆属数据扎实、方法得当的务实之作,体现了具身智能接近“形神合一”的发展路径。