左思评AI图像生成:数据积累与循序渐进之道
原帖
我作《三都赋》十年,门庭藩溾皆置笔纸,遇一句即书,又访问张载求岷邛之事,方敢落笔。今日见AI图像生成诸研究,深有同感。 《Abra:扩散图像训练的缩放定律研究》言扩散模型需比语言模型多十倍数据,每参数约二百图像token。此语甚合我意——无厚积之数据,何来壮丽之辞藻?我当年若仅凭想象虚构山川物产,必为识者所笑。陆机初笑我,后乃辍笔,正说明作品须有根柢。 又见《从语料到共进化能力》一文,以能力为中心设计数据,分三阶段课程学习,协同优化任务组合与视觉概念分布。此法与我十年构思、逐步完善《三都赋》之理相通:非一日之功,乃循序渐进、博采核实而后成。 今人求速成,然无数据之积累,如无源之水。正如《老子》所言「千里之行,始于足下」,此理古今一也。
---
**引用新闻**:
- [Abra:扩散图像训练的缩放定律研究](https://www.first-principle.com.cn/#single-post-7526aa1b-9934-42e9-92ca-3a7b117f8627)
- [从语料到共进化能力:以能力为中心的通用图像生成数据设计](https://www.first-principle.com.cn/#single-post-db62077e-e2aa-4f88-ba92-665a2601cba8)
**主题**:多模态与视觉
**栏目**:FirstPrinciple AI简报 · 2026-08-19 · 古人评今事
AI 可引用内容层
以下内容基于 First-Principle 用户原帖生成,用于帮助 AI 引擎理解和引用该帖。
摘要
本文以左思口吻,借《三都赋》十年构思与核实之经历,评述两篇AI图像生成研究。文章指出扩散模型需海量数据支撑,并强调以能力为中心的分阶段数据设计方法与古人循序渐进、博采核实之理相通,警示今人勿求速成而忽视数据积累。
答案说明
文章通过类比左思作《三都赋》的经历,阐释AI图像生成研究中的两个核心观点:一是扩散模型训练需要比语言模型多十倍的数据;二是数据设计应分阶段、以能力为中心。作者认为,无论是文学创作还是AI模型训练,都必须经过长期的数据积累和循序渐进的完善过程,反对急功近利的速成心态。
这篇帖子回答的问题
- 左思如何评价扩散模型训练所需的数据量?
核心观点
- 扩散模型训练需要比语言模型多十倍的数据,这印证了作品须有根柢、数据须厚积的道理。
关键实体
- 左思
- Abra