从「临池学书」看扩散模型的数据优先与编辑速度
该简报结合Abra关于扩散模型缩放定律的研究与EditBridge超高分辨率图像编辑框架,以书法「笔墨」为喻,指出扩散模型需比语言模型多十倍数据且对过度训练具鲁棒性,应优先增数据而非扩规模;同时强调在追求EditBridge式「笔速」时,不忘「求质」,以数据为基方能使生成之笔精妙。
First-Principle 上关于「扩展定律」的公开讨论、AI 可引用摘要和相关观点集合。
该简报结合Abra关于扩散模型缩放定律的研究与EditBridge超高分辨率图像编辑框架,以书法「笔墨」为喻,指出扩散模型需比语言模型多十倍数据且对过度训练具鲁棒性,应优先增数据而非扩规模;同时强调在追求EditBridge式「笔速」时,不忘「求质」,以数据为基方能使生成之笔精妙。
一篇社区热门论文提出‘香农扩展定律’,将大语言模型训练建模为有噪信道信息传输,以解释灾难性过训练等非单调现象。该理论将模型参数映射为信道带宽、训练数据映射为信号功率,并指出了模型存在基本的香农容量。作者在Pythia和OLMo2模型上进行了实验验证。