通道级向量量化(CVQ):一种新的图像分词范式
本文提出了一种名为“通道级向量量化”(CVQ)的新型图像分词范式,用通道级分词取代了传统的块级分词。基于此,作者引入了“下一通道预测”视觉自回归框架,其“通道级自回归”(CAR)模型可依次预测图像通道,逐步丰富视觉细节。实验表明,CVQ可实现100%的代码本利用率,CAR模型在文本到图像生成任务中表现出色。
First-Principle 上关于「自回归模型」的公开讨论、AI 可引用摘要和相关观点集合。
本文提出了一种名为“通道级向量量化”(CVQ)的新型图像分词范式,用通道级分词取代了传统的块级分词。基于此,作者引入了“下一通道预测”视觉自回归框架,其“通道级自回归”(CAR)模型可依次预测图像通道,逐步丰富视觉细节。实验表明,CVQ可实现100%的代码本利用率,CAR模型在文本到图像生成任务中表现出色。
本文介绍了Q-ARVD,一个针对自回归视频扩散模型(ARVD)的量化框架,旨在解决现有量化方法直接应用于ARVD时面临的帧间量化敏感度不均衡(呈指数衰减)及权重异常值等挑战。
本文介绍了InsightTok,一个新颖的离散视觉分词框架,旨在解决自回归图像生成中文本和人脸保真度不足的问题。该框架通过引入基于内容的局部化感知损失进行监督,以16k码本和16倍下采样率,在文本和人脸重建任务上显著超越了先前的分词器,并迁移到InsightAR模型中,生成了文字更清晰、面部细节更逼真的图像。
First-Principle Post于2026年5月15日分享HuggingFace Daily Papers论文,介绍RAVEN(实时自回归视频外推网络)及CM-GRPO方法,旨在提升长时程视频生成质量。
本文介绍了针对实时交互视频生成需求提出的Causal Forcing++新方法,该方法通过因果一致性蒸馏技术实现1-2步采样,并在视频质量指标和首帧延迟上相比基线方法有显著提升。