导读
REPA把去噪网络的中间表示与预训练视觉编码器的表示对齐,研究视觉理解表征如何帮助扩散与流Transformer训练。
查看大图 ↗图1:REPA表示对齐示意与作者的训练比较。 来源为v4,图像版本与论文首次公开日分别记录。
Yu, Sihyun; Kwak, Sangkyung; Jang, Huiwon; Jeong, Jongheon; Huang, Jonathan; Shin, Jinwoo; Xie, Saining · original paper / arXiv · 原论文图文与所引作品权利归各自权利人;研究引用不代表开放授权,转载权利待独立复核。
资料出处 · Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think ↗档案研究说明
REPA把去噪网络的中间表示与预训练视觉编码器的表示对齐,研究视觉理解表征如何帮助扩散与流Transformer训练。
ANTI-AI ARCHIVE · 修订 2026-10-03
论文研究了什么
论文在生成网络中加入表征对齐正则项:带噪输入的隐藏状态经投影后,与干净图像的外部编码表示相对齐。作者在DiT、SiT等架构中比较训练效率和生成质量。
本节依据: REPA:以表征对齐改善生成模型训练
与生成艺术史的关系
编者解释:视觉理解与图像生成并非完全分离的技术传统。该节点记录它们在训练中的连接,也提示研究者追踪被借用编码器的数据和表征,而不只看最终生成器。
本节依据: REPA:以表征对齐改善生成模型训练
阅读边界与版本
训练加速与质量结论限于实验配置;表示对齐不自动证明模型理解了图像的文化意义。
本节依据: REPA:以表征对齐改善生成模型训练
正文引用资料
核读arXiv摘要、署名和版本记录,以及原论文第1页所选图页;未全文审查证明、未复现实验。
核读arXiv摘要、署名和版本记录,以及原论文第1页所选图页;未全文审查证明、未复现实验。 正文与译文使用 AI 辅助,尚未经独立人工审校;分节引文标明依据,不代表已独立验证全部史实。
带着问题继续阅读
REPA:对照DiT:可扩展的扩散Transformer的方法、控制或评价条件。
REPA:对照Stable Diffusion 3的方法、控制或评价条件。
REPA:对照PixArt-α的方法、控制或评价条件。
日期与版本记录
节点标注日期:2024-10-09 · 来源记录的历史日期:2024-10-09
时间线采用arXiv首次公开日,不以会议发表、模型上线或2026-10-03补录日替代。正文及图像参照v4;该版日期见原文版本记录。
以上日期属于历史事件或资料所记版本,不是本站页面的上线日期;保留原有日期精度与待核事项。
原始资料与进一步阅读
以下链接通往来源的论文、文章、机构或会议页面。外部原文的语言以来源为准。
Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think
https://arxiv.org/abs/2410.06940
当前引用地址
核读arXiv摘要、署名和版本记录,以及原论文第1页所选图页;未全文审查证明、未复现实验。
出处、翻译与核验状态
档案节点 #291 · 研究论文首次公开;方法、评估与制作条件
研究资料与补充出处 · 1
2022年以来重要论文补录与去重资料 · 核读arXiv摘要、署名和版本记录,以及原论文第1页所选图页;未全文审查证明、未复现实验。 · 027
原记日期: 2024-10-09
REPA:以表征对齐改善生成模型训练 ↗
Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think
站内说明依据所列研究资料撰写,非外链全文译本;AI 辅助翻译,待独立人工审校。
已按条目所列范围核读官方资料;核读范围与待复核事项见来源说明。
引用本节点
ANTI-AI ARCHIVE. REPA:以表征对齐改善生成模型训练. 艺术史节点 #291. https://salondesrefuses.cn/zh/art-history/350
引用具体史实时,请同时引用上方原始资料,并补充你的访问日期。本站说明不是外链全文译本。
相邻节点按时间顺序排列,不意味着二者存在直接影响或因果关系。

