本导读串联52个研究相关节点,其中33个为本次补入的2022—2025年论文,5个已有成果补齐了论文与版本依据,其余沿用已有论文节点。七条阅读路径覆盖架构与采样、可控编辑、三维、视频、声音、评价及文化研究。选取依据是方法上的独立贡献、与制作或观看条件的关系,以及评价、数据和艺术家权益方面的解释力,并非按公司或产品热度排名。时间线采用预印本首次公开日;会议版、修订版与产品上线日期另行说明。原图保留图号、版本、署名与来源,演示链接指向作者项目。本批核读摘要、提交记录及注明的原图页,未复现实验,也不声称穷尽2022—2026年的论文;2026年新近候选的持续影响仍需追踪。
沿这条线索阅读
架构、采样与训练
2022 · DALL·E 2:结合 CLIP 潜变量的分层图像生成 ↗DALL·E 2 将 diffusion-based image prior/decoder 与 CLIP 表示结合,显著提升逼真度和文本一致性。2022 年逐步扩展研究预览、beta 和无候补名单访问,使文生图第一次成为全球大众产品。
2022–2023 · LoRA:低秩适配与扩散社区应用 ↗LoRA 原论文发表于 2021 年,通过冻结主模型、训练低秩增量矩阵降低微调成本。Stable Diffusion 社群在 2022–23 年迅速把它变成 style、character、clothing、pose、celebrity 等小型可交换适配器。这里发生了关键文化转变:风格和身份不再只是 prompt 里的名字,也可以被打包为一个轻量模型文件流通。
2022-05 · Imagen:深层语言理解与逼真图像生成 ↗Imagen 使用大型文本编码器和 diffusion decoder,研究显示扩大 language model 对 image-text alignment 的收益尤其明显。它强化了一个后来被 GPT-native image generation 继续推进的方向:更强语言理解会改变视觉生成能力。
2022-06 · Parti:扩展自回归模型以生成丰富图像 ↗Parti 探索与 diffusion 并行的 autoregressive 路线,把图像 token 当作另一种“语言”生成。它说明 2022 年文生图爆发并非只有 diffusion 一条技术道路。
2022-06-01 · EDM:厘清扩散生成模型的设计空间 ↗EDM将采样、训练和网络预处理拆分为可比较的设计选择,使生成速度与质量的关系能在具体方法层面讨论,而不是只看模型品牌。
2022-06-02 · DPM-Solver:少步数扩散采样 ↗DPM-Solver针对扩散常微分方程设计专用求解器,减少生成所需的网络求值次数,补充模型发布节点背后的采样方法史。
2022-09-07 · Rectified Flow:学习更直的数据生成路径 ↗Rectified Flow把生成与分布迁移表述为学习尽量笔直的流动路径,为后来基于流的图像模型补充独立于产品公告的理论来源。
2022-10-06 · Flow Matching:通过向量场学习生成 ↗Flow Matching通过回归条件概率路径上的向量场训练连续流模型,让扩散路径与其他传输路径进入同一研究框架。
2022-12-19 · DiT:可扩展的扩散Transformer ↗DiT以处理潜空间图块的Transformer替代常见U-Net骨干,并检验计算规模与生成质量的关系,为后来的生成模型架构提供关键比较点。
2023-01-02 · Muse:以掩码生成Transformer合成图像 ↗Muse在离散图像词元上学习掩码预测并并行解码,展示区别于常见扩散采样与逐词元自回归的文本生成图像路线。
2023-03-02 · 一致性模型:从噪声直接映射到数据 ↗Consistency Models研究单步或少步生成,既可蒸馏已有扩散模型,也可独立训练,为后来的实时与交互式图像生成提供方法背景。
2023-07-26 · SDXL:高分辨率潜在扩散模型 ↗SDXL 提高构图、细节、风格和分辨率表现,并继续保持开放模型可微调、可组合的特征。它是 Stable Diffusion 生态从实验性爆发进入成熟生产阶段的重要节点。
2023-09 · PixArt-α:高效扩散 Transformer ↗PixArt-α 将 diffusion transformer、预训练文本编码器和训练效率作为核心问题,成为 2024 DiT/flow image model 浪潮的重要开放研究节点。
2023-10 · 潜在一致性模型:少步图像生成 ↗LCM 通过 consistency distillation 在 latent space 实现 2–4 步高质量生成。速度提升改变的是接口可能性:当生成接近实时,AI 图像更容易进入绘画、设计、直播和交互软件。
2024-02 · Stable Diffusion 3:整流流 Transformer ↗SD3 采用 diffusion transformer 与 flow matching,并强调多主体 prompt、文字与图像质量。这一节点代表主流图像生成进一步吸收 Transformer 架构。
2024-04-03 · VAR:通过下一尺度预测进行视觉自回归生成 ↗VAR将视觉自回归从逐词元预测改写为由粗到细的下一尺度预测,提供与扩散Transformer并行的图像生成路线。
2024-06-17 · MAR与Diffusion Loss:无需向量量化的自回归图像生成 ↗该论文用扩散过程描述连续词元的概率分布,将自回归建模与连续潜变量连接起来,说明自回归图像生成并不必然依赖离散量化。
2024-10-09 · REPA:以表征对齐改善生成模型训练 ↗REPA把去噪网络的中间表示与预训练视觉编码器的表示对齐,研究视觉理解表征如何帮助扩散与流Transformer训练。
2024-10-14 · SANA:高压缩潜空间与线性扩散Transformer ↗SANA结合深度压缩自编码器、线性注意力和高效采样研究高分辨率图像生成,把算力与本地创作条件纳入方法史。
2025-01-29 · Janus-Pro:理解与生成的多模态扩展 ↗Janus-Pro通过训练策略、数据规模和模型规模调整,研究统一多模态系统中的理解与图像生成,为原有Janus路线提供后续证据。
2025-05-19 · MeanFlow:通过平均速度学习单步生成 ↗MeanFlow以区间平均速度而非瞬时速度描述生成流,并从头训练单步模型,扩展少步生成与Flow Matching之间的研究线索。
图像编辑与可控生成
2022-08-02 · An Image is Worth One Word(一图抵一词):文本反演与个性化生成 ↗Textual Inversion 学习新的 text embedding,而不重训整个模型。它极其适合这条 Genealogy:视觉概念、对象甚至 style 可以被映射为一个可组合的新“词”。注意:这不是说 style 本体就是 token,而是模型中一种有效的个性化表示方法。
2022-08-02 · Prompt-to-Prompt:通过交叉注意力编辑图像 ↗Prompt-to-Prompt研究词语与图像空间布局的交叉注意力关系,通过改写提示词控制局部替换和整体变化,是生成与可编辑性之间的重要连接。
2022-08-25 · DreamBooth:面向特定主体的扩散模型微调 ↗DreamBooth 通过少量 subject images fine-tune pretrained text-to-image model,把唯一 identifier 与具体主体绑定。它把 identity preservation 直接引入生成系统,也为后来的 celebrity / character / product customization 和 likeness 争议提供技术前史。
2022-11 / 2023 · InstructPix2Pix:遵循图像编辑指令 ↗InstructPix2Pix 利用 GPT-3 与 Stable Diffusion 合成训练数据,再训练 instruction-conditioned diffusion model。它把生成系统从“一次性造图”推进到“对已有图像进行语言驱动修改”的交互范式。
2022-11-17 · Null-text Inversion:把真实图像带入扩散编辑 ↗Null-text Inversion通过优化无条件文本嵌入反演真实图像,使提示词编辑可以接续已有照片,而不必重新训练模型权重。
2023-01-17 · GLIGEN:让文字与空间位置共同控制生成 ↗GLIGEN通过新增门控层向预训练扩散模型注入定位条件,以文字和边界框控制对象与布局,扩充提示词之外的构图方法。
2023-02 · ControlNet:为文本生成图像增加条件控制 ↗ControlNet 冻结 pretrained diffusion backbone,通过附加网络学习空间条件。它把 text-to-image 从语义控制推进到几何与构图控制,是 AI 生产工作流真正专业化的转折点之一。
2023-02 · T2I-Adapter:轻量适配器与精细控制 ↗T2I-Adapter 与 ControlNet 同期代表一个决定性趋势:基础模型无需完全重训,就可以通过模块化附件获得精细外部控制。AI 图像生产因此变成 base model + adapters 的组合系统。
2023-05 · DragGAN:基于拖动点的图像编辑 ↗DragGAN 利用 GAN feature space 实现 point-based manipulation,展示“直接操纵生成流形”的编辑范式。虽然 diffusion 很快成为主流,这种 direct manipulation 继续影响后来的生成式编辑界面。
2023-08 · IP-Adapter:图像提示适配器 ↗IP-Adapter 通过 decoupled cross-attention 为 pretrained diffusion 增加 lightweight image-prompt capability。它让参考图控制与 text prompt、ControlNet 共存,为今天广泛的 reference-driven portrait、fashion 和 identity workflows 奠定关键基础。
2024-01 · InstantID:零样本身份保持 ↗InstantID 将 face embedding 与结构条件结合,为 diffusion 增加高效 identity preservation。它是 DreamBooth 式“训练一个人”向 reference-based identity generation 转型的重要节点,也直接关联 likeness / consent 的后来争议。
三维生成与空间表示
2022-09-29 · DreamFusion:用二维扩散模型生成三维对象 ↗DreamFusion利用二维扩散先验优化三维表示,使文本生成从平面图像延伸到可改变视点与照明的对象,补充文本到三维的研究脉络。
2023-03-20 · Zero-1-to-3:从单张图像生成新视角 ↗Zero-1-to-3以单张图像和相对相机变化为条件生成新视角,将图像先验与三维重建连接起来,同时暴露不可见部分的推断问题。
2023-05-25 · ProlificDreamer:变分分数蒸馏与文本到三维 ↗ProlificDreamer针对分数蒸馏中的过饱和、过度平滑和低多样性提出变分方法,让文本到三维的质量问题成为可追踪的研究变化。
2023-08-08 · 3D Gaussian Splatting:实时辐射场渲染 ↗3D Gaussian Splatting用可优化的三维高斯表示场景并快速渲染新视角,是空间图像制作的重要基础设施;它本身不是文本生成三维模型。
2024-12-02 · TRELLIS:面向多种三维输出的结构化潜表示 ↗TRELLIS用结构化潜表示连接文本或图像条件与网格、辐射场和高斯等输出,研究三维资产生成的格式与编辑能力。
视频与时间连续性
2022-04-07 · 视频扩散模型 ↗视频扩散模型把图像去噪扩展到时间维度,并研究图像与视频联合训练及片段延展,为理解生成影像的时间连续性提供研究节点。
2023 · AnimateDiff:为个性化图像模型增加运动 ↗AnimateDiff 将运动建模作为可插拔模块引入 personalized text-to-image diffusion ecosystem。它的重要性在于保持原有角色、风格和社区模型资产,同时把静态生成扩展到视频。
2023-11 · Stable Video Diffusion:开放视频生成 ↗Stable Video Diffusion 将 latent video diffusion 公开给研究和开发者,使开放生成生态从图像向视频延展。它也预示后续 image model / video model 之间越来越紧密的共享基础设施。
2024-01-23 · Lumiere:时空扩散的视频生成 ↗Lumiere以时空U-Net在一次模型前向处理中覆盖完整视频时长,针对关键帧再插值路线的时间一致性问题提出另一种架构。
2025-04-17 · FramePack:视频帧上下文压缩与漂移防范 ↗FramePack按帧的重要性压缩历史上下文,并研究生成过程中的漂移,让较长视频的记忆与计算成本成为独立论文节点。
2025-06-09 · Self Forcing:缩小自回归视频训练与推理的差距 ↗Self Forcing让视频模型在训练中接续自己生成的帧,针对训练看真实上下文、推理却依赖自身输出的不一致,研究流式视频生成。
声音与音乐生成
2023-01-29 · AudioLDM:潜空间扩散的文本到声音生成 ↗AudioLDM将潜空间扩散用于一般声音合成,借助语言—音频对齐表示连接文字与听觉内容,把生成艺术研究延伸到环境声与声音编辑。
2023-06-08 · MusicGen:简单且可控的音乐生成 ↗MusicGen通过单一语言模型组织多路压缩音乐词元,以文字或旋律为条件生成音乐,把表示方式与听觉控制纳入生成艺术时间线。
评价标准与基准
2023-10-17 · GenEval:对象、数量与关系的图文对齐评估 ↗GenEval把图文对齐拆成对象共现、位置、数量和颜色等可检验问题,使“生成得好”不再只对应一个整体质量分数。
2023-11-29 · VBench:分维度评估视频生成 ↗VBench将视频生成质量分为主体一致性、运动、闪烁和空间关系等16个维度,并用人类偏好标注检验指标,为视频节点提供评价背景。
数据、艺术家权益与文化研究
2022 · LAION-5B:大规模图文数据集 ↗LAION-5B 公开大规模 image-text pair 索引和过滤方法,成为 Stable Diffusion 等开放生态的重要数据背景。它也是 2022 以后版权、训练数据、艺术家姓名与数据来源争议无法绕开的技术节点: 数据集本身从工程基础设施变成政治对象。
2023-01-30 · 从扩散模型中提取训练数据 ↗该论文用生成与筛选流程检验扩散模型对训练图像的记忆,使训练数据再现成为可实证研究的问题,而非仅凭图像相似性的推测。
2023-02-08 · Glaze论文:艺术家风格模仿的技术防护 ↗Glaze研究在公开图像中加入细微扰动以干扰风格模仿微调,并纳入艺术家用户研究,使拒绝被学习成为生成艺术史中的技术议题。
2023-06-07 · 艺术与生成式AI的科学:跨学科研究议程 ↗Epstein等人的扩展论文围绕美学文化、所有权与署名、创意劳动和媒体生态提出研究问题,将生成式AI艺术讨论从模型性能扩展到制度与文化。
2023-10-20 · Nightshade论文:提示概念与训练数据干预 ↗Nightshade研究针对提示概念的训练数据投毒,并将其讨论为创作者抵抗无视退出要求的抓取的一种方案,连接技术研究与数据控制争议。
对照档案与阅读范围
本批逐条核对38篇论文记录,正文核读范围见各节点;非arXiv全库检索完成声明。
档案编写的研究导读;中英文可能包含 AI 辅助翻译,尚待独立人工审校。具体史实请对照各节点的原始资料。
继续阅读
生成艺术史:1943—2026 年的历史线索 ↗为什么从 1943 年开始? ↗如何使用这 356 个节点? ↗生成艺术时间线:早期计算、软件艺术与crypto生态 ↗返回艺术史卡片目录 ↗引用本页
ANTI-AI ARCHIVE. 2022年以来的重要论文:从生成方法到文化问题. https://salondesrefuses.cn/zh/art-history/guides/recent-papers
引用时请补充访问日期;引用具体史实时,同时注明节点和原始来源。

