AI 艺术史不只是一份图像模型的版本表。这条阅读路径把理论、艺术家的工作、展览制度和技术工具放在一起,帮助读者追问:谁制定规则,谁参与创作,作品又如何被展示和解释?
为什么从 1943 年开始?
1943 年是本研究母版选取的思想背景节点,不是把 AI 艺术的诞生定在这一年。早期神经计算、控制论、计算机艺术与后来的机器学习并不等同;阅读时应保留这些实践之间的差异,不把它们写成必然通向今天生成式 AI 的单线进步史。
如何使用这 140 个节点?
先按年代定位,再对照原题、人物和机构、研究说明及原始来源。理论论文能支撑某项方法的提出,展览记录能支撑展示与传播,但两者都不能单独证明一项技术如何影响全部艺术实践。日期精度、来源局限和待核状态随条目保留;右侧时间线提供交互浏览,下方正文提供连续阅读和引用入口。
专题为档案编写的研究导读,中英文含 AI 辅助编译,待独立人工审校;具体史实与权利信息请对照条目中的原语言来源。
140 个历史节点
展开条目可阅读研究说明和来源;编号沿用研究母版,排序按年代。历史论述仍待独立核验。
1943神经活动内在观念的逻辑演算
+
A Logical Calculus of the Ideas Immanent in Nervous Activity
McCulloch & Pitts
Warren McCulloch 与 Walter Pitts 用简化神经元和逻辑演算讨论神经活动如何实现计算。它并不是图像生成论文,但它建立了一种关键想象:感知与认知过程可以被表示为可计算网络。AI 艺术史如果从神经生成模型开始,必须把这一层形式化前史保留下来。
阅读原始来源 · A Logical Calculus of the Ideas Immanent in Nervous Activity ↗
研究母版 · p. 4 · #001 · 研究论述待独立核验
在交互时间线打开 ↗1948通信的数学理论
+
A Mathematical Theory of Communication
Claude Shannon
Shannon 在《A Mathematical Theory of Communication》中建立现代信息论。对这条 Genealogy 而言,关键不是把 Shannon 直接说成“AI 艺术的起点”,而是指出一个新的知识条件:图像、文字与声音都可以在通信系统中作为可编码的信息被处理。后来的数据集、压缩表示、潜空间与生成模型,都发生在这个更广阔的信息化条件之中。
阅读原始来源 · A Mathematical Theory of Communication ↗
研究母版 · p. 4 · #002 · 研究论述待独立核验
在交互时间线打开 ↗1948控制论
+
Cybernetics
Norbert Wiener
Wiener 的《Cybernetics: Or Control and Communication in the Animal and the Machine》把通信、反馈与控制放在同一理论框架中。对于 Archive 后来的“control / sovereignty”问题,这一节点尤其重要:文化信息并非只被储存和传输,它也会进入反馈回路,成为调节机器行为与组织权力的资源。
研究母版 · p. 4 · #003 · 研究论述待独立核验
在交互时间线打开 ↗1949行为的组织
+
The Organization of Behavior
Donald Hebb
Hebb 的学习理论强调神经连接可因共同活动而改变。虽然它距离生成图像还有很远,但它帮助建立了一个后来极其重要的假设:能力并不一定靠显式规则写入系统,也可以通过经验与连接权重变化习得。
阅读原始来源 · The Organization of Behavior ↗
研究母版 · p. 5 · #004 · 研究论述待独立核验
在交互时间线打开 ↗1950计算机器与智能
+
Computing Machinery and Intelligence
Alan Turing
Turing 不再试图先定义“思考”的本体,而以 Imitation Game 将机器智能转化为行为与交互问题。这个操作性转向非常关键:后来 AI 的视觉生成能力同样不是先通过“机器是否具有创造力”获得合法性,而是通过它能否产生、修改和组织视觉对象来被实际评价。
阅读原始来源 · Computing Machinery and Intelligence ↗
研究母版 · p. 5 · #005 · 研究论述待独立核验
在交互时间线打开 ↗1952示波图与电子抽象
+
Oscillons / Electronic Abstractions
Ben F. Laposky
Laposky 用示波器生成电子波形,再通过摄影固定为抽象图像。它发生在数字计算机艺术成熟之前,却已把电信号、数学曲线与视觉构成连接起来,是电子生成美学的重要前史。
阅读原始来源 · Oscillons / Electronic Abstractions ↗
研究母版 · p. 7 · #012 · 研究论述待独立核验
在交互时间线打开 ↗1954–1969《美学》与信息美学
+
Aesthetica / Einführung in die informationstheoretische Ästhetik
Max Bense
Bense 在 1954–1960 年间出版四卷《Aesthetica》,1965 年合订扩充,并在 1969 年出版 《Einführung in die informationstheoretische Ästhetik》。他的工作把美学与信息论、统计结构、程序化生产连接起来。这里不是要声称“艺术就是信息”,而是标记一个重要思想转折:形式、秩序、复杂度与审美差异开始进入计算性描述的范围。
阅读原始来源 · Aesthetica / Einführung in die informationstheoretische Ästhetik ↗
研究母版 · p. 5 · #006 · 研究论述待独立核验
在交互时间线打开 ↗1956达特茅斯人工智能夏季研究计划
+
Dartmouth Summer Research Project on Artificial Intelligence proposal/workshop
John McCarthy; Marvin Minsky; Nathaniel Rochester; Claude Shannon and participants
Dartmouth 会议并不直接涉及艺术,但它确立了“智能可被机器模拟和研究”的学术共同体框架。后来的计算机视觉、机器学习与生成模型均在这一制度谱系中发展。
阅读原始来源 · Dartmouth Summer Research Project on Artificial Intelligence proposal/workshop ↗
研究母版 · p. 5 · #007 · 研究论述待独立核验
在交互时间线打开 ↗1956–1959振荡图与早期电子艺术写作
+
Oscillograms; early computer / electronic art writing
Herbert W. Franke
Franke 既制作电子振荡图像,也长期讨论数学、信息和技术如何参与艺术。与 Bense、Nake 等人的信息美学环境一起,他帮助形成德国与奥地利早期计算机艺术的理论与实践网络。
阅读原始来源 · Oscillograms; early computer / electronic art writing ↗
研究母版 · p. 7 · #013 · 研究论述待独立核验
在交互时间线打开 ↗1958感知机
+
The Perceptron
Frank Rosenblatt
Rosenblatt 的 perceptron 将模式识别与神经网络学习联系起来。对视觉 AI 史而言,它代表从“规则由程序员全部写入”走向“系统从样本中调整参数”的早期关键步骤。
研究母版 · p. 6 · #008 · 研究论述待独立核验
在交互时间线打开 ↗1958 / 1966信息理论与审美知觉
+
Théorie de l'information et perception esthétique
Abraham Moles
Moles 的法文研究后来以《Information Theory and Esthetic Perception》英译出版。他关心艺术对象如何作为“信息消息”被感知、冗余与复杂度如何参与审美经验。它与 Bense 一起构成信息美学最重要的理论背景。
阅读原始来源 · Théorie de l'information et perception esthétique ↗
研究母版 · p. 6 · #009 · 研究论述待独立核验
在交互时间线打开 ↗1959利用跳棋游戏开展机器学习的若干研究
+
Some Studies in Machine Learning Using the Game of Checkers
Arthur Samuel
Samuel 的跳棋程序展示机器无需由程序员逐步写明所有策略,也可以通过学习改善表现。这种从显式规则向经验学习的变化,最终会成为现代生成模型与数据驱动视觉系统的基础。
阅读原始来源 · Some Studies in Machine Learning Using the Game of Checkers ↗
研究母版 · p. 6 · #010 · 研究论述待独立核验
在交互时间线打开 ↗1960人机共生
+
Man-Computer Symbiosis
J. C. R. Licklider
Licklider 提出 human-computer symbiosis:人与计算机各自承担擅长部分,通过实时交互形成新的认知系统。今天 conversational image generation 与 visual agents 的“协作创作”接口, 可以在这里找到重要的人机交互前史。
阅读原始来源 · Man-Computer Symbiosis ↗
研究母版 · p. 6 · #011 · 研究论述待独立核验
在交互时间线打开 ↗1961–1973新倾向展览与计算机视觉研究
+
New Tendencies exhibitions and Computers and Visual Research
Almir Mavignier · Matko Meštrović · international participants
萨格勒布 New Tendencies 从具体/光学艺术逐渐转向“Computers and Visual Research”, 把程序、信息、科学方法和观众知觉置于艺术讨论中心。它是计算机艺术在国际制度层面早期成形的重要平台。
阅读原始来源 · New Tendencies exhibitions and Computers and Visual Research ↗
研究母版 · p. 7 · #015 · 研究论述待独立核验
在交互时间线打开 ↗1963Sketchpad:交互式绘图系统
+
Sketchpad
Ivan Sutherland
Sketchpad 将图形对象、约束和人机交互放进同一个系统,奠定交互式计算机图形的重要传统。它提醒我们:AI 艺术史不只是“模型如何生成图像”,也包括视觉创作界面如何把计算能力转化为艺术实践。
研究母版 · p. 8 · #016 · 研究论述待独立核验
在交互时间线打开 ↗1964–1966人还是机器:蒙德里安构图与计算机图像的主观比较
+
Human or Machine: A Subjective Comparison of Piet Mondrian’s Composition with Lines and a Computer-Generated Picture
A. Michael Noll
Noll 生成与 Mondrian 构图相似的计算机图像,并通过观看者实验比较审美偏好与作者判断。 它极早地预演了后来围绕“机器模仿风格”“人能否识别 AI 图像”的争论,但技术机制仍是程序生成而非训练数据学习。
研究母版 · p. 8 · #017 · 研究论述待独立核验
在交互时间线打开 ↗1965早期计算机艺术展览
+
Early computer-generated art exhibitions and Noll experiments
Georg Nees; Frieder Nake; A. Michael Noll
1965 年,Georg Nees 在斯图加特展出计算机生成图形;A. Michael Noll 与 Béla Julesz 在纽约 Howard Wise Gallery 展出 computer-generated pictures;Frieder Nake 也成为同年最早公开展示算法艺术的先驱之一。计算机开始不只是工程工具,而被当作形式生产机器进入艺术制度。
阅读原始来源 · Early computer-generated art exhibitions and Noll experiments ↗
研究母版 · p. 8 · #018 · 研究论述待独立核验
在交互时间线打开 ↗1966九个夜晚:戏剧与工程
+
9 Evenings: Theatre & Engineering
Billy Klüver; Robert Rauschenberg; John Cage; Lucinda Childs; engineers and artists
9 Evenings 将艺术家与 Bell Labs 工程师协作组织成大型现场实验,直接促成 E.A.T.。它扩展了计算/控制系统在艺术中的角色,为后来交互艺术、机器行为与实时生成铺路。
阅读原始来源 · 9 Evenings: Theatre & Engineering ↗
研究母版 · p. 8 · #019 · 研究论述待独立核验
在交互时间线打开 ↗1966艺术与技术实验协会
+
Experiments in Art and Technology (organization)
Billy Klüver; Fred Waldhauer; Robert Rauschenberg; Robert Whitman
E.A.T. 由 Billy Klüver、Fred Waldhauer、Robert Rauschenberg、Robert Whitman 等推动,将艺术—工程合作制度化。它不是 AI 艺术组织,但建立了之后数字艺术、媒体艺术和实验技术艺术的重要生产模式。
阅读原始来源 · Experiments in Art and Technology (organization) ↗
研究母版 · p. 9 · #020 · 研究论述待独立核验
在交互时间线打开 ↗1968计算机艺术协会
+
Computer Arts Society
Alan Sutcliffe; George Mallen; John Lansdown
CAS 在英国成立,连接艺术家、设计师、工程师与研究者。它的重要性在于制度化: computer art 不再是零散实验,而开始形成持续的展示、讨论、出版与专业网络。
阅读原始来源 · Computer Arts Society ↗
研究母版 · p. 9 · #021 · 研究论述待独立核验
在交互时间线打开 ↗1968控制论的偶然发现:展览
+
Cybernetic Serendipity exhibition
Jasia Reichardt (curator); participating artists/researchers
Jasia Reichardt 策划的《Cybernetic Serendipity》集中展示 computer music、computer graphics、machines and environments、computer poems 等实践。它使“计算机与艺术”的问题从实验室进入广泛公共文化语境,也把 Wiener 式 cybernetics 与艺术实践真正并置起来。
阅读原始来源 · Cybernetic Serendipity exhibition ↗
研究母版 · p. 9 · #022 · 研究论述待独立核验
在交互时间线打开 ↗1968–1980年代算法绘画与“想象机器”实践
+
Algorithmic drawings / “machine imaginaire” practice
Vera Molnár
Molnár 从手工“machine imaginaire”到真实计算机程序,把规则系统、排列组合和微小随机偏差用于绘画与绘图。她的重要性在于显示生成艺术并不是后来深度学习突然发明的创作范式:艺术家早已把程序、约束与变化本身作为作品生成机制。
阅读原始来源 · Algorithmic drawings / “machine imaginaire” practice ↗
研究母版 · p. 9 · #023 · 研究论述待独立核验
在交互时间线打开 ↗1960年代末—1970年代AARON:以规则编码绘画知识
+
AARON
Harold Cohen
Cohen 在 1960 年代末构思 AARON,1970 年代命名并持续开发。AARON 不是从海量图像中训练,而是把 Cohen 对绘画、表示和构图的知识编码为规则系统。它提供了一个关键对照:machine art 并不必然依赖 scraping、dataset 或风格挪用,因此今天的 anti-AI politics 不能简单等同为“反对机器创作”。
研究母版 · p. 7 · #014 · 研究论述待独立核验
在交互时间线打开 ↗1969–1971计算机绘图与《程序化美学》
+
Computer-generated drawings; Une esthétique programmée
Manfred Mohr
Mohr 在 1969 年后系统使用计算机和绘图机,1971 年在巴黎 Musée d’Art Moderne de la Ville de Paris 举办重要个展。其工作说明“程序”可以像绘画方法一样成为持续的作者性系统。
阅读原始来源 · Computer-generated drawings; Une esthétique programmée ↗
研究母版 · p. 10 · #024 · 研究论述待独立核验
在交互时间线打开 ↗1970《软件》展览:信息技术在艺术中的新意义
+
Software exhibition, Jewish Museum, New York
Jack Burnham (curator); artists and technologists
Jack Burnham 策划的 Software 展览把信息处理、概念系统和交互过程放进艺术机构。它连接系统美学、概念艺术和计算文化,对后来把艺术理解为规则、协议、程序和信息过程非常关键。
阅读原始来源 · Software exhibition, Jewish Museum, New York ↗
研究母版 · p. 10 · #025 · 研究论述待独立核验
在交互时间线打开 ↗1971洛杉矶郡艺术博物馆“艺术与技术”计划
+
Art and Technology program/exhibition
Maurice Tuchman (curator); participating artists and corporations
LACMA 的 Art and Technology 项目让艺术家进入企业实验室和工业资源体系。它不是 AI art,但为后来艺术与大型技术公司、研究机构之间的生产关系提供早期制度范式。
阅读原始来源 · Art and Technology program/exhibition ↗
研究母版 · p. 10 · #026 · 研究论述待独立核验
在交互时间线打开 ↗1975 / 1982分形对象与自然的分形几何
+
Les objets fractals (1975); The Fractal Geometry of Nature (1982)
Benoît Mandelbrot
Mandelbrot 的分形研究不是 AI,但对生成艺术影响巨大:简单规则能够产生复杂、自相似的视觉世界。分形图像在 1980–90 年代普及,也帮助公众把数学计算与视觉创造直接联系起来。
阅读原始来源 · Les objets fractals (1975); The Fractal Geometry of Nature (1982) ↗
研究母版 · p. 10 · #027 · 研究论述待独立核验
在交互时间线打开 ↗1979林茨电子艺术节
+
Ars Electronica Festival
Hannes Leopoldseder; Hubert Bognermayr; Herbert W. Franke; others
Ars Electronica 从 1979 年开始把艺术、技术与社会问题放在同一公共平台上。它后来持续展出人工生命、机器人、数据艺术和 AI 艺术,是 AI art 从实验技术进入文化制度的重要长期基础设施。
阅读原始来源 · Ars Electronica Festival ↗
研究母版 · p. 11 · #028 · 研究论述待独立核验
在交互时间线打开 ↗1986Biomorph:生物形态的交互进化
+
Biomorph evolutionary program
Richard Dawkins
Dawkins 的 Biomorph 程序用递归规则和人为选择展示累积进化。它不属于机器学习艺术,但与 Karl Sims、William Latham 的进化艺术共同建立 interactive evolutionary aesthetics:创作者不必直接绘制结果,而是选择生成空间中的后代。
阅读原始来源 · Biomorph evolutionary program ↗
研究母版 · p. 11 · #029 · 研究论述待独立核验
在交互时间线打开 ↗1986通过误差反向传播学习表征
+
Learning representations by back-propagating errors
Rumelhart, Hinton & Williams
Backpropagation 让隐藏层可以通过训练形成对任务有用的内部表示。它不是视觉生成技术本身,却是后续深度学习视觉系统的基础机制之一:特征不再完全由人手工定义,而是在训练过程中形成。
阅读原始来源 · Learning representations by back-propagating errors ↗
研究母版 · p. 11 · #030 · 研究论述待独立核验
在交互时间线打开 ↗1987Boids:群体运动的局部规则
+
Boids
Craig Reynolds
Boids 用分离、对齐、聚合等局部规则模拟群体运动。它对动画、人工生命与生成艺术影响深远,说明视觉复杂性可以来自分布式规则而不是中央设计。
研究母版 · p. 12 · #031 · 研究论述待独立核验
在交互时间线打开 ↗1988–1992FormGrow 与 Mutator 进化系统
+
FormGrow / Mutator evolutionary systems
William Latham; Stephen Todd
Latham 与 Todd 在 IBM UK 等环境中开发基于进化的三维形态生成系统。其方法将艺术创作从直接塑形转变为定义生成规则和挑选变异结果,是今天 latent exploration 与 variation workflow 的重要历史类比。
阅读原始来源 · FormGrow / Mutator evolutionary systems ↗
研究母版 · p. 12 · #032 · 研究论述待独立核验
在交互时间线打开 ↗1991计算机图形中的人工进化
+
Artificial Evolution for Computer Graphics
Karl Sims
Karl Sims 用遗传算法和交互式选择生成复杂图像、纹理和动画。这里已经出现后来生成式系统非常熟悉的结构:机器批量产生候选,用户通过选择引导下一轮结果。它把“审美判断”嵌入生成回路,而不是只放在作品完成之后。
阅读原始来源 · Artificial Evolution for Computer Graphics ↗
研究母版 · p. 12 · #033 · 研究论述待独立核验
在交互时间线打开 ↗1994进化的虚拟生物
+
Evolving Virtual Creatures
Karl Sims
Sims 不仅生成图像,也让虚拟生物的身体结构和控制网络共同进化。这将生成艺术扩展到动态行为与人工生命,对之后游戏、simulation art 和 embodied generative systems 有长期影响。
阅读原始来源 · Evolving Virtual Creatures ↗
研究母版 · p. 12 · #034 · 研究论述待独立核验
在交互时间线打开 ↗1995 / 2000基于金字塔的纹理分析与参数化纹理模型
+
Pyramid-Based Texture Analysis/Synthesis; Parametric Texture Model
David Heeger; James Bergen; Javier Portilla; Eero Simoncelli
这些纹理合成方法尝试通过多尺度滤波响应与统计约束重建纹理外观。Gatys 的 neural style transfer 后来将深层网络特征统计用于 style representation,因此这一纹理统计传统是不可忽略的技术祖先。
阅读原始来源 · Pyramid-Based Texture Analysis/Synthesis; Parametric Texture Model ↗
研究母版 · p. 13 · #035 · 研究论述待独立核验
在交互时间线打开 ↗1998基于梯度学习的文档识别
+
Gradient-Based Learning Applied to Document Recognition
LeCun et al.
LeNet-5 及相关工作把卷积、共享权重、梯度训练整合为稳定视觉架构。后来的 AlexNet、生成模型中的卷积编码器和视觉特征提取都承接这一传统。
阅读原始来源 · Gradient-Based Learning Applied to Document Recognition ↗
研究母版 · p. 13 · #036 · 研究论述待独立核验
在交互时间线打开 ↗2001用于纹理合成与迁移的图像拼缝
+
Image Quilting for Texture Synthesis and Transfer
Alexei A. Efros; William T. Freeman
Image Quilting 从样本纹理中选择并拼接图像块生成更大纹理,还展示 texture transfer。它不是深度学习,却代表了“从现成图像材料学习和重组视觉外观”的重要前神经路线。
阅读原始来源 · Image Quilting for Texture Synthesis and Transfer ↗
研究母版 · p. 13 · #037 · 研究论述待独立核验
在交互时间线打开 ↗2001Processing:创意编程环境
+
Processing
Casey Reas; Ben Fry
Processing 把绘图、交互与程序结构变成易学的 creative coding 环境。它不属于 AI,但建立了 2000 年代最重要的生成艺术创作基础设施之一,并培养了后来接受 notebook、node workflow、 prompt scripting 的创作者文化。
研究母版 · p. 13 · #038 · 研究论述待独立核验
在交互时间线打开 ↗2006深度信念网络的快速学习算法
+
A Fast Learning Algorithm for Deep Belief Nets
Hinton, Osindero & Teh
这篇工作是 2000 年代深度学习复兴的重要节点之一。它帮助重新确立多层表示学习的研究势头,为几年后的大规模视觉深度学习创造条件。
阅读原始来源 · A Fast Learning Algorithm for Deep Belief Nets ↗
研究母版 · p. 14 · #039 · 研究论述待独立核验
在交互时间线打开 ↗2006–2012The Painting Fool:计算创造力项目
+
The Painting Fool
Simon Colton
The Painting Fool 是长期 computational creativity 项目,强调系统应当拥有一定创作决策和过程叙事。它连接 symbolic/computational creativity 与后来数据驱动生成模型之间的文化讨论。
研究母版 · p. 14 · #040 · 研究论述待独立核验
在交互时间线打开 ↗2009ImageNet:大规模层级图像数据库
+
ImageNet: A Large-Scale Hierarchical Image Database
Jia Deng; Wei Dong; Richard Socher; Li-Jia Li; Kai Li; Li Fei-Fei
ImageNet 将 WordNet 的语义层级与数百万图像连接,并使用众包完成标注。它代表 AI 视觉史最重要的 Dataset Turn:文化与日常图像不再只是被观看,而被组织成机器可学习、可比较、可扩展的训练资源。
阅读原始来源 · ImageNet: A Large-Scale Hierarchical Image Database ↗
研究母版 · p. 14 · #041 · 研究论述待独立核验
在交互时间线打开 ↗2010ImageNet 大规模视觉识别挑战赛
+
ILSVRC
ImageNet team; international computer vision community
ILSVRC 将 ImageNet 子集标准化为年度视觉识别竞赛。数据不只是训练材料,也成为可比较研究进步的度量体系;2012 AlexNet 的突破正是在这一制度结构中被确认和放大。
研究母版 · p. 14 · #042 · 研究论述待独立核验
在交互时间线打开 ↗2012AlexNet:深度卷积图像分类
+
AlexNet
Krizhevsky, Sutskever & Hinton
AlexNet 在 ImageNet 分类上大幅领先传统方法,使深度卷积网络成为计算机视觉主流。它把 Dataset Turn 推向能力生产:训练语料的规模、GPU 计算与 learned representation 开始形成一个强耦合系统。
研究母版 · p. 15 · #043 · 研究论述待独立核验
在交互时间线打开 ↗2013自编码变分贝叶斯
+
Auto-Encoding Variational Bayes
Kingma & Welling
VAE 建立可微分的潜变量生成框架。对 AI 艺术史最重要的遗产是“latent space”逐渐从统计模型术语变成视觉生成文化中的核心概念:图像可以被压缩成潜在表示,并从该空间重新采样和重构。
阅读原始来源 · Auto-Encoding Variational Bayes ↗
研究母版 · p. 15 · #044 · 研究论述待独立核验
在交互时间线打开 ↗2014生成对抗网络
+
Generative Adversarial Nets
Goodfellow et al.
GAN 把图像生成带入数据驱动的分布学习时代。与 AARON 等规则系统相比,生成逻辑不再主要由艺术家显式编码,而是从训练数据中学习。这个范式改变了“机器图像”的本体:输出开始被理解为某个数据分布的样本。
阅读原始来源 · Generative Adversarial Nets ↗
研究母版 · p. 15 · #045 · 研究论述待独立核验
在交互时间线打开 ↗2014条件生成对抗网络
+
Conditional Generative Adversarial Nets
Mehdi Mirza; Simon Osindero
Conditional GAN 将额外条件输入生成器和判别器,为“可控生成”提供通用框架。后来的 class-conditioned synthesis、text-to-image GAN 与各种结构条件生成都承接这一思路。
阅读原始来源 · Conditional Generative Adversarial Nets ↗
研究母版 · p. 15 · #046 · 研究论述待独立核验
在交互时间线打开 ↗2015LAPGAN:拉普拉斯金字塔生成网络
+
LAPGAN
Emily Denton; Soumith Chintala; Arthur Szlam; Rob Fergus
LAPGAN 通过 Laplacian pyramid 在多个尺度生成细节。它是 Progressive GAN 之前的重要高分辨率生成尝试,也说明“逐层/逐尺度”一直是图像生成质量扩展的核心问题。
研究母版 · p. 16 · #047 · 研究论述待独立核验
在交互时间线打开 ↗2015艺术风格的神经算法
+
A Neural Algorithm of Artistic Style
Gatys, Ecker & Bethge
Neural Style Transfer 用深层卷积特征表示内容,并用统计特征描述“style”,随后重新合成图像。它不能证明艺术风格本体上就是这些统计量,但它在文化上确立了极具影响力的想象:style 可以被提取、计算和转移。From Style to Sovereignty 的技术前史在这里第一次变得非常直观。
阅读原始来源 · A Neural Algorithm of Artistic Style ↗
研究母版 · p. 16 · #048 · 研究论述待独立核验
在交互时间线打开 ↗2015DeepDream:神经网络的可视化
+
DeepDream
Alexander Mordvintsev; Christopher Olah; Mike Tyka / Google
DeepDream 通过放大网络内部激活让模型“看见”的模式显形。它不是现代文生图,但它让公众第一次大规模接触一种明显来自神经网络内部表征的视觉风格,并迅速进入艺术家、媒体和网络文化。
研究母版 · p. 16 · #049 · 研究论述待独立核验
在交互时间线打开 ↗2015DRAW:注意机制与迭代画布
+
DRAW
Karol Gregor; Ivo Danihelka; Alex Graves; Danilo Rezende; Daan Wierstra
DRAW 结合 VAE、RNN 与可微注意机制,让模型通过多步“读/写”画布生成图像。虽然没有成为后来主流产品架构,它展示了 iterative image generation 与 attention 的早期结合。
研究母版 · p. 16 · #050 · 研究论述待独立核验
在交互时间线打开 ↗2015DCGAN:深度卷积生成对抗网络
+
DCGAN
Radford, Metz & Chintala
DCGAN 建立后来大量视觉 GAN 的标准架构实践,并显示潜变量方向可以对应语义变化。它使 latent manipulation 更接近后来的艺术工作流。
研究母版 · p. 17 · #051 · 研究论述待独立核验
在交互时间线打开 ↗2016pix2pix:配对图像转换
+
pix2pix
Isola et al.
pix2pix 用配对图像训练从 label map、edge map、sketch 等输入生成目标图像。它把生成模型从“从噪声生成”推进到“根据结构条件转换”,为后来编辑、重绘与结构控制留下清晰技术谱系。
研究母版 · p. 17 · #052 · 研究论述待独立核验
在交互时间线打开 ↗2016Prisma:移动端风格迁移
+
Prisma mobile application
Prisma Labs
Prisma 等应用把 neural style transfer 变成普通用户可直接使用的视觉界面。这一步的历史意义不是算法创新,而是把“风格作为可调用效果”变成大众日常经验。
阅读原始来源 · Prisma mobile application ↗
研究母版 · p. 17 · #053 · 研究论述待独立核验
在交互时间线打开 ↗2016–2017StackGAN:堆叠生成对抗网络的文本生成图像
+
StackGAN: Text to Photo-realistic Image Synthesis with Stacked GANs
Han Zhang; Tao Xu; Hongsheng Li; Shaoting Zhang; Xiaogang Wang; Xiaolei Huang; Dimitris Metaxas
StackGAN 用两阶段生成把文本描述转为低分辨率结构,再细化为更高分辨率图像。它是 DALL·E/Imagen 前 text-to-image 研究的重要主干,说明 prompt-driven image generation 在 diffusion 之前已有连续技术谱系。
阅读原始来源 · StackGAN: Text to Photo-realistic Image Synthesis with Stacked GANs ↗
研究母版 · p. 17 · #054 · 研究论述待独立核验
在交互时间线打开 ↗2017生成对抗网络的渐进式增长
+
Progressive Growing of GANs
Karras et al.
Progressive GAN 逐层增加分辨率,提高训练稳定性和细节质量。它使高分辨率合成人像在公众文化中具有巨大冲击力,并直接通向 StyleGAN。
阅读原始来源 · Progressive Growing of GANs ↗
研究母版 · p. 18 · #055 · 研究论述待独立核验
在交互时间线打开 ↗2017注意力就是全部所需
+
Attention Is All You Need
Vaswani et al.
Transformer 最初是序列建模架构,并非图像生成论文;但后来的 CLIP、DALL·E、DiT、 MMDiT 和原生多模态模型都直接或间接建立在 attention/Transformer 范式上。因此它必须出现在完整 Genealogy 中。
阅读原始来源 · Attention Is All You Need ↗
研究母版 · p. 18 · #056 · 研究论述待独立核验
在交互时间线打开 ↗2017CycleGAN:非配对图像转换
+
CycleGAN
Zhu et al.
CycleGAN 用 cycle consistency 解决 unpaired image translation,使季节转换、绘画域转换、对象变形等任务大幅扩展。它推动“视觉 domain / style 可被统计地学习并转换”的观念。
研究母版 · p. 18 · #057 · 研究论述待独立核验
在交互时间线打开 ↗2017神经离散表征学习:VQ-VAE
+
Neural Discrete Representation Learning
Aaron van den Oord; Oriol Vinyals; Koray Kavukcuoglu
VQ-VAE 学习离散 codebook,将高维输入压缩成可组合的离散表示。DALL·E、VQGAN 与多种 autoregressive image model 都继承了“视觉 token”思路。
阅读原始来源 · Neural Discrete Representation Learning ↗
研究母版 · p. 18 · #058 · 研究论述待独立核验
在交互时间线打开 ↗2017–2018AttnGAN:注意力驱动的细粒度文本生成图像
+
AttnGAN: Fine-Grained Text to Image Generation with Attentional GANs
Tao Xu; Pengchuan Zhang; Qiuyuan Huang; Han Zhang; Zhe Gan; Xiaolei Huang; Xiaodong He
AttnGAN 用 word-region attention 与 DAMSM 对齐文字和视觉区域,提高复杂文本描述的细节生成。它是现代 prompt adherence 与 cross-modal alignment 的重要前 diffusion 节点。
阅读原始来源 · AttnGAN: Fine-Grained Text to Image Generation with Attentional GANs ↗
研究母版 · p. 19 · #059 · 研究论述待独立核验
在交互时间线打开 ↗2018BigGAN:规模化条件图像生成
+
BigGAN
Brock, Donahue & Simonyan
BigGAN 将 GAN 训练扩展到大规模 ImageNet 条件生成,显著提高保真度。它强化了一个后来 foundation-model 时代反复出现的经验:模型、数据和计算规模本身可以成为生成质量的重要来源。
研究母版 · p. 19 · #060 · 研究论述待独立核验
在交互时间线打开 ↗2018StyleGAN:基于风格的生成架构
+
StyleGAN
Karras, Laine & Aila
StyleGAN 引入 mapping network 与 style-based generator,对不同尺度视觉属性进行更直观的控制。它把“latent space 中存在可导航视觉属性”这一观念推向广泛文化影响,也推动人脸生成、latent editing 与 AI 肖像实践。
研究母版 · p. 19 · #061 · 研究论述待独立核验
在交互时间线打开 ↗2018–2019Ganbreeder 与 Artbreeder:潜在空间的社交创作
+
Ganbreeder / Artbreeder
Joel Simon; Artbreeder community
Joel Simon 的 Ganbreeder 后发展为 Artbreeder,把 GAN latent space 变成可浏览、混合、 继承和社交分享的创作界面。它是 prompt culture 之前重要的“latent culture”节点。
阅读原始来源 · Ganbreeder / Artbreeder ↗
研究母版 · p. 19 · #062 · 研究论述待独立核验
在交互时间线打开 ↗2018-10《埃德蒙·德·贝拉米肖像》拍卖
+
Portrait of Edmond de Belamy
Obvious (Hugo Caselles-Dupré; Pierre Fautrel; Gauthier Vernier); Robbie Barrat lineage controversy
Christie’s 以 432,500 美元成交《Edmond de Belamy》,使 GAN art 成为全球媒体议题, 同时也引发代码来源、作者性和技术劳动归属争论。AI art 的价值链开始明显涉及模型、代码、艺术品牌与市场制度。
阅读原始来源 · Portrait of Edmond de Belamy ↗
研究母版 · p. 20 · #063 · 研究论述待独立核验
在交互时间线打开 ↗2019《AI:不止于人类》展览
+
AI: More than Human
Barbican curatorial team; international artists/researchers
Barbican 的大型展览把历史 automata、机器学习、机器人和当代 AI 艺术放入同一叙事空间。AI art 在 2019 前后已形成稳定的机构展示对象,为 2022 后的争议提供制度前史。
阅读原始来源 · AI: More than Human ↗
研究母版 · p. 20 · #064 · 研究论述待独立核验
在交互时间线打开 ↗2019《过路人的记忆 I》
+
Memories of Passersby I
Mario Klingemann
Klingemann 将神经生成系统作为持续运行的装置出售,使“作品”从一张 AI 图像转向生成机器本身及其无穷输出。它对 AI art 的 objecthood、收藏与作者性提出更复杂问题。
阅读原始来源 · Memories of Passersby I ↗
研究母版 · p. 20 · #065 · 研究论述待独立核验
在交互时间线打开 ↗2019VQ-VAE-2:多样且高保真的图像生成
+
Generating Diverse High-Fidelity Images with VQ-VAE-2
Ali Razavi; Aaron van den Oord; Oriol Vinyals
VQ-VAE-2 使用层级离散潜变量和 autoregressive priors 达到当时很高的图像质量,为 DALL·E 等将视觉表示 token 化的大模型路径提供重要技术背景。
阅读原始来源 · Generating Diverse High-Fidelity Images with VQ-VAE-2 ↗
研究母版 · p. 20 · #066 · 研究论述待独立核验
在交互时间线打开 ↗2019SPADE 与 GauGAN:语义布局生成图像
+
SPADE paper / GauGAN demo
Taesung Park; Ming-Yu Liu; Ting-Chun Wang; Jun-Yan Zhu / NVIDIA
SPADE 将 semantic layout 转换为高质量图像,NVIDIA 以 GauGAN 演示其交互创作潜力。它预示后来 ControlNet、布局控制和设计型生成工具的发展。
阅读原始来源 · SPADE paper / GauGAN demo ↗
研究母版 · p. 21 · #067 · 研究论述待独立核验
在交互时间线打开 ↗2019StyleGAN2:分析并改进生成图像质量
+
Analyzing and Improving the Image Quality of StyleGAN
Tero Karras; Samuli Laine; Miika Aittala; Janne Hellsten; Jaakko Lehtinen; Timo Aila
StyleGAN2 修正 StyleGAN 的特征伪影,并改进 latent-to-image mapping。它强化了 inversion、编辑与属性操控,使“生成—反演—编辑”的完整工作流变得更成熟。
阅读原始来源 · Analyzing and Improving the Image Quality of StyleGAN ↗
研究母版 · p. 21 · #068 · 研究论述待独立核验
在交互时间线打开 ↗2020去噪扩散概率模型
+
Denoising Diffusion Probabilistic Models
Ho, Jain & Abbeel
DDPM 证明 diffusion probabilistic models 可以达到高质量图像合成。与 GAN 的一次性生成不同,diffusion 把图像构造为逐步反演噪声的过程;这一范式随后成为 2022 以后文生图的主流基础。
阅读原始来源 · Denoising Diffusion Probabilistic Models ↗
研究母版 · p. 21 · #069 · 研究论述待独立核验
在交互时间线打开 ↗2020–2021驯服 Transformer:VQGAN
+
Taming Transformers / VQGAN
Esser, Rombach & Ommer
VQGAN 将卷积编码器的局部视觉能力与 Transformer 的全局建模结合,形成高质量离散视觉表示。它直接影响了早期 VQGAN+CLIP 艺术文化,也为 latent-space generative models 提供重要技术经验。
阅读原始来源 · Taming Transformers / VQGAN ↗
研究母版 · p. 21 · #070 · 研究论述待独立核验
在交互时间线打开 ↗2020-04Jukebox:音乐生成模型
+
Jukebox: A Generative Model for Music
Prafulla Dhariwal et al.; OpenAI
Jukebox 用层级 VQ-VAE 与 autoregressive priors 生成音乐和粗略人声。它不是后来的文本音乐平台,但显示“从大规模文化录音中学习生成能力”已成为跨媒体范式。
阅读原始来源 · Jukebox: A Generative Model for Music ↗
研究母版 · p. 22 · #071 · 研究论述待独立核验
在交互时间线打开 ↗2020-05语言模型是少样本学习者:GPT-3
+
Language Models are Few-Shot Learners
Tom B. Brown et al.; OpenAI
GPT-3 不是图像模型,但它把 prompt 从普通输入文本提升为通用任务编程接口。DALL·E 3、ChatGPT 图像生成和 conversational editing 的文化逻辑,都建立在“自然语言作为模型控制层”这一更广泛变化上。
阅读原始来源 · Language Models are Few-Shot Learners ↗
研究母版 · p. 22 · #072 · 研究论述待独立核验
在交互时间线打开 ↗2021Botto:社区投票与持续生成
+
Botto
Mario Klingemann; Botto community
Botto 通过生成候选图像、社区投票和拍卖形成持续创作回路。它把生成模型、collective taste、token governance 和艺术市场合并,为“机器作者性”和平台化文化生产提供重要案例。
研究母版 · p. 22 · #073 · 研究论述待独立核验
在交互时间线打开 ↗2021VQGAN+CLIP:社区工作流
+
VQGAN+CLIP community workflow
Community practitioners; Katherine Crowson and open-source notebook ecosystem
社区把 VQGAN 的视觉生成与 CLIP 的文本—图像相似度结合,用文字引导生成过程。它并非单篇 canonical paper,而是一种高度重要的实践组合:prompt recipe、艺术家姓名、seed、notebook 和迭代参数开始成为创作语言。
阅读原始来源 · VQGAN+CLIP community workflow ↗
研究母版 · p. 22 · #074 · 研究论述待独立核验
在交互时间线打开 ↗2021-02零样本文本生成图像:DALL·E
+
Zero-Shot Text-to-Image Generation
Aditya Ramesh; Mikhail Pavlov; Gabriel Goh; Scott Gray; Chelsea Voss et al. / OpenAI
DALL·E 用 autoregressive Transformer 统一建模文字与图像 token,并展示广泛 zero-shot 组合能力。它把“输入一句话生成新图像”从研究演示推进为公众可理解的新型生成范式。
阅读原始来源 · Zero-Shot Text-to-Image Generation ↗
研究母版 · p. 23 · #075 · 研究论述待独立核验
在交互时间线打开 ↗2021-02从自然语言监督中学习可迁移视觉模型:CLIP
+
Learning Transferable Visual Models From Natural Language Supervision
Alec Radford et al. / OpenAI
CLIP 从互联网图文对学习图像—文本对齐,使自然语言能够零样本地指向视觉概念。它成为 VQGAN+CLIP、Disco Diffusion 等早期 prompt-driven image art 的核心条件,也把 web-scale image-text data 推到生成文化中心。
阅读原始来源 · Learning Transferable Visual Models From Natural Language Supervision ↗
研究母版 · p. 23 · #076 · 研究论述待独立核验
在交互时间线打开 ↗2021-05扩散模型超越生成对抗网络
+
Diffusion Models Beat GANs
Dhariwal & Nichol
这项工作通过改进架构与 classifier guidance 让 diffusion 在 ImageNet 合成上超过当时主流 GAN。它标志 GAN 时代向 diffusion 时代的技术转折。
阅读原始来源 · Diffusion Models Beat GANs ↗
研究母版 · p. 23 · #077 · 研究论述待独立核验
在交互时间线打开 ↗2021-10-29Disco Diffusion:可复用的生成笔记本
+
Disco Diffusion notebook/system
Somnai; Gandamu; Disco Diffusion contributors/community
Disco Diffusion 从 2021 年 10 月起快速迭代,将 diffusion、CLIP guidance、cutouts、图像提示和动画参数整合为可复用 Colab 工作流。它在论文史中不一定是最基础的发明,但在 AI 艺术史中是决定性的文化节点:prompt engineering 被大量用户直接当作艺术实践。
阅读原始来源 · Disco Diffusion notebook/system ↗
研究母版 · p. 23 · #078 · 研究论述待独立核验
在交互时间线打开 ↗2021-12GLIDE:文本引导的图像生成与编辑
+
GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models
Alex Nichol; Prafulla Dhariwal et al. / OpenAI
GLIDE 比较 CLIP guidance 与 classifier-free guidance,并展示 photorealistic text-to-image 与 inpainting。它是 DALL·E 2 和后来主流 diffusion 文生图的重要前置节点。
研究母版 · p. 24 · #079 · 研究论述待独立核验
在交互时间线打开 ↗2021-12 / 2022-06潜在扩散模型
+
Latent Diffusion Models
Rombach et al.
Latent Diffusion Models 在预训练 autoencoder 的潜空间进行 diffusion,并通过 cross- attention 接收文本等条件。它显著降低计算成本,是 Stable Diffusion 的直接技术基础,也是开放文生图生态真正可以跑到消费级 GPU 的关键原因之一。
阅读原始来源 · Latent Diffusion Models ↗
研究母版 · p. 24 · #080 · 研究论述待独立核验
在交互时间线打开 ↗2022LAION-5B:大规模图文数据集
+
LAION-5B: An open large-scale dataset for training next generation image-text models
Christoph Schuhmann et al. / LAION
LAION-5B 公开大规模 image-text pair 索引和过滤方法,成为 Stable Diffusion 等开放生态的重要数据背景。它也是 2022 以后版权、训练数据、艺术家姓名与数据来源争议无法绕开的技术节点: 数据集本身从工程基础设施变成政治对象。
阅读原始来源 · LAION-5B: An open large-scale dataset for training next generation image-text models ↗
研究母版 · p. 24 · #081 · 研究论述待独立核验
在交互时间线打开 ↗2022DALL·E 2:结合 CLIP 潜变量的分层图像生成
+
Hierarchical Text-Conditional Image Generation with CLIP Latents / DALL·E 2 product
Aditya Ramesh; Prafulla Dhariwal; Alex Nichol; Casey Chu / OpenAI
DALL·E 2 将 diffusion-based image prior/decoder 与 CLIP 表示结合,显著提升逼真度和文本一致性。2022 年逐步扩展研究预览、beta 和无候补名单访问,使文生图第一次成为全球大众产品。
母版标作 2022-03;产品与论文发布月份待复核,此处暂按年份展示。
阅读原始来源 · Hierarchical Text-Conditional Image Generation with CLIP Latents / DALL·E 2 product ↗
研究母版 · p. 25 · #082 · 研究论述待独立核验
在交互时间线打开 ↗2022–2023Civitai:社区模型流通平台
+
Civitai model-sharing platform
Civitai founders/team and model-sharing community
Civitai 等平台把 Stable Diffusion 生态中的微调模型与配置变成可流通的文化对象。生成能力从单一 foundation model 分裂成庞大的社区模型市场,也让 provenance、风格复制、人物模型与 consent 问题更复杂。
阅读原始来源 · Civitai model-sharing platform ↗
研究母版 · p. 27 · #091 · 研究论述待独立核验
在交互时间线打开 ↗2022–2023LoRA:低秩适配与扩散社区应用
+
LoRA: Low-Rank Adaptation of Large Language Models + diffusion community adoption
Edward Hu et al. (LoRA); Stable Diffusion open-source community
LoRA 原论文发表于 2021 年,通过冻结主模型、训练低秩增量矩阵降低微调成本。Stable Diffusion 社群在 2022–23 年迅速把它变成 style、character、clothing、pose、celebrity 等小型可交换适配器。这里发生了关键文化转变:风格和身份不再只是 prompt 里的名字,也可以被打包为一个轻量模型文件流通。
阅读原始来源 · LoRA: Low-Rank Adaptation of Large Language Models + diffusion community adoption ↗
研究母版 · p. 27 · #092 · 研究论述待独立核验
在交互时间线打开 ↗2022-05Imagen:深层语言理解与逼真图像生成
+
Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding
Chitwan Saharia et al. / Google Research
Imagen 使用大型文本编码器和 diffusion decoder,研究显示扩大 language model 对 image-text alignment 的收益尤其明显。它强化了一个后来被 GPT-native image generation 继续推进的方向:更强语言理解会改变视觉生成能力。
阅读原始来源 · Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding ↗
研究母版 · p. 25 · #083 · 研究论述待独立核验
在交互时间线打开 ↗2022-06Parti:扩展自回归模型以生成丰富图像
+
Scaling Autoregressive Models for Content-Rich Text-to-Image Generation
Jiahui Yu et al. / Google Research
Parti 探索与 diffusion 并行的 autoregressive 路线,把图像 token 当作另一种“语言”生成。它说明 2022 年文生图爆发并非只有 diffusion 一条技术道路。
阅读原始来源 · Scaling Autoregressive Models for Content-Rich Text-to-Image Generation ↗
研究母版 · p. 25 · #084 · 研究论述待独立核验
在交互时间线打开 ↗2022-06Diffusers:模块化扩散工具库
+
Diffusers library
Hugging Face Diffusers team
Diffusers 把 schedulers、pipelines、model components 和训练脚本模块化,显著降低 diffusion model 的部署和二次开发门槛。它是研究模型快速变成生态系统的重要中间层。
研究母版 · p. 25 · #085 · 研究论述待独立核验
在交互时间线打开 ↗2022-07Midjourney:开放测试与 Discord 社区
+
Midjourney open beta / Discord platform
David Holz; Midjourney team/community
Midjourney 的历史意义不仅是模型质量。Discord 界面让用户实时看到他人的 prompt 与结果,形成极高密度的社会学习、风格扩散和 prompt imitation。文生图由“个人工具”转为公共视觉文化。
阅读原始来源 · Midjourney open beta / Discord platform ↗
研究母版 · p. 26 · #086 · 研究论述待独立核验
在交互时间线打开 ↗2022-08–10AUTOMATIC1111:Stable Diffusion 网页界面
+
stable-diffusion-webui
AUTOMATIC1111 and open-source contributors
WebUI 将 txt2img、img2img、inpainting、sampler、extensions 和后来的 LoRA/ControlNet 集成进统一界面。开放权重真正转化为大规模创作者工具,离不开这类社区软件层。
阅读原始来源 · stable-diffusion-webui ↗
研究母版 · p. 26 · #087 · 研究论述待独立核验
在交互时间线打开 ↗2022-08-02一个词即一幅图:文本反演与个性化生成
+
An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion
Rinon Gal; Yuval Alaluf; Yuval Atzmon; Or Patashnik; Amit Bermano; Gal Chechik; Daniel Cohen-Or
Textual Inversion 学习新的 text embedding,而不重训整个模型。它极其适合这条 Genealogy:视觉概念、对象甚至 style 可以被映射为一个可组合的新“词”。注意:这不是说 style 本体就是 token,而是模型中一种有效的个性化表示方法。
研究母版 · p. 28 · #093 · 研究论述待独立核验
在交互时间线打开 ↗2022-08-22Stable Diffusion:公开模型权重
+
Stable Diffusion public model release
Robin Rombach; Patrick Esser; CompVis; Stability AI; Runway collaborators
Stable Diffusion 基于 Latent Diffusion 路线并公开模型权重。其真正的历史断裂在于 access model:用户不再只能调用公司 API,而可以下载、fine-tune、fork、组合和本地部署。随后 LoRA、 ControlNet、Civitai、ComfyUI 等完整生态由此爆发。
阅读原始来源 · Stable Diffusion public model release ↗
研究母版 · p. 26 · #088 · 研究论述待独立核验
在交互时间线打开 ↗2022-08-25DreamBooth:面向特定主体的扩散模型微调
+
DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation
Nataniel Ruiz; Yuanzhen Li; Varun Jampani; Yael Pritch; Michael Rubinstein; Kfir Aberman
DreamBooth 通过少量 subject images fine-tune pretrained text-to-image model,把唯一 identifier 与具体主体绑定。它把 identity preservation 直接引入生成系统,也为后来的 celebrity / character / product customization 和 likeness 争议提供技术前史。
阅读原始来源 · DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation ↗
研究母版 · p. 28 · #094 · 研究论述待独立核验
在交互时间线打开 ↗2022-09《太空歌剧院》:艺术竞赛争议
+
Théâtre D’opéra Spatial
Jason M. Allen; Midjourney
Jason Allen 使用 Midjourney 创作并后期处理作品后参赛获奖。事件成为 2022 “Political Turn”的文化标志之一:争论从技术展示转向艺术劳动、规则披露、作者身份与竞争公平。
阅读原始来源 · Théâtre D’opéra Spatial ↗
这份 2023 年的官方登记复审文件回顾了作品及其 2022 年获奖情况。
研究母版 · p. 26 · #089 · 研究论述待独立核验
在交互时间线打开 ↗2022-11《无监督》:博物馆藏品与生成装置
+
Unsupervised
Refik Anadol Studio; MoMA
Unsupervised 使用 MoMA collection data 训练/驱动生成视觉系统,并以实时大型屏幕呈现。作品同时让 dataset、museum collection 和生成模型之间的关系变成可见的艺术材料。
研究母版 · p. 27 · #090 · 研究论述待独立核验
在交互时间线打开 ↗2022-11 / 2023InstructPix2Pix:遵循图像编辑指令
+
InstructPix2Pix: Learning to Follow Image Editing Instructions
Tim Brooks; Aleksander Holynski; Alexei A. Efros
InstructPix2Pix 利用 GPT-3 与 Stable Diffusion 合成训练数据,再训练 instruction-conditioned diffusion model。它把生成系统从“一次性造图”推进到“对已有图像进行语言驱动修改”的交互范式。
阅读原始来源 · InstructPix2Pix: Learning to Follow Image Editing Instructions ↗
研究母版 · p. 28 · #095 · 研究论述待独立核验
在交互时间线打开 ↗2023ComfyUI:节点式生成工作流
+
ComfyUI
ComfyAnonymous and open-source contributors
ComfyUI 把 Stable Diffusion 工作流显式化为 graph。它的历史意义是把 generation 变成 production pipeline:用户不再只写 prompt,而是在可视化系统里编排模型与控制模块。AI 图像创作由“模型使用”走向“系统设计”。
研究母版 · p. 29 · #096 · 研究论述待独立核验
在交互时间线打开 ↗2023AnimateDiff:为个性化图像模型增加运动
+
AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
Yuwei Guo et al.
AnimateDiff 将运动建模作为可插拔模块引入 personalized text-to-image diffusion ecosystem。它的重要性在于保持原有角色、风格和社区模型资产,同时把静态生成扩展到视频。
研究母版 · p. 31 · #106 · 研究论述待独立核验
在交互时间线打开 ↗2023-02ControlNet:为文本生成图像增加条件控制
+
Adding Conditional Control to Text-to-Image Diffusion Models
Lvmin Zhang; Anyi Rao; Maneesh Agrawala
ControlNet 冻结 pretrained diffusion backbone,通过附加网络学习空间条件。它把 text-to-image 从语义控制推进到几何与构图控制,是 AI 生产工作流真正专业化的转折点之一。
阅读原始来源 · Adding Conditional Control to Text-to-Image Diffusion Models ↗
研究母版 · p. 29 · #097 · 研究论述待独立核验
在交互时间线打开 ↗2023-02T2I-Adapter:轻量适配器与精细控制
+
T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models
Chong Mou; Xintao Wang; Liangbin Xie; Yanze Wu; Jian Zhang; Zhongang Qi; Ying Shan; Xiaohu Qie
T2I-Adapter 与 ControlNet 同期代表一个决定性趋势:基础模型无需完全重训,就可以通过模块化附件获得精细外部控制。AI 图像生产因此变成 base model + adapters 的组合系统。
研究母版 · p. 29 · #098 · 研究论述待独立核验
在交互时间线打开 ↗2023-03-21Adobe Firefly 与生成式填充
+
Adobe Firefly / Generative Fill
Adobe Firefly / Adobe Research and Creative Cloud teams
Firefly 的意义不仅是 Adobe 也做文生图,而是 GenAI 进入成熟创意软件基础设施。Adobe 从发布之初就把训练来源、创作者补偿、Do Not Train 和 Content Credentials 与模型产品绑定,生成技术第一次以大型创意产业标准化治理方案进入设计师日常。
阅读原始来源 · Adobe Firefly / Generative Fill ↗
研究母版 · p. 29 · #099 · 研究论述待独立核验
在交互时间线打开 ↗2023-05DragGAN:基于拖动点的图像编辑
+
Drag Your GAN: Interactive Point-based Manipulation on the Generative Image Manifold
Xingang Pan et al.; Max Planck Institute for Informatics / Saarland research team
DragGAN 利用 GAN feature space 实现 point-based manipulation,展示“直接操纵生成流形”的编辑范式。虽然 diffusion 很快成为主流,这种 direct manipulation 继续影响后来的生成式编辑界面。
阅读原始来源 · Drag Your GAN: Interactive Point-based Manipulation on the Generative Image Manifold ↗
研究母版 · p. 30 · #100 · 研究论述待独立核验
在交互时间线打开 ↗2023-06Runway Gen-2:多模态视频生成
+
Gen-2 multimodal video generation
Runway
Runway Gen-2 支持文本、图像等条件生成短视频,是 2023 生成视频产品化的重要节点。它把创作者的关注从单张构图扩展到运动、摄影机、时间一致性和影视生产。
阅读原始来源 · Gen-2 multimodal video generation ↗
研究母版 · p. 31 · #107 · 研究论述待独立核验
在交互时间线打开 ↗2023-07-26SDXL:高分辨率潜在扩散模型
+
SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
Robin Rombach; Stability AI research team and collaborators
SDXL 提高构图、细节、风格和分辨率表现,并继续保持开放模型可微调、可组合的特征。它是 Stable Diffusion 生态从实验性爆发进入成熟生产阶段的重要节点。
阅读原始来源 · SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis ↗
研究母版 · p. 30 · #101 · 研究论述待独立核验
在交互时间线打开 ↗2023-08IP-Adapter:图像提示适配器
+
IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models
Hu Ye; Jun Zhang; Sibo Liu; Xiao Han; Wei Yang / Tencent AI Lab
IP-Adapter 通过 decoupled cross-attention 为 pretrained diffusion 增加 lightweight image-prompt capability。它让参考图控制与 text prompt、ControlNet 共存,为今天广泛的 reference-driven portrait、fashion 和 identity workflows 奠定关键基础。
阅读原始来源 · IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models ↗
研究母版 · p. 30 · #102 · 研究论述待独立核验
在交互时间线打开 ↗2023-08Ideogram:图像中的文字
+
Ideogram text-to-image model
Ideogram team
Ideogram 因较强的 in-image text rendering 获得关注。它显示 text-to-image 不再只竞争“漂亮图”,而进入文字、版式、标志与商业图形等设计任务。
阅读原始来源 · Ideogram text-to-image model ↗
研究母版 · p. 30 · #103 · 研究论述待独立核验
在交互时间线打开 ↗2023-09PixArt-α:高效扩散 Transformer
+
PixArt-α: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
Junsong Chen et al.
PixArt-α 将 diffusion transformer、预训练文本编码器和训练效率作为核心问题,成为 2024 DiT/flow image model 浪潮的重要开放研究节点。
研究母版 · p. 34 · #118 · 研究论述待独立核验
在交互时间线打开 ↗2023-09 / 2023-10DALL·E 3 与 ChatGPT 集成
+
DALL·E 3 / ChatGPT integration
OpenAI image generation team; ChatGPT product team
DALL·E 3 与 ChatGPT 集成,使用户可以用自然语言讨论想法、要求修改,再由语言模型组织图像提示。这个节点改变了交互逻辑:用户不再必须掌握模型特有的 prompt 语法,生成界面开始从 prompt box 转向 conversation。
阅读原始来源 · DALL·E 3 / ChatGPT integration ↗
研究母版 · p. 37 · #128 · 研究论述待独立核验
在交互时间线打开 ↗2023-10潜在一致性模型:少步图像生成
+
Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference
Simian Luo et al.
LCM 通过 consistency distillation 在 latent space 实现 2–4 步高质量生成。速度提升改变的是接口可能性:当生成接近实时,AI 图像更容易进入绘画、设计、直播和交互软件。
阅读原始来源 · Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference ↗
研究母版 · p. 31 · #104 · 研究论述待独立核验
在交互时间线打开 ↗2023-11Pika 1.0:视频生成与修改
+
Pika 1.0
Pika Labs
Pika 将 text-to-video、image-to-video 和视频修改包装为低门槛创作工具。它与 Runway 一起使生成视频从研究和专业试验走向大众产品市场。
研究母版 · p. 32 · #108 · 研究论述待独立核验
在交互时间线打开 ↗2023-11Stable Video Diffusion:开放视频生成
+
Stable Video Diffusion
Stability AI / research collaborators
Stable Video Diffusion 将 latent video diffusion 公开给研究和开发者,使开放生成生态从图像向视频延展。它也预示后续 image model / video model 之间越来越紧密的共享基础设施。
阅读原始来源 · Stable Video Diffusion ↗
研究母版 · p. 32 · #109 · 研究论述待独立核验
在交互时间线打开 ↗2023-12Midjourney V6
+
Midjourney V6
Midjourney team
Midjourney V6 强化 prompt accuracy、coherence、image prompting 与 remix。它代表闭源平台路线在视觉品质、审美调性和社区界面上的持续迭代。
研究母版 · p. 31 · #105 · 研究论述待独立核验
在交互时间线打开 ↗2024Recraft V3:面向设计交付
+
Recraft V3
Recraft team
Recraft 等设计导向模型把生成任务从纯视觉想象推进到品牌资产、排版、矢量与可交付设计。这个分化说明 AI image generation 已经从单一技术类别变成不同创意产业的生产工具。
研究母版 · p. 34 · #119 · 研究论述待独立核验
在交互时间线打开 ↗2024-01InstantID:零样本身份保持
+
InstantID: Zero-shot Identity-Preserving Generation in Seconds
Qixun Wang et al.
InstantID 将 face embedding 与结构条件结合,为 diffusion 增加高效 identity preservation。它是 DreamBooth 式“训练一个人”向 reference-based identity generation 转型的重要节点,也直接关联 likeness / consent 的后来争议。
阅读原始来源 · InstantID: Zero-shot Identity-Preserving Generation in Seconds ↗
研究母版 · p. 35 · #120 · 研究论述待独立核验
在交互时间线打开 ↗2024-02Sora:连续影像与公众期待
+
Sora
OpenAI Sora research and product teams
Sora 把公众对生成模型的期待从单张图像推向连续世界、摄影机运动和物理一致性。它使“生成视觉文化”的研究范围不可避免地扩展到 video model 与影视产业。
研究母版 · p. 32 · #110 · 研究论述待独立核验
在交互时间线打开 ↗2024-02Stable Cascade:分阶段压缩生成
+
Stable Cascade
Stability AI; Würstchen research lineage
Stable Cascade 基于 Würstchen 路线,将极强语义压缩与分阶段生成结合。虽然未成为最终主导生态,它代表 post-SDXL 时期对效率、压缩表示和 modular generation 的重要探索。
研究母版 · p. 35 · #121 · 研究论述待独立核验
在交互时间线打开 ↗2024-02Stable Diffusion 3:整流流 Transformer
+
Stable Diffusion 3 / Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
Stability AI research team
SD3 采用 diffusion transformer 与 flow matching,并强调多主体 prompt、文字与图像质量。这一节点代表主流图像生成进一步吸收 Transformer 架构。
研究母版 · p. 35 · #122 · 研究论述待独立核验
在交互时间线打开 ↗2024-05Veo:面向电影语言的视频生成
+
Veo video generation model
Google DeepMind
Veo 在 Google I/O 2024 发布,强调 1080p、超过一分钟时长和电影语言理解。它将视频生成竞争从短片 demo 推向更接近影视生产的时长、镜头和控制问题。
阅读原始来源 · Veo video generation model ↗
研究母版 · p. 32 · #111 · 研究论述待独立核验
在交互时间线打开 ↗2024-05 / 2024-08Imagen 3:平台模型栈中的图像能力
+
Imagen 3
Google DeepMind / Imagen team
Imagen 3 在 Google I/O 亮相并随后进入 Gemini 与 Vertex AI。它代表大型通用 AI 平台把 image generation 作为模型栈中的标准媒体能力,而不再是孤立实验产品。
研究母版 · p. 35 · #123 · 研究论述待独立核验
在交互时间线打开 ↗2024-06可灵:视频生成模型
+
Kling video generation model
Kuaishou / Kling AI team
Kling 在 2024 年公开后迅速因运动表现和较长视频能力获得关注。它说明生成媒体前沿不再由单一欧美实验室主导,也为后来的跨平台影视 IP 冲突提供技术背景。
阅读原始来源 · Kling video generation model ↗
研究母版 · p. 33 · #112 · 研究论述待独立核验
在交互时间线打开 ↗2024-06Dream Machine:面向用户的视频生成
+
Dream Machine
Luma AI
Dream Machine 通过 web 产品快速开放 text/image-to-video,使 2024 年视频生成呈现与 2022 文生图类似的产品爆发:用户开始围绕 prompt、reference image 和 motion consistency 建立新工作流。
研究母版 · p. 33 · #113 · 研究论述待独立核验
在交互时间线打开 ↗2024-06Runway Gen-3 Alpha
+
Gen-3 Alpha
Runway
Gen-3 Alpha 强化 fidelity、motion 与 temporal consistency,并逐渐加入 image/video controls。它标志生成视频开始形成与 image GenAI 同样复杂的专业控制层。
研究母版 · p. 33 · #114 · 研究论述待独立核验
在交互时间线打开 ↗2024-08FLUX.1 模型家族
+
FLUX.1 model family
Black Forest Labs (Robin Rombach; Andreas Blattmann; Patrick Esser et al.)
由多位原 Stable Diffusion/CompVis 核心研究者参与创建的 Black Forest Labs 推出 FLUX.1。它强化 prompt adherence、文字生成和高质量开放/可开发生态,并让社区微调基础逐渐从 SDXL 扩展到新的模型家族。
阅读原始来源 · FLUX.1 model family ↗
研究母版 · p. 36 · #124 · 研究论述待独立核验
在交互时间线打开 ↗2024-08Ideogram 2.0:排版与风格控制
+
Ideogram 2.0
Ideogram
Ideogram 2.0 强化 typography、style control 和多种生成模式。它代表 2024 以后模型竞争从纯 photorealism 转向可读文字、品牌感和设计可用性。
研究母版 · p. 36 · #125 · 研究论述待独立核验
在交互时间线打开 ↗2024-10Stable Diffusion 3.5
+
Stable Diffusion 3.5
Stability AI
SD3.5 Large / Large Turbo / Medium 继续使用 MMDiT/flow 路线并调整质量与硬件适配。它不再像 SD 1.5 那样垄断社区,但仍是开放生成模型多中心格局的重要节点。
阅读原始来源 · Stable Diffusion 3.5 ↗
研究母版 · p. 36 · #126 · 研究论述待独立核验
在交互时间线打开 ↗2024-11FLUX.1 Tools:编辑与结构控制
+
FLUX.1 Tools
Black Forest Labs
BFL 为 FLUX 推出 Fill、Depth、Canny 和 Redux 等工具,把编辑、边缘/深度控制和 reference remix 直接纳入模型家族。这显示模块化 control 已从社区扩展层变成基础模型公司的标准产品能力。
研究母版 · p. 36 · #127 · 研究论述待独立核验
在交互时间线打开 ↗2024-12混元视频:公开模型与代码
+
HunyuanVideo
Tencent Hunyuan team
HunyuanVideo 公开模型与代码,使高参数规模视频生成也进入 open-weight/open-source 竞争。它加强了 ComfyUI 等社区对视频模型的本地编排能力。
研究母版 · p. 33 · #115 · 研究论述待独立核验
在交互时间线打开 ↗2025-03Runway Gen-4:跨镜头一致性
+
Gen-4
Runway
Gen-4 强调在多个生成镜头中维持人物、环境和视觉风格一致。生成视频从“单个漂亮 clip”转向可编辑、可连续叙事的 production system。
研究母版 · p. 34 · #116 · 研究论述待独立核验
在交互时间线打开 ↗2025-03Gemini 原生图像生成预览
+
Gemini native image generation preview
Google DeepMind / Gemini team
Gemini 2.0 Flash 的原生图像能力展示 text+image dialogue、连续编辑和多模态输出。它与 GPT-4o 同期表明 image generation 正从独立 diffusion product 融入 general multimodal model。
阅读原始来源 · Gemini native image generation preview ↗
研究母版 · p. 37 · #129 · 研究论述待独立核验
在交互时间线打开 ↗2025-03Ideogram 3.0:文字、写实与风格参考
+
Ideogram 3.0
Ideogram
Ideogram 3.0 继续强化 text rendering、photorealism 和 style references。它体现专业图像模型在 2025 进一步垂直化:不同产品围绕设计、文字、品牌资产形成明确差异。
研究母版 · p. 37 · #130 · 研究论述待独立核验
在交互时间线打开 ↗2025-03-25GPT-4o 原生图像生成
+
GPT-4o native image generation
OpenAI image generation and multimodal teams
GPT-4o image generation 可以在对话上下文中理解上传图片、渲染文字、执行多轮修改,并利用模型知识生成视觉内容。这里发生重要 Interface Turn:用户不再“操作图像生成器”,而是与一个同时能看、理解、讨论、编辑和生成的多模态系统协作。
阅读原始来源 · GPT-4o native image generation ↗
研究母版 · p. 37 · #131 · 研究论述待独立核验
在交互时间线打开 ↗2025-04-04Midjourney V7:个性化与快速迭代
+
Midjourney V7
Midjourney team
V7 强化 text/image prompt、细节一致性,并把 personalization 设为默认能力。Draft Mode 的对话式快速迭代显示,即使在独立图像平台中,交互也在从“一次一 prompt”转向持续的 conversational workflow。
研究母版 · p. 38 · #132 · 研究论述待独立核验
在交互时间线打开 ↗2025-04-23gpt-image-1:图像生成 API
+
gpt-image-1 API
OpenAI image generation team
OpenAI 通过 gpt-image-1 把 ChatGPT 图像生成能力开放给开发者和企业。历史意义在于接口层再次迁移:native multimodal image generation 不只存在于一个聊天产品,而可以被嵌入电商、 设计、教育、游戏与企业工作流。
研究母版 · p. 38 · #133 · 研究论述待独立核验
在交互时间线打开 ↗2025-04-24Firefly Image Model 4:创意平台中的模型调用
+
Firefly Image Model 4
Adobe Firefly / Creative Cloud teams
Firefly Image Model 4 与 partner models 同时进入统一平台,Firefly 进一步从“一个生成模型”演变为创意生产操作层。生成能力开始像字体、插件或渲染器一样,被专业软件按任务调用。
阅读原始来源 · Firefly Image Model 4 ↗
研究母版 · p. 38 · #134 · 研究论述待独立核验
在交互时间线打开 ↗2025-05Veo 3:结合声音的视频生成
+
Veo 3
Google DeepMind
Veo 3 将视频与音频生成结合,减少后期拼接不同模型的需求。它使 generative media 的单位从“图像/视频帧”扩大到带声音的完整片段,对影视劳动与权利链产生更直接影响。
研究母版 · p. 34 · #117 · 研究论述待独立核验
在交互时间线打开 ↗2025-05-20Imagen 4:多媒体模型集合
+
Imagen 4
Google DeepMind / Imagen team
Imagen 4 与 Veo 3、Lyria 2 同时发布,显示图像、视频、音频生成已不再是孤立模型,而开始成为同一平台下的多媒体能力集合。
研究母版 · p. 38 · #135 · 研究论述待独立核验
在交互时间线打开 ↗2025-05-29FLUX.1 Kontext:上下文中的生成与编辑
+
FLUX.1 Kontext
Black Forest Labs research team
FLUX.1 Kontext 把经典 text-to-image 扩展为 in-context image generation:输入可以同时包含图像和文字,并在持续编辑中维持角色和场景关系。它代表 reference-native、editing-native 模型取代“纯文生图”成为新主流。
研究母版 · p. 39 · #136 · 研究论述待独立核验
在交互时间线打开 ↗2025-08Gemini 2.5 Flash Image:参考图与连续编辑
+
Gemini 2.5 Flash Image
Google DeepMind / Gemini team
Gemini 2.5 Flash Image 将人物/对象保持、多图组合和 conversational editing 推向更高可靠性。它代表 2025 reference-native generation 的成熟:生成的核心不再只是从零造图,而是基于已有视觉对象持续工作。
阅读原始来源 · Gemini 2.5 Flash Image ↗
研究母版 · p. 39 · #137 · 研究论述待独立核验
在交互时间线打开 ↗2026-04-21ChatGPT Images 2.0 与 GPT-Image-2
+
ChatGPT Images 2.0; GPT-Image-2 API
OpenAI image generation team
ChatGPT Images 2.0 与 GPT-Image-2 把更强 instruction-following、布局、文字与高分辨率输出推向 production workflow。GPT-Image-2 同日进入 API 和 Codex,图像生成继续基础设施化。
阅读原始来源 · ChatGPT Images 2.0; GPT-Image-2 API ↗
研究母版 · p. 39 · #138 · 发布日期已核对,其他论述待核
在交互时间线打开 ↗2026-04-21GPT-Image-2:API 与生产资产
+
GPT-Image-2 / ChatGPT Images 2.0
OpenAI image generation team
GPT Image 2 在 API 与 Codex 中推出,强调复杂视觉任务、布局、文本、指令遵循和最高 2K 的生产用途。它显示生成图像正在从“生成一张漂亮图”转向“生成可直接进入产品和设计系统的资产”。
阅读原始来源 · GPT-Image-2 / ChatGPT Images 2.0 ↗
研究母版 · p. 39 · #139 · 研究论述待独立核验
在交互时间线打开 ↗2026-09-08ChatGPT Images 2.5 与 Flare / Sunburst
+
ChatGPT Images 2.5 / GPT-Image-2.5 Flare & Sunburst
OpenAI image generation team
ChatGPT Images 2.5 强化细节、主体保持、多轮编辑和速度,同时加入 Sketch、Templates 与直接评论图片的编辑方式;API 则提供 GPT-Image-2.5 Flare / Sunburst。它标记 2026 年 image generation 的界面状态:生成、参考、标注、编辑、模板与协作几乎完全合并。
阅读原始来源 · ChatGPT Images 2.5 / GPT-Image-2.5 Flare & Sunburst ↗
研究母版 · p. 40 · #140 · 发布日期已核对,其他论述待核
在交互时间线打开 ↗继续阅读与引用
本页是选题与阅读路径,不是穷尽的历史。引用具体主张时,请同时注明对应条目及原始来源;引用本导读时,注明页面标题、网址和访问日期。
查看全部编年事件 ↗