—AI 艺术史:1943—2026 年的历史线索AI 艺术史不只是一份图像模型的版本表。这条阅读路径把理论、艺术家的工作、展览制度和技术工具放在一起,帮助读者追问:谁制定规则,谁参与创作,作品又如何被展示和解释?研究导读 · ANTI-AI ARCHIVE阅读AI 艺术史:1943—2026 年的历史线索
—为什么从 1943 年开始?1943 年是本研究母版选取的思想背景节点,不是把 AI 艺术的诞生定在这一年。早期神经计算、控制论、计算机艺术与后来的机器学习并不等同;阅读时应保留这些实践之间的差异,不把它们写成必然通向今天生成式 AI 的单线进步史。研究导读 · ANTI-AI ARCHIVE阅读为什么从 1943 年开始?
—如何使用这 224 个节点?先按年代定位,再对照原题、人物和机构、研究说明及原始来源。理论论文能支撑某项方法的提出,展览记录能支撑展示与传播,但两者都不能单独证明一项技术如何影响全部艺术实践。日期精度、来源局限和待核状态随条目保留;右侧时间线与卡片目录联动浏览;点击“阅读”或双击卡片进入独立详情页,查看完整说明、出处与引用。研究导读 · ANTI-AI ARCHIVE阅读如何使用这 224 个节点?
1943神经活动内在观念的逻辑演算Warren McCulloch 与 Walter Pitts 用简化神经元和逻辑演算讨论神经活动如何实现计算。它并不是图像生成论文,但它建立了一种关键想象:感知与认知过程可以被表示为可计算网络。AI 艺术史如果从神经生成模型开始,必须把这一层形式化前史保留下来。历史节点 · McCulloch & Pitts阅读神经活动内在观念的逻辑演算
1948通信的数学理论Shannon 在《A Mathematical Theory of Communication》中建立现代信息论。对这条 Genealogy 而言,关键不是把 Shannon 直接说成“AI 艺术的起点”,而是指出一个新的知识条件:图像、文字与声音都可以在通信系统中作为可编码的信息被处理。后来的数据集、压缩表示、潜空间与生成模型,都发生在这个更广阔的信息化条件之中。历史节点 · Claude Shannon阅读通信的数学理论
1948控制论Wiener 的《Cybernetics: Or Control and Communication in the Animal and the Machine》把通信、反馈与控制放在同一理论框架中。对于 Archive 后来的“control / sovereignty”问题,这一节点尤其重要:文化信息并非只被储存和传输,它也会进入反馈回路,成为调节机器行为与组织权力的资源。历史节点 · Norbert Wiener阅读控制论
1949行为的组织Hebb 的学习理论强调神经连接可因共同活动而改变。虽然它距离生成图像还有很远,但它帮助建立了一个后来极其重要的假设:能力并不一定靠显式规则写入系统,也可以通过经验与连接权重变化习得。历史节点 · Donald Hebb阅读行为的组织
1950计算机器与智能Turing 不再试图先定义“思考”的本体,而以 Imitation Game 将机器智能转化为行为与交互问题。这个操作性转向非常关键:后来 AI 的视觉生成能力同样不是先通过“机器是否具有创造力”获得合法性,而是通过它能否产生、修改和组织视觉对象来被实际评价。历史节点 · Alan Turing阅读计算机器与智能
1952示波图与电子抽象Laposky 用示波器生成电子波形,再通过摄影固定为抽象图像。它发生在数字计算机艺术成熟之前,却已把电信号、数学曲线与视觉构成连接起来,是电子生成美学的重要前史。历史节点 · Ben F. Laposky阅读示波图与电子抽象
1954《美学》与信息美学Bense 在 1954–1960 年间出版四卷《Aesthetica》,1965 年合订扩充,并在 1969 年出版 《Einführung in die informationstheoretische Ästhetik》。他的工作把美学与信息论、统计结构、程序化生产连接起来。这里不是要声称“艺术就是信息”,而是标记一个重要思想转折:形式、秩序、复杂度与审美差异开始进入计算性描述的范围。历史节点 · Max Bense阅读《美学》与信息美学
1956达特茅斯人工智能夏季研究计划Dartmouth 会议并不直接涉及艺术,但它确立了“智能可被机器模拟和研究”的学术共同体框架。后来的计算机视觉、机器学习与生成模型均在这一制度谱系中发展。历史节点 · John McCarthy; Marvin Minsky; Nathaniel Rochester; Claude Shannon and participants阅读达特茅斯人工智能夏季研究计划
1956振荡图与早期电子艺术写作Franke 既制作电子振荡图像,也长期讨论数学、信息和技术如何参与艺术。与 Bense、Nake 等人的信息美学环境一起,他帮助形成德国与奥地利早期计算机艺术的理论与实践网络。历史节点 · Herbert W. Franke阅读振荡图与早期电子艺术写作
1958感知机Rosenblatt 的 perceptron 将模式识别与神经网络学习联系起来。对视觉 AI 史而言,它代表从“规则由程序员全部写入”走向“系统从样本中调整参数”的早期关键步骤。历史节点 · Frank Rosenblatt阅读感知机
1958信息理论与审美知觉Moles 的法文研究后来以《Information Theory and Esthetic Perception》英译出版。他关心艺术对象如何作为“信息消息”被感知、冗余与复杂度如何参与审美经验。它与 Bense 一起构成信息美学最重要的理论背景。历史节点 · Abraham Moles阅读信息理论与审美知觉
1959利用跳棋游戏开展机器学习的若干研究Samuel 的跳棋程序展示机器无需由程序员逐步写明所有策略,也可以通过学习改善表现。这种从显式规则向经验学习的变化,最终会成为现代生成模型与数据驱动视觉系统的基础。历史节点 · Arthur Samuel阅读利用跳棋游戏开展机器学习的若干研究
1960人机共生Licklider 提出 human-computer symbiosis:人与计算机各自承担擅长部分,通过实时交互形成新的认知系统。今天 conversational image generation 与 visual agents 的“协作创作”接口, 可以在这里找到重要的人机交互前史。历史节点 · J. C. R. Licklider阅读人机共生
1961新倾向展览与计算机视觉研究萨格勒布 New Tendencies 从具体/光学艺术逐渐转向“Computers and Visual Research”, 把程序、信息、科学方法和观众知觉置于艺术讨论中心。它是计算机艺术在国际制度层面早期成形的重要平台。历史节点 · Almir Mavignier · Matko Meštrović · international participants阅读新倾向展览与计算机视觉研究
1963Sketchpad:交互式绘图系统Sketchpad 将图形对象、约束和人机交互放进同一个系统,奠定交互式计算机图形的重要传统。它提醒我们:AI 艺术史不只是“模型如何生成图像”,也包括视觉创作界面如何把计算能力转化为艺术实践。历史节点 · Ivan Sutherland阅读Sketchpad:交互式绘图系统
1964人还是机器:蒙德里安构图与计算机图像的主观比较Noll 生成与 Mondrian 构图相似的计算机图像,并通过观看者实验比较审美偏好与作者判断。 它极早地预演了后来围绕“机器模仿风格”“人能否识别 AI 图像”的争论,但技术机制仍是程序生成而非训练数据学习。历史节点 · A. Michael Noll阅读人还是机器:蒙德里安构图与计算机图像的主观比较
1965早期计算机艺术展览1965 年,Georg Nees 在斯图加特展出计算机生成图形;A. Michael Noll 与 Béla Julesz 在纽约 Howard Wise Gallery 展出 computer-generated pictures;Frieder Nake 也成为同年最早公开展示算法艺术的先驱之一。计算机开始不只是工程工具,而被当作形式生产机器进入艺术制度。历史节点 · Georg Nees; Frieder Nake; A. Michael Noll阅读早期计算机艺术展览
1966九个夜晚:戏剧与工程9 Evenings 将艺术家与 Bell Labs 工程师协作组织成大型现场实验,直接促成 E.A.T.。它扩展了计算/控制系统在艺术中的角色,为后来交互艺术、机器行为与实时生成铺路。历史节点 · Billy Klüver; Robert Rauschenberg; John Cage; Lucinda Childs; engineers and artists阅读九个夜晚:戏剧与工程
1966艺术与技术实验协会E.A.T. 由 Billy Klüver、Fred Waldhauer、Robert Rauschenberg、Robert Whitman 等推动,将艺术—工程合作制度化。它不是 AI 艺术组织,但建立了之后数字艺术、媒体艺术和实验技术艺术的重要生产模式。历史节点 · Billy Klüver; Fred Waldhauer; Robert Rauschenberg; Robert Whitman阅读艺术与技术实验协会
1968计算机艺术协会CAS 在英国成立,连接艺术家、设计师、工程师与研究者。它的重要性在于制度化: computer art 不再是零散实验,而开始形成持续的展示、讨论、出版与专业网络。历史节点 · Alan Sutcliffe; George Mallen; John Lansdown阅读计算机艺术协会
1968Cybernetic Serendipity(控制论的偶然性):展览Jasia Reichardt 策划的《Cybernetic Serendipity》集中展示 computer music、computer graphics、machines and environments、computer poems 等实践。它使“计算机与艺术”的问题从实验室进入广泛公共文化语境,也把 Wiener 式 cybernetics 与艺术实践真正并置起来。历史节点 · Jasia Reichardt (curator); participating artists/researchers阅读Cybernetic Serendipity(控制论的偶然性):展览
1968算法绘画与“想象机器”实践Molnár 从手工“machine imaginaire”到真实计算机程序,把规则系统、排列组合和微小随机偏差用于绘画与绘图。她的重要性在于显示生成艺术并不是后来深度学习突然发明的创作范式:艺术家早已把程序、约束与变化本身作为作品生成机制。历史节点 · Vera Molnár阅读算法绘画与“想象机器”实践
1969AARON:以规则编码绘画知识Cohen 在 1960 年代末构思 AARON,1970 年代命名并持续开发。AARON 不是从海量图像中训练,而是把 Cohen 对绘画、表示和构图的知识编码为规则系统。它提供了一个关键对照:machine art 并不必然依赖 scraping、dataset 或风格挪用,因此今天的 anti-AI politics 不能简单等同为“反对机器创作”。历史节点 · Harold Cohen阅读AARON:以规则编码绘画知识
1969计算机绘图与《程序化美学》Mohr 在 1969 年后系统使用计算机和绘图机,1971 年在巴黎 Musée d’Art Moderne de la Ville de Paris 举办重要个展。其工作说明“程序”可以像绘画方法一样成为持续的作者性系统。历史节点 · Manfred Mohr阅读计算机绘图与《程序化美学》
1970《软件》展览:信息技术在艺术中的新意义Jack Burnham 策划的 Software 展览把信息处理、概念系统和交互过程放进艺术机构。它连接系统美学、概念艺术和计算文化,对后来把艺术理解为规则、协议、程序和信息过程非常关键。历史节点 · Jack Burnham (curator); artists and technologists阅读《软件》展览:信息技术在艺术中的新意义
1971洛杉矶郡艺术博物馆“艺术与技术”计划LACMA 的 Art and Technology 项目让艺术家进入企业实验室和工业资源体系。它不是 AI art,但为后来艺术与大型技术公司、研究机构之间的生产关系提供早期制度范式。历史节点 · Maurice Tuchman (curator); participating artists and corporations阅读洛杉矶郡艺术博物馆“艺术与技术”计划
1975分形对象与自然的分形几何Mandelbrot 的分形研究不是 AI,但对生成艺术影响巨大:简单规则能够产生复杂、自相似的视觉世界。分形图像在 1980–90 年代普及,也帮助公众把数学计算与视觉创造直接联系起来。历史节点 · Benoît Mandelbrot阅读分形对象与自然的分形几何
1979林茨电子艺术节Ars Electronica 从 1979 年开始把艺术、技术与社会问题放在同一公共平台上。它后来持续展出人工生命、机器人、数据艺术和 AI 艺术,是 AI art 从实验技术进入文化制度的重要长期基础设施。历史节点 · Hannes Leopoldseder; Hubert Bognermayr; Herbert W. Franke; others阅读林茨电子艺术节
1986Biomorph:生物形态的交互进化Dawkins 的 Biomorph 程序用递归规则和人为选择展示累积进化。它不属于机器学习艺术,但与 Karl Sims、William Latham 的进化艺术共同建立 interactive evolutionary aesthetics:创作者不必直接绘制结果,而是选择生成空间中的后代。历史节点 · Richard Dawkins阅读Biomorph:生物形态的交互进化
1986通过误差反向传播学习表征Backpropagation 让隐藏层可以通过训练形成对任务有用的内部表示。它不是视觉生成技术本身,却是后续深度学习视觉系统的基础机制之一:特征不再完全由人手工定义,而是在训练过程中形成。历史节点 · Rumelhart, Hinton & Williams阅读通过误差反向传播学习表征
1987Boids:群体运动的局部规则Boids 用分离、对齐、聚合等局部规则模拟群体运动。它对动画、人工生命与生成艺术影响深远,说明视觉复杂性可以来自分布式规则而不是中央设计。历史节点 · Craig Reynolds阅读Boids:群体运动的局部规则
1988FormGrow 与 Mutator 进化系统Latham 与 Todd 在 IBM UK 等环境中开发基于进化的三维形态生成系统。其方法将艺术创作从直接塑形转变为定义生成规则和挑选变异结果,是今天 latent exploration 与 variation workflow 的重要历史类比。历史节点 · William Latham; Stephen Todd阅读FormGrow 与 Mutator 进化系统
1991计算机图形中的人工进化Karl Sims 用遗传算法和交互式选择生成复杂图像、纹理和动画。这里已经出现后来生成式系统非常熟悉的结构:机器批量产生候选,用户通过选择引导下一轮结果。它把“审美判断”嵌入生成回路,而不是只放在作品完成之后。历史节点 · Karl Sims阅读计算机图形中的人工进化
1994进化的虚拟生物Sims 不仅生成图像,也让虚拟生物的身体结构和控制网络共同进化。这将生成艺术扩展到动态行为与人工生命,对之后游戏、simulation art 和 embodied generative systems 有长期影响。历史节点 · Karl Sims阅读进化的虚拟生物
1995基于金字塔的纹理分析与参数化纹理模型这些纹理合成方法尝试通过多尺度滤波响应与统计约束重建纹理外观。Gatys 的 neural style transfer 后来将深层网络特征统计用于 style representation,因此这一纹理统计传统是不可忽略的技术祖先。历史节点 · David Heeger; James Bergen; Javier Portilla; Eero Simoncelli阅读基于金字塔的纹理分析与参数化纹理模型
1998基于梯度学习的文档识别LeNet-5 及相关工作把卷积、共享权重、梯度训练整合为稳定视觉架构。后来的 AlexNet、生成模型中的卷积编码器和视觉特征提取都承接这一传统。历史节点 · LeCun et al.阅读基于梯度学习的文档识别
2001用于纹理合成与迁移的图像拼缝Image Quilting 从样本纹理中选择并拼接图像块生成更大纹理,还展示 texture transfer。它不是深度学习,却代表了“从现成图像材料学习和重组视觉外观”的重要前神经路线。历史节点 · Alexei A. Efros; William T. Freeman阅读用于纹理合成与迁移的图像拼缝
2001Processing:创意编程环境Processing 把绘图、交互与程序结构变成易学的 creative coding 环境。它不属于 AI,但建立了 2000 年代最重要的生成艺术创作基础设施之一,并培养了后来接受 notebook、node workflow、 prompt scripting 的创作者文化。历史节点 · Casey Reas; Ben Fry阅读Processing:创意编程环境
2006深度信念网络的快速学习算法这篇工作是 2000 年代深度学习复兴的重要节点之一。它帮助重新确立多层表示学习的研究势头,为几年后的大规模视觉深度学习创造条件。历史节点 · Hinton, Osindero & Teh阅读深度信念网络的快速学习算法
2006The Painting Fool:计算创造力项目The Painting Fool 是长期 computational creativity 项目,强调系统应当拥有一定创作决策和过程叙事。它连接 symbolic/computational creativity 与后来数据驱动生成模型之间的文化讨论。历史节点 · Simon Colton阅读The Painting Fool:计算创造力项目
2009ImageNet:大规模层级图像数据库ImageNet 将 WordNet 的语义层级与数百万图像连接,并使用众包完成标注。它代表 AI 视觉史最重要的 Dataset Turn:文化与日常图像不再只是被观看,而被组织成机器可学习、可比较、可扩展的训练资源。历史节点 · Jia Deng; Wei Dong; Richard Socher; Li-Jia Li; Kai Li; Li Fei-Fei阅读ImageNet:大规模层级图像数据库
2010ImageNet 大规模视觉识别挑战赛ILSVRC 将 ImageNet 子集标准化为年度视觉识别竞赛。数据不只是训练材料,也成为可比较研究进步的度量体系;2012 AlexNet 的突破正是在这一制度结构中被确认和放大。历史节点 · ImageNet team; international computer vision community阅读ImageNet 大规模视觉识别挑战赛
2012AlexNet:深度卷积图像分类AlexNet 在 ImageNet 分类上大幅领先传统方法,使深度卷积网络成为计算机视觉主流。它把 Dataset Turn 推向能力生产:训练语料的规模、GPU 计算与 learned representation 开始形成一个强耦合系统。历史节点 · Krizhevsky, Sutskever & Hinton阅读AlexNet:深度卷积图像分类
2013自编码变分贝叶斯VAE 建立可微分的潜变量生成框架。对 AI 艺术史最重要的遗产是“latent space”逐渐从统计模型术语变成视觉生成文化中的核心概念:图像可以被压缩成潜在表示,并从该空间重新采样和重构。历史节点 · Kingma & Welling阅读自编码变分贝叶斯
2014生成对抗网络GAN 把图像生成带入数据驱动的分布学习时代。与 AARON 等规则系统相比,生成逻辑不再主要由艺术家显式编码,而是从训练数据中学习。这个范式改变了“机器图像”的本体:输出开始被理解为某个数据分布的样本。历史节点 · Goodfellow et al.阅读生成对抗网络
2014条件生成对抗网络Conditional GAN 将额外条件输入生成器和判别器,为“可控生成”提供通用框架。后来的 class-conditioned synthesis、text-to-image GAN 与各种结构条件生成都承接这一思路。历史节点 · Mehdi Mirza; Simon Osindero阅读条件生成对抗网络
2015LAPGAN:拉普拉斯金字塔生成网络LAPGAN 通过 Laplacian pyramid 在多个尺度生成细节。它是 Progressive GAN 之前的重要高分辨率生成尝试,也说明“逐层/逐尺度”一直是图像生成质量扩展的核心问题。历史节点 · Emily Denton; Soumith Chintala; Arthur Szlam; Rob Fergus阅读LAPGAN:拉普拉斯金字塔生成网络
2015艺术风格的神经算法Neural Style Transfer 用深层卷积特征表示内容,并用统计特征描述“style”,随后重新合成图像。它不能证明艺术风格本体上就是这些统计量,但它在文化上确立了极具影响力的想象:style 可以被提取、计算和转移。From Style to Sovereignty 的技术前史在这里第一次变得非常直观。历史节点 · Gatys, Ecker & Bethge阅读艺术风格的神经算法
2015DeepDream:神经网络的可视化DeepDream 通过放大网络内部激活让模型“看见”的模式显形。它不是现代文生图,但它让公众第一次大规模接触一种明显来自神经网络内部表征的视觉风格,并迅速进入艺术家、媒体和网络文化。历史节点 · Alexander Mordvintsev; Christopher Olah; Mike Tyka / Google阅读DeepDream:神经网络的可视化
2015DRAW:注意机制与迭代画布DRAW 结合 VAE、RNN 与可微注意机制,让模型通过多步“读/写”画布生成图像。虽然没有成为后来主流产品架构,它展示了 iterative image generation 与 attention 的早期结合。历史节点 · Karol Gregor; Ivo Danihelka; Alex Graves; Danilo Rezende; Daan Wierstra阅读DRAW:注意机制与迭代画布
2015DCGAN:深度卷积生成对抗网络DCGAN 建立后来大量视觉 GAN 的标准架构实践,并显示潜变量方向可以对应语义变化。它使 latent manipulation 更接近后来的艺术工作流。历史节点 · Radford, Metz & Chintala阅读DCGAN:深度卷积生成对抗网络
2016pix2pix:配对图像转换pix2pix 用配对图像训练从 label map、edge map、sketch 等输入生成目标图像。它把生成模型从“从噪声生成”推进到“根据结构条件转换”,为后来编辑、重绘与结构控制留下清晰技术谱系。历史节点 · Isola et al.阅读pix2pix:配对图像转换
2016Prisma:移动端风格迁移Prisma 等应用把 neural style transfer 变成普通用户可直接使用的视觉界面。这一步的历史意义不是算法创新,而是把“风格作为可调用效果”变成大众日常经验。历史节点 · Prisma Labs阅读Prisma:移动端风格迁移
2016StackGAN:堆叠生成对抗网络的文本生成图像StackGAN 用两阶段生成把文本描述转为低分辨率结构,再细化为更高分辨率图像。它是 DALL·E/Imagen 前 text-to-image 研究的重要主干,说明 prompt-driven image generation 在 diffusion 之前已有连续技术谱系。历史节点 · Han Zhang; Tao Xu; Hongsheng Li; Shaoting Zhang; Xiaogang Wang; Xiaolei Huang; Dimitris Metaxas阅读StackGAN:堆叠生成对抗网络的文本生成图像
2017生成对抗网络的渐进式增长Progressive GAN 逐层增加分辨率,提高训练稳定性和细节质量。它使高分辨率合成人像在公众文化中具有巨大冲击力,并直接通向 StyleGAN。历史节点 · Karras et al.阅读生成对抗网络的渐进式增长
2017Attention Is All You Need(注意力机制即你所需)Transformer 最初是序列建模架构,并非图像生成论文;但后来的 CLIP、DALL·E、DiT、 MMDiT 和原生多模态模型都直接或间接建立在 attention/Transformer 范式上。因此它必须出现在完整 Genealogy 中。历史节点 · Vaswani et al.阅读Attention Is All You Need(注意力机制即你所需)
2017CycleGAN:非配对图像转换CycleGAN 用 cycle consistency 解决 unpaired image translation,使季节转换、绘画域转换、对象变形等任务大幅扩展。它推动“视觉 domain / style 可被统计地学习并转换”的观念。历史节点 · Zhu et al.阅读CycleGAN:非配对图像转换
2017神经离散表征学习:VQ-VAEVQ-VAE 学习离散 codebook,将高维输入压缩成可组合的离散表示。DALL·E、VQGAN 与多种 autoregressive image model 都继承了“视觉 token”思路。历史节点 · Aaron van den Oord; Oriol Vinyals; Koray Kavukcuoglu阅读神经离散表征学习:VQ-VAE
2017AttnGAN:注意力驱动的细粒度文本生成图像AttnGAN 用 word-region attention 与 DAMSM 对齐文字和视觉区域,提高复杂文本描述的细节生成。它是现代 prompt adherence 与 cross-modal alignment 的重要前 diffusion 节点。历史节点 · Tao Xu; Pengchuan Zhang; Qiuyuan Huang; Han Zhang; Zhe Gan; Xiaolei Huang; Xiaodong He阅读AttnGAN:注意力驱动的细粒度文本生成图像
2018BigGAN:规模化条件图像生成BigGAN 将 GAN 训练扩展到大规模 ImageNet 条件生成,显著提高保真度。它强化了一个后来 foundation-model 时代反复出现的经验:模型、数据和计算规模本身可以成为生成质量的重要来源。历史节点 · Brock, Donahue & Simonyan阅读BigGAN:规模化条件图像生成
2018StyleGAN:基于风格的生成架构StyleGAN 引入 mapping network 与 style-based generator,对不同尺度视觉属性进行更直观的控制。它把“latent space 中存在可导航视觉属性”这一观念推向广泛文化影响,也推动人脸生成、latent editing 与 AI 肖像实践。历史节点 · Karras, Laine & Aila阅读StyleGAN:基于风格的生成架构
2018Ganbreeder 与 Artbreeder:潜在空间的社交创作Joel Simon 的 Ganbreeder 后发展为 Artbreeder,把 GAN latent space 变成可浏览、混合、 继承和社交分享的创作界面。它是 prompt culture 之前重要的“latent culture”节点。历史节点 · Joel Simon; Artbreeder community阅读Ganbreeder 与 Artbreeder:潜在空间的社交创作
2018《埃德蒙·德·贝拉米肖像》拍卖Christie’s 以 432,500 美元成交《Edmond de Belamy》,使 GAN art 成为全球媒体议题, 同时也引发代码来源、作者性和技术劳动归属争论。AI art 的价值链开始明显涉及模型、代码、艺术品牌与市场制度。历史节点 · Obvious (Hugo Caselles-Dupré; Pierre Fautrel; Gauthier Vernier); Robbie Barrat lineage controversy阅读《埃德蒙·德·贝拉米肖像》拍卖
2019《AI:不止于人类》展览Barbican 的大型展览把历史 automata、机器学习、机器人和当代 AI 艺术放入同一叙事空间。AI art 在 2019 前后已形成稳定的机构展示对象,为 2022 后的争议提供制度前史。历史节点 · Barbican curatorial team; international artists/researchers阅读《AI:不止于人类》展览
2019《过路人的记忆 I》Klingemann 将神经生成系统作为持续运行的装置出售,使“作品”从一张 AI 图像转向生成机器本身及其无穷输出。它对 AI art 的 objecthood、收藏与作者性提出更复杂问题。历史节点 · Mario Klingemann阅读《过路人的记忆 I》
2019VQ-VAE-2:多样且高保真的图像生成VQ-VAE-2 使用层级离散潜变量和 autoregressive priors 达到当时很高的图像质量,为 DALL·E 等将视觉表示 token 化的大模型路径提供重要技术背景。历史节点 · Ali Razavi; Aaron van den Oord; Oriol Vinyals阅读VQ-VAE-2:多样且高保真的图像生成
2019SPADE 与 GauGAN:语义布局生成图像SPADE 将 semantic layout 转换为高质量图像,NVIDIA 以 GauGAN 演示其交互创作潜力。它预示后来 ControlNet、布局控制和设计型生成工具的发展。历史节点 · Taesung Park; Ming-Yu Liu; Ting-Chun Wang; Jun-Yan Zhu / NVIDIA阅读SPADE 与 GauGAN:语义布局生成图像
2019StyleGAN2:分析并改进生成图像质量StyleGAN2 修正 StyleGAN 的特征伪影,并改进 latent-to-image mapping。它强化了 inversion、编辑与属性操控,使“生成—反演—编辑”的完整工作流变得更成熟。历史节点 · Tero Karras; Samuli Laine; Miika Aittala; Janne Hellsten; Jaakko Lehtinen; Timo Aila阅读StyleGAN2:分析并改进生成图像质量
2020去噪扩散概率模型DDPM 证明 diffusion probabilistic models 可以达到高质量图像合成。与 GAN 的一次性生成不同,diffusion 把图像构造为逐步反演噪声的过程;这一范式随后成为 2022 以后文生图的主流基础。历史节点 · Ho, Jain & Abbeel阅读去噪扩散概率模型
2020驯服 Transformer:VQGANVQGAN 将卷积编码器的局部视觉能力与 Transformer 的全局建模结合,形成高质量离散视觉表示。它直接影响了早期 VQGAN+CLIP 艺术文化,也为 latent-space generative models 提供重要技术经验。历史节点 · Esser, Rombach & Ommer阅读驯服 Transformer:VQGAN
2020Jukebox:音乐生成模型Jukebox 用层级 VQ-VAE 与 autoregressive priors 生成音乐和粗略人声。它不是后来的文本音乐平台,但显示“从大规模文化录音中学习生成能力”已成为跨媒体范式。历史节点 · Prafulla Dhariwal et al.; OpenAI阅读Jukebox:音乐生成模型
2020语言模型是少样本学习者:GPT-3GPT-3 不是图像模型,但它把 prompt 从普通输入文本提升为通用任务编程接口。DALL·E 3、ChatGPT 图像生成和 conversational editing 的文化逻辑,都建立在“自然语言作为模型控制层”这一更广泛变化上。历史节点 · Tom B. Brown et al.; OpenAI阅读语言模型是少样本学习者:GPT-3
2021Botto:社区投票与持续生成Botto 通过生成候选图像、社区投票和拍卖形成持续创作回路。它把生成模型、collective taste、token governance 和艺术市场合并,为“机器作者性”和平台化文化生产提供重要案例。历史节点 · Mario Klingemann; Botto community阅读Botto:社区投票与持续生成
2021VQGAN+CLIP:社区工作流社区把 VQGAN 的视觉生成与 CLIP 的文本—图像相似度结合,用文字引导生成过程。它并非单篇 canonical paper,而是一种高度重要的实践组合:prompt recipe、艺术家姓名、seed、notebook 和迭代参数开始成为创作语言。历史节点 · Community practitioners; Katherine Crowson and open-source notebook ecosystem阅读VQGAN+CLIP:社区工作流
2021CLIP 首次公布自然语言监督建立了图像与文字共享的表示空间,随后被社区创作工作流用作控制信号。这一节点记录 CLIP 的首次公布,与后续论文发表分开。历史节点 · OpenAI阅读CLIP 首次公布
2021DALL·E 首次公布在扩散模型流行之前,大规模文本生成图像已通过 DALL·E 成为公众可辨认的研究与产品方向。此处记录首次公布,论文发表另列节点。历史节点 · OpenAI阅读DALL·E 首次公布
2021零样本文本生成图像:DALL·EDALL·E 用 autoregressive Transformer 统一建模文字与图像 token,并展示广泛 zero-shot 组合能力。它把“输入一句话生成新图像”从研究演示推进为公众可理解的新型生成范式。历史节点 · Aditya Ramesh; Mikhail Pavlov; Gabriel Goh; Scott Gray; Chelsea Voss et al. / OpenAI阅读零样本文本生成图像:DALL·E
2021从自然语言监督中学习可迁移视觉模型:CLIPCLIP 从互联网图文对学习图像—文本对齐,使自然语言能够零样本地指向视觉概念。它成为 VQGAN+CLIP、Disco Diffusion 等早期 prompt-driven image art 的核心条件,也把 web-scale image-text data 推到生成文化中心。历史节点 · Alec Radford et al. / OpenAI阅读从自然语言监督中学习可迁移视觉模型:CLIP
2021扩散模型超越生成对抗网络这项工作通过改进架构与 classifier guidance 让 diffusion 在 ImageNet 合成上超过当时主流 GAN。它标志 GAN 时代向 diffusion 时代的技术转折。历史节点 · Dhariwal & Nichol阅读扩散模型超越生成对抗网络
2021Disco Diffusion:可复用的生成笔记本Disco Diffusion 从 2021 年 10 月起快速迭代,将 diffusion、CLIP guidance、cutouts、图像提示和动画参数整合为可复用 Colab 工作流。它在论文史中不一定是最基础的发明,但在 AI 艺术史中是决定性的文化节点:prompt engineering 被大量用户直接当作艺术实践。历史节点 · Somnai; Gandamu; Disco Diffusion contributors/community阅读Disco Diffusion:可复用的生成笔记本
2021GLIDE:文本引导的图像生成与编辑GLIDE 比较 CLIP guidance 与 classifier-free guidance,并展示 photorealistic text-to-image 与 inpainting。它是 DALL·E 2 和后来主流 diffusion 文生图的重要前置节点。历史节点 · Alex Nichol; Prafulla Dhariwal et al. / OpenAI阅读GLIDE:文本引导的图像生成与编辑
2021潜在扩散模型Latent Diffusion Models 在预训练 autoencoder 的潜空间进行 diffusion,并通过 cross- attention 接收文本等条件。它显著降低计算成本,是 Stable Diffusion 的直接技术基础,也是开放文生图生态真正可以跑到消费级 GPU 的关键原因之一。历史节点 · Rombach et al.阅读潜在扩散模型
2022LAION-5B:大规模图文数据集LAION-5B 公开大规模 image-text pair 索引和过滤方法,成为 Stable Diffusion 等开放生态的重要数据背景。它也是 2022 以后版权、训练数据、艺术家姓名与数据来源争议无法绕开的技术节点: 数据集本身从工程基础设施变成政治对象。历史节点 · Christoph Schuhmann et al. / LAION阅读LAION-5B:大规模图文数据集
2022DALL·E 2:结合 CLIP 潜变量的分层图像生成DALL·E 2 将 diffusion-based image prior/decoder 与 CLIP 表示结合,显著提升逼真度和文本一致性。2022 年逐步扩展研究预览、beta 和无候补名单访问,使文生图第一次成为全球大众产品。历史节点 · Aditya Ramesh; Prafulla Dhariwal; Alex Nichol; Casey Chu / OpenAI阅读DALL·E 2:结合 CLIP 潜变量的分层图像生成
2022Civitai:社区模型流通平台Civitai 等平台把 Stable Diffusion 生态中的微调模型与配置变成可流通的文化对象。生成能力从单一 foundation model 分裂成庞大的社区模型市场,也让 provenance、风格复制、人物模型与 consent 问题更复杂。历史节点 · Civitai founders/team and model-sharing community阅读Civitai:社区模型流通平台
2022LoRA:低秩适配与扩散社区应用LoRA 原论文发表于 2021 年,通过冻结主模型、训练低秩增量矩阵降低微调成本。Stable Diffusion 社群在 2022–23 年迅速把它变成 style、character、clothing、pose、celebrity 等小型可交换适配器。这里发生了关键文化转变:风格和身份不再只是 prompt 里的名字,也可以被打包为一个轻量模型文件流通。历史节点 · Edward Hu et al. (LoRA); Stable Diffusion open-source community阅读LoRA:低秩适配与扩散社区应用
2022Midjourney V1 默认模型时期早期 Midjourney 形成了鲜明的绘画性视觉风格,并以 Discord 为主要入口建立社群创作循环。这里的月份标记默认模型时期,不等同于精确发布日。历史节点 · Midjourney阅读Midjourney V1 默认模型时期
2022Midjourney V2Midjourney 开始按月或季度快速迭代模型,预示了生成式视觉产品此后密集更新的节奏。该节点记录 V2 所代表的版本更替。历史节点 · Midjourney阅读Midjourney V2
2022Imagen:深层语言理解与逼真图像生成Imagen 使用大型文本编码器和 diffusion decoder,研究显示扩大 language model 对 image-text alignment 的收益尤其明显。它强化了一个后来被 GPT-native image generation 继续推进的方向:更强语言理解会改变视觉生成能力。历史节点 · Chitwan Saharia et al. / Google Research阅读Imagen:深层语言理解与逼真图像生成
2022DALL·E 2 扩大研究预览OpenAI 开始每周从候补名单中增加至多一千名使用者,模型评估由有限研究预览转向更大规模的用户测试。这与后续收费测试和取消候补名单是不同阶段。历史节点 · OpenAI阅读DALL·E 2 扩大研究预览
2022Parti:扩展自回归模型以生成丰富图像Parti 探索与 diffusion 并行的 autoregressive 路线,把图像 token 当作另一种“语言”生成。它说明 2022 年文生图爆发并非只有 diffusion 一条技术道路。历史节点 · Jiahui Yu et al. / Google Research阅读Parti:扩展自回归模型以生成丰富图像
2022Diffusers:模块化扩散工具库Diffusers 把 schedulers、pipelines、model components 和训练脚本模块化,显著降低 diffusion model 的部署和二次开发门槛。它是研究模型快速变成生态系统的重要中间层。历史节点 · Hugging Face Diffusers team阅读Diffusers:模块化扩散工具库
2022Midjourney:开放测试与 Discord 社区Midjourney 的历史意义不仅是模型质量。Discord 界面让用户实时看到他人的 prompt 与结果,形成极高密度的社会学习、风格扩散和 prompt imitation。文生图由“个人工具”转为公共视觉文化。历史节点 · David Holz; Midjourney team/community阅读Midjourney:开放测试与 Discord 社区
2022DALL·E 2:收费测试版DALL·E 2 引入商业化访问和计费机制,图像生成从研究预览进一步转为面向消费者的创意服务。此节点记录测试版,不与取消候补名单混同。历史节点 · OpenAI阅读DALL·E 2:收费测试版
2022AUTOMATIC1111:Stable Diffusion 网页界面WebUI 将 txt2img、img2img、inpainting、sampler、extensions 和后来的 LoRA/ControlNet 集成进统一界面。开放权重真正转化为大规模创作者工具,离不开这类社区软件层。历史节点 · AUTOMATIC1111 and open-source contributors阅读AUTOMATIC1111:Stable Diffusion 网页界面
2022An Image is Worth One Word(一图抵一词):文本反演与个性化生成Textual Inversion 学习新的 text embedding,而不重训整个模型。它极其适合这条 Genealogy:视觉概念、对象甚至 style 可以被映射为一个可组合的新“词”。注意:这不是说 style 本体就是 token,而是模型中一种有效的个性化表示方法。历史节点 · Rinon Gal; Yuval Alaluf; Yuval Atzmon; Or Patashnik; Amit Bermano; Gal Chechik; Daniel Cohen-Or阅读An Image is Worth One Word(一图抵一词):文本反演与个性化生成
2022Stable Diffusion:公开模型权重Stable Diffusion 基于 Latent Diffusion 路线并公开模型权重。其真正的历史断裂在于 access model:用户不再只能调用公司 API,而可以下载、fine-tune、fork、组合和本地部署。随后 LoRA、 ControlNet、Civitai、ComfyUI 等完整生态由此爆发。历史节点 · Robin Rombach; Patrick Esser; CompVis; Stability AI; Runway collaborators阅读Stable Diffusion:公开模型权重
2022DreamBooth:面向特定主体的扩散模型微调DreamBooth 通过少量 subject images fine-tune pretrained text-to-image model,把唯一 identifier 与具体主体绑定。它把 identity preservation 直接引入生成系统,也为后来的 celebrity / character / product customization 和 likeness 争议提供技术前史。历史节点 · Nataniel Ruiz; Yuanzhen Li; Varun Jampani; Yael Pritch; Michael Rubinstein; Kfir Aberman阅读DreamBooth:面向特定主体的扩散模型微调
2022DALL·E 2:画面扩展Outpainting 将生成图像延伸到原有边框以外,使 AI 作为编辑与扩展工具进入创作流程。它与仅从文字生成一张新图像的操作有所区别。历史节点 · OpenAI阅读DALL·E 2:画面扩展
2022《太空歌剧院》:艺术竞赛争议Jason Allen 使用 Midjourney 创作并后期处理作品后参赛获奖。事件成为 2022 “Political Turn”的文化标志之一:争论从技术展示转向艺术劳动、规则披露、作者身份与竞争公平。历史节点 · Jason M. Allen; Midjourney阅读《太空歌剧院》:艺术竞赛争议
2022DALL·E 2 取消候补名单DALL·E 2 取消候补名单,使高质量图像生成由邀请制转向更广泛的公开使用。这是访问方式的变化,与模型本身的首次公布分开记录。历史节点 · OpenAI阅读DALL·E 2 取消候补名单
2022Make-A-VideoMeta 公布文本生成视频研究。在文生图走向大规模使用后的数月内,生成式运动影像成为更显著的研究方向,扩展了视觉生成的时间维度。历史节点 · Meta阅读Make-A-Video
2022《无监督》:博物馆藏品与生成装置Unsupervised 使用 MoMA collection data 训练/驱动生成视觉系统,并以实时大型屏幕呈现。作品同时让 dataset、museum collection 和生成模型之间的关系变成可见的艺术材料。历史节点 · Refik Anadol Studio; MoMA阅读《无监督》:博物馆藏品与生成装置
2022InstructPix2Pix:遵循图像编辑指令InstructPix2Pix 利用 GPT-3 与 Stable Diffusion 合成训练数据,再训练 instruction-conditioned diffusion model。它把生成系统从“一次性造图”推进到“对已有图像进行语言驱动修改”的交互范式。历史节点 · Tim Brooks; Aleksander Holynski; Alexei A. Efros阅读InstructPix2Pix:遵循图像编辑指令
2022Midjourney V4V4 引入新的架构,改善图像连贯性和视觉表现。它展示了封闭模型快速迭代的节奏,也使版本差异成为理解生成图像风格的一个背景。历史节点 · Midjourney阅读Midjourney V4
2022DALL·E API 公开测试图像生成通过 API 成为第三方产品可以调用的基础设施。这个节点记录开发者接入方式的改变,而非 DALL·E 2 模型的再次发布。历史节点 · OpenAI阅读DALL·E API 公开测试
2022Stable Diffusion 2.0新版本采用 OpenCLIP 文本编码器、调整训练数据子集,并支持更高分辨率。母版以此讨论模型和数据的变化如何迅速改变视觉风格及提示词的使用方式。历史节点 · Stability AI阅读Stable Diffusion 2.0
2022Canva 文本生成图像工具Canva 把文本生成图像嵌入日常设计流程,体现主流设计平台对生成技术的吸收。母版将这一阶段作为后续 Magic Media 的前身记录。历史节点 · Canva阅读Canva 文本生成图像工具
2022Stable Diffusion 2.1在 2.0 发布后数周,Stability AI 再次调整数据过滤与提示词响应。母版以此说明,视觉生成模型的更新周期已可以按周计算。历史节点 · Stability AI阅读Stable Diffusion 2.1
2023ComfyUI:节点式生成工作流ComfyUI 把 Stable Diffusion 工作流显式化为 graph。它的历史意义是把 generation 变成 production pipeline:用户不再只写 prompt,而是在可视化系统里编排模型与控制模块。AI 图像创作由“模型使用”走向“系统设计”。历史节点 · ComfyAnonymous and open-source contributors阅读ComfyUI:节点式生成工作流
2023AnimateDiff:为个性化图像模型增加运动AnimateDiff 将运动建模作为可插拔模块引入 personalized text-to-image diffusion ecosystem。它的重要性在于保持原有角色、风格和社区模型资产,同时把静态生成扩展到视频。历史节点 · Yuwei Guo et al.阅读AnimateDiff:为个性化图像模型增加运动
2023ControlNet:为文本生成图像增加条件控制ControlNet 冻结 pretrained diffusion backbone,通过附加网络学习空间条件。它把 text-to-image 从语义控制推进到几何与构图控制,是 AI 生产工作流真正专业化的转折点之一。历史节点 · Lvmin Zhang; Anyi Rao; Maneesh Agrawala阅读ControlNet:为文本生成图像增加条件控制
2023T2I-Adapter:轻量适配器与精细控制T2I-Adapter 与 ControlNet 同期代表一个决定性趋势:基础模型无需完全重训,就可以通过模块化附件获得精细外部控制。AI 图像生产因此变成 base model + adapters 的组合系统。历史节点 · Chong Mou; Xintao Wang; Liangbin Xie; Yanze Wu; Jian Zhang; Zhongang Qi; Ying Shan; Xiaohu Qie阅读T2I-Adapter:轻量适配器与精细控制
2023Runway Gen-1Gen-1 通过文字提示或图像参照,把风格与构图施加于已有视频。视频到视频的操作使生成技术进一步进入以原始素材为基础的影视工作流。历史节点 · Runway阅读Runway Gen-1
2023Canva Magic Design 与视觉套件扩展Canva 将生成式 AI 从图像制作扩展到自动排版、品牌模板和视觉传播流程。该节点强调平台工作流的变化,与单一图像模型更新分开记录。历史节点 · Canva阅读Canva Magic Design 与视觉套件扩展
2023Midjourney V5V5 改善摄影式图像的真实感,使 Midjourney 成为封闭图像生成模型中一个重要的视觉参照。母版将其放在快速版本迭代的脉络中讨论。历史节点 · Midjourney阅读Midjourney V5
2023Adobe Firefly 与生成式填充Firefly 的意义不仅是 Adobe 也做文生图,而是 GenAI 进入成熟创意软件基础设施。Adobe 从发布之初就把训练来源、创作者补偿、Do Not Train 和 Content Credentials 与模型产品绑定,生成技术第一次以大型创意产业标准化治理方案进入设计师日常。历史节点 · Adobe Firefly / Adobe Research and Creative Cloud teams阅读Adobe Firefly 与生成式填充
2023Bing Image Creator微软把基于 DALL·E 的图像生成嵌入搜索、聊天和 Edge 浏览器。生成图像因此成为通用信息入口的一部分,而不只存在于专门的创作工具中。历史节点 · Microsoft阅读Bing Image Creator
2023Niji 5Midjourney 与 Spellbrush 面向动画风格推出专门模型。母版将其视为风格专门化从非正式微调实践转向主流产品策略的一个节点。历史节点 · Midjourney / Spellbrush阅读Niji 5
2023SDXL 测试版SDXL 测试版面向 API 客户和 DreamStudio 用户开放,强调构图及照片真实感的改善。此处记录测试访问阶段,与后续 1.0 发布区分。历史节点 · Stability AI阅读SDXL 测试版
2023DragGAN:基于拖动点的图像编辑DragGAN 利用 GAN feature space 实现 point-based manipulation,展示“直接操纵生成流形”的编辑范式。虽然 diffusion 很快成为主流,这种 direct manipulation 继续影响后来的生成式编辑界面。历史节点 · Xingang Pan et al.; Max Planck Institute for Informatics / Saarland research team阅读DragGAN:基于拖动点的图像编辑
2023Photoshop 测试版生成式填充生成式填充把基于扩散模型的生成能力引入专业栅格图像编辑软件。创作者可在已有图像中局部操作,生成因此成为编辑流程的一层。历史节点 · Adobe阅读Photoshop 测试版生成式填充
2023Midjourney V5.1V5 发布数周后,V5.1 改善自然语言提示的使用和默认视觉表现。连续版本更新显示了封闭图像模型快速调整创作体验的方式。历史节点 · Midjourney阅读Midjourney V5.1
2023Runway Gen-2:多模态视频生成Runway Gen-2 支持文本、图像等条件生成短视频,是 2023 生成视频产品化的重要节点。它把创作者的关注从单张构图扩展到运动、摄影机、时间一致性和影视生产。历史节点 · Runway阅读Runway Gen-2:多模态视频生成
2023Midjourney V5.2V5.2 改善细节、构图与风格化控制,继续完善 V5 系列。这个节点关注同一模型家族内的操作能力变化,而非新产品类别的出现。历史节点 · Midjourney阅读Midjourney V5.2
2023CM3leonMeta 的 CM3leon 以基于 token 的多模态 Transformer 同时处理图像生成和图像转文字。母版将其作为多项视觉任务汇入同一基础模型的研究节点。历史节点 · RESEARCH MODEL阅读CM3leon
2023SDXL:高分辨率潜在扩散模型SDXL 提高构图、细节、风格和分辨率表现,并继续保持开放模型可微调、可组合的特征。它是 Stable Diffusion 生态从实验性爆发进入成熟生产阶段的重要节点。历史节点 · Robin Rombach; Stability AI research team and collaborators阅读SDXL:高分辨率潜在扩散模型
2023IP-Adapter:图像提示适配器IP-Adapter 通过 decoupled cross-attention 为 pretrained diffusion 增加 lightweight image-prompt capability。它让参考图控制与 text prompt、ControlNet 共存,为今天广泛的 reference-driven portrait、fashion 和 identity workflows 奠定关键基础。历史节点 · Hu Ye; Jun Zhang; Sibo Liu; Xiao Han; Wei Yang / Tencent AI Lab阅读IP-Adapter:图像提示适配器
2023Ideogram:图像中的文字Ideogram 因较强的 in-image text rendering 获得关注。它显示 text-to-image 不再只竞争“漂亮图”,而进入文字、版式、标志与商业图形等设计任务。历史节点 · Ideogram team阅读Ideogram:图像中的文字
2023PixArt-α:高效扩散 TransformerPixArt-α 将 diffusion transformer、预训练文本编码器和训练效率作为核心问题,成为 2024 DiT/flow image model 浪潮的重要开放研究节点。历史节点 · Junsong Chen et al.阅读PixArt-α:高效扩散 Transformer
2023DALL·E 3 与 ChatGPT 集成DALL·E 3 与 ChatGPT 集成,使用户可以用自然语言讨论想法、要求修改,再由语言模型组织图像提示。这个节点改变了交互逻辑:用户不再必须掌握模型特有的 prompt 语法,生成界面开始从 prompt box 转向 conversation。历史节点 · OpenAI image generation team; ChatGPT product team阅读DALL·E 3 与 ChatGPT 集成
2023DALL·E 3 公布DALL·E 3 强调提示遵循和图像中文字的表现,并通过语言模型协助组织提示。这个节点记录公布阶段,ChatGPT 内实际开放使用另有节点。历史节点 · OpenAI阅读DALL·E 3 公布
2023潜在一致性模型:少步图像生成LCM 通过 consistency distillation 在 latent space 实现 2–4 步高质量生成。速度提升改变的是接口可能性:当生成接近实时,AI 图像更容易进入绘画、设计、直播和交互软件。历史节点 · Simian Luo et al.阅读潜在一致性模型:少步图像生成
2023Firefly Image 2、矢量与设计模型Adobe 把生成能力从栅格图像扩展到矢量图形和可编辑设计模板。多个模型同时进入创意软件体系,扩大了生成技术所覆盖的设计对象。历史节点 · Adobe阅读Firefly Image 2、矢量与设计模型
2023Pika 1.0:视频生成与修改Pika 将 text-to-video、image-to-video 和视频修改包装为低门槛创作工具。它与 Runway 一起使生成视频从研究和专业试验走向大众产品市场。历史节点 · Pika Labs阅读Pika 1.0:视频生成与修改
2023Stable Video Diffusion:开放视频生成Stable Video Diffusion 将 latent video diffusion 公开给研究和开发者,使开放生成生态从图像向视频延展。它也预示后续 image model / video model 之间越来越紧密的共享基础设施。历史节点 · Stability AI / research collaborators阅读Stable Video Diffusion:开放视频生成
2023Ideogram 0.2Ideogram 在初次上线约两个月后更新模型,改善提示响应与文字排印。该节点保留早期版本演变,与后来的 1.0 和 2.0 分开记录。历史节点 · Ideogram阅读Ideogram 0.2
2023Emu Video 与 Emu EditMeta 将文本生成视频与基于指令的图像编辑并置,探索二者与共同图像基础模型的关系。这一研究同时涉及生成运动影像和修改已有图像。历史节点 · Meta阅读Emu Video 与 Emu Edit
2023SDXL Turbo对抗式扩散蒸馏把图像生成压缩到单步,推动实时文生图成为可操作的产品目标。母版强调推理速度对创作界面和交互节奏的影响。历史节点 · Stability AI阅读SDXL Turbo
2023Midjourney V6Midjourney V6 强化 prompt accuracy、coherence、image prompting 与 remix。它代表闭源平台路线在视觉品质、审美调性和社区界面上的持续迭代。历史节点 · Midjourney team阅读Midjourney V6
2023Imagen 2 推广应用Imagen 2 进入 Google Cloud、Vertex AI 及面向消费者的实验产品。这个节点关注模型可用范围的扩展,以及企业接入与公众实验之间的联系。历史节点 · Google阅读Imagen 2 推广应用
2024Recraft V3:面向设计交付Recraft 等设计导向模型把生成任务从纯视觉想象推进到品牌资产、排版、矢量与可交付设计。这个分化说明 AI image generation 已经从单一技术类别变成不同创意产业的生产工具。历史节点 · Recraft team阅读Recraft V3:面向设计交付
2024InstantID:零样本身份保持InstantID 将 face embedding 与结构条件结合,为 diffusion 增加高效 identity preservation。它是 DreamBooth 式“训练一个人”向 reference-based identity generation 转型的重要节点,也直接关联 likeness / consent 的后来争议。历史节点 · Qixun Wang et al.阅读InstantID:零样本身份保持
2024Sora:连续影像与公众期待Sora 把公众对生成模型的期待从单张图像推向连续世界、摄影机运动和物理一致性。它使“生成视觉文化”的研究范围不可避免地扩展到 video model 与影视产业。历史节点 · OpenAI Sora research and product teams阅读Sora:连续影像与公众期待
2024Stable Cascade:分阶段压缩生成Stable Cascade 基于 Würstchen 路线,将极强语义压缩与分阶段生成结合。虽然未成为最终主导生态,它代表 post-SDXL 时期对效率、压缩表示和 modular generation 的重要探索。历史节点 · Stability AI; Würstchen research lineage阅读Stable Cascade:分阶段压缩生成
2024Stable Diffusion 3:整流流 TransformerSD3 采用 diffusion transformer 与 flow matching,并强调多主体 prompt、文字与图像质量。这一节点代表主流图像生成进一步吸收 Transformer 架构。历史节点 · Stability AI research team阅读Stable Diffusion 3:整流流 Transformer
2024Google ImageFXGoogle 通过专门的实验界面向消费者提供 Imagen 图像生成。此节点关注用户入口和操作方式,区别于底层模型本身的研究公布。历史节点 · Google阅读Google ImageFX
2024Ideogram 1.0Ideogram 1.0 进一步改善图像中文字的排印与提示遵循,强化面向设计的图像生成方向。它与 2023 年首次上线的 0.1 版本分开记录。历史节点 · Ideogram阅读Ideogram 1.0
2024Recraft V2Recraft V2 明确面向设计工作,强调品牌一致性、矢量图形和可控的图形输出。它显示了图像模型按具体职业流程进行专门化的方向。历史节点 · Recraft阅读Recraft V2
2024Stability AI 图像服务 API生成、放大、擦除、画面扩展以及结构和风格控制被打包为面向制作流程的 API。母版将其视为从单一模型转向一组可组合服务的变化。历史节点 · Stability AI阅读Stability AI 图像服务 API
2024Stable Diffusion 3 API 与 TurboSD3 在开放权重之前先通过托管 API 面向开发者提供服务。这一顺序表明,研究模型、云端接口和本地部署版本已经成为不同的发布阶段。历史节点 · Stability AI阅读Stable Diffusion 3 API 与 Turbo
2024Firefly Image 3Firefly Image 3 通过照片真实感、风格控制和参考图像生成,深化生成式 AI 与 Photoshop、InDesign 等创意软件的结合。历史节点 · MODEL/PRODUCT阅读Firefly Image 3
2024Photoshop 图像生成与填充升级Photoshop 的生成操作由局部填充进一步扩展到从空白画布生成完整图像,并加入参考控制。母版用它说明专业编辑与图像合成边界的变化。历史节点 · Adobe阅读Photoshop 图像生成与填充升级
2024Veo:面向电影语言的视频生成Veo 在 Google I/O 2024 发布,强调 1080p、超过一分钟时长和电影语言理解。它将视频生成竞争从短片 demo 推向更接近影视生产的时长、镜头和控制问题。历史节点 · Google DeepMind阅读Veo:面向电影语言的视频生成
2024Imagen 3:平台模型栈中的图像能力Imagen 3 在 Google I/O 亮相并随后进入 Gemini 与 Vertex AI。它代表大型通用 AI 平台把 image generation 作为模型栈中的标准媒体能力,而不再是孤立实验产品。历史节点 · Google DeepMind / Imagen team阅读Imagen 3:平台模型栈中的图像能力
2024可灵:视频生成模型Kling 在 2024 年公开后迅速因运动表现和较长视频能力获得关注。它说明生成媒体前沿不再由单一欧美实验室主导,也为后来的跨平台影视 IP 冲突提供技术背景。历史节点 · Kuaishou / Kling AI team阅读可灵:视频生成模型
2024Dream Machine:面向用户的视频生成Dream Machine 通过 web 产品快速开放 text/image-to-video,使 2024 年视频生成呈现与 2022 文生图类似的产品爆发:用户开始围绕 prompt、reference image 和 motion consistency 建立新工作流。历史节点 · Luma AI阅读Dream Machine:面向用户的视频生成
2024Runway Gen-3 AlphaGen-3 Alpha 强化 fidelity、motion 与 temporal consistency,并逐渐加入 image/video controls。它标志生成视频开始形成与 image GenAI 同样复杂的专业控制层。历史节点 · Runway阅读Runway Gen-3 Alpha
2024Niji 6这一动画风格模型改善日文文字呈现和插画细节。节点采用所引官方旧版文档记载的日期,作为专门化视觉模型持续迭代的记录。历史节点 · Midjourney / Spellbrush阅读Niji 6
2024Stable Diffusion 3 Medium 开放发布SD3 Medium 权重面向自行部署开放,使多模态扩散 Transformer 与流匹配进入可本地使用的生态。它与此前的研究预览和 API 发布分开记录。历史节点 · Stability AI阅读Stable Diffusion 3 Medium 开放发布
2024LivePortraitLivePortrait 提供高效且可控制的人像动画能力,推动说话人像及角色动画工作流。母版将其放在生成视频与表演控制相交的脉络中。历史节点 · Kuaishou / KwaiVGI阅读LivePortrait
2024Midjourney V6.1V6.1 在保持 V6 交互方式的同时改善细节连贯性;母版记载生成速度约提升四分之一。该速度说法仍需结合官方测试条件理解。历史节点 · Midjourney阅读Midjourney V6.1
2024FLUX.1 模型家族由多位原 Stable Diffusion/CompVis 核心研究者参与创建的 Black Forest Labs 推出 FLUX.1。它强化 prompt adherence、文字生成和高质量开放/可开发生态,并让社区微调基础逐渐从 SDXL 扩展到新的模型家族。历史节点 · Black Forest Labs (Robin Rombach; Andreas Blattmann; Patrick Esser et al.)阅读FLUX.1 模型家族
2024Ideogram 2.0:排版与风格控制Ideogram 2.0 强化 typography、style control 和多种生成模式。它代表 2024 以后模型竞争从纯 photorealism 转向可读文字、品牌感和设计可用性。历史节点 · Ideogram阅读Ideogram 2.0:排版与风格控制
2024Firefly 视频模型预览Adobe 公布生成视频模型预览,并以专业工作流及训练素材授权叙事联系 Premiere Pro。这里记录公司的产品定位,不把该叙事视为对全部权利问题的独立结论。历史节点 · Adobe阅读Firefly 视频模型预览
2024Stable Diffusion 3.5SD3.5 Large / Large Turbo / Medium 继续使用 MMDiT/flow 路线并调整质量与硬件适配。它不再像 SD 1.5 那样垄断社区,但仍是开放生成模型多中心格局的重要节点。历史节点 · Stability AI阅读Stable Diffusion 3.5
2024Runway Act-OneAct-One 通过驱动表演把面部动作转移到生成角色上,扩展了对角色表演的控制。这个节点关注表演输入如何进入生成动画流程。历史节点 · Runway阅读Runway Act-One
2024Canva Dream LabCanva 把由 Leonardo Phoenix 支持的视觉创作引入大众设计套件,扩展原有图像生成能力。该节点体现模型供应方与设计平台之间的整合。历史节点 · Canva / Leonardo.Ai阅读Canva Dream Lab
2024Meta Movie GenMovie Gen 将文本生成视频、个性化视频、视频编辑和同步音频置于同一研究套件中。它显示生成技术从单个镜头向多种视听制作任务的扩展。历史节点 · Meta阅读Meta Movie Gen
2024Firefly 生成视频与 Premiere 生成式延长测试生成视频进入 Firefly 网页应用,生成式延长进入 Premiere 时间线。母版关注生成能力如何成为剪辑操作的一部分,而非只生成独立短片。历史节点 · Adobe阅读Firefly 生成视频与 Premiere 生成式延长测试
2024Ideogram Canvas、Magic Fill 与 Extend无限画布将图像生成、局部重绘和画面扩展整合进同一视觉工作空间。该节点记录编辑界面的变化,与底层模型版本更新分开。历史节点 · Ideogram阅读Ideogram Canvas、Magic Fill 与 Extend
2024Stable Diffusion 3.5 Medium3.5 系列公布后一周,较小的 Medium 版本扩大了消费级硬件上的使用可能。母版把不同规模版本的部署门槛作为发布史的一部分。历史节点 · OPEN MODEL阅读Stable Diffusion 3.5 Medium
2024FLUX.1 Tools:编辑与结构控制BFL 为 FLUX 推出 Fill、Depth、Canny 和 Redux 等工具,把编辑、边缘/深度控制和 reference remix 直接纳入模型家族。这显示模块化 control 已从社区扩展层变成基础模型公司的标准产品能力。历史节点 · Black Forest Labs阅读FLUX.1 Tools:编辑与结构控制
2024SD3.5 ControlNetsCanny 边缘、深度和模糊等控制方式使 Stable Diffusion 新版本更适合精确制作流程。它们提供对结构的约束,补充仅靠文字描述的生成方式。历史节点 · Stability AI阅读SD3.5 ControlNets
2024混元视频:公开模型与代码HunyuanVideo 公开模型与代码,使高参数规模视频生成也进入 open-weight/open-source 竞争。它加强了 ComfyUI 等社区对视频模型的本地编排能力。历史节点 · Tencent Hunyuan team阅读混元视频:公开模型与代码
2024Runway FramesRunway 从视频扩展到强调视觉世界与风格一致性的图像模型。母版以 Frames 记录创意平台跨越静态与运动影像的产品布局。历史节点 · Runway阅读Runway Frames
2024Sora 公开产品上线Sora 从研究预览转为面向消费者的创意产品,让更多使用者可以实际测试视频生成。产品开放与此前的模型预览是两个不同的历史节点。历史节点 · OpenAI阅读Sora 公开产品上线
2024Veo 2首代 Veo 公布约七个月后,Veo 2 继续改善视频质量、镜头控制和真实感。母版用这一节点展示视频模型在同一年内快速更替的节奏。历史节点 · Google DeepMind阅读Veo 2
2024Google WhiskWhisk 以图像为提示入口,让用户组合主体、场景与风格参照,无需先编写很长的文字提示。它反映了生成界面从文本输入向视觉参照的扩展。历史节点 · Google阅读Google Whisk
2025Runway Aleph 视频编辑Aleph 通过语言修改已有视频,使生成式视频从合成新片段扩展到编辑原始素材。母版仅提供年份,不将其转写为未经核实的具体发布日期。历史节点 · Runway阅读Runway Aleph 视频编辑
2025Runway Gen-4.5Gen-4.5 强调连续指令、镜头编排与画面忠实度,体现同一年内视频模型快速更替。此处沿用母版的年份精度,具体日期仍待核验。历史节点 · Runway阅读Runway Gen-4.5
2025Pika 2.1 与 2.2 系列Pika 的消费级视频产品围绕更长片段、效果和可控性持续更新,并通过易于传播的创作形式竞争。母版将两次版本变化合记,尚未核实各自日期。历史节点 · Pika阅读Pika 2.1 与 2.2 系列
2025Luma Ray2母版记载 Ray2 采用更大的多模态架构和约十倍训练算力,改善运动连贯性及制作可用性。这些规模与性能说法应结合发布方的表述理解。历史节点 · Luma AI阅读Luma Ray2
2025Ideogram 2aIdeogram 2a 作为更快的中间版本,体现模型系列不仅按质量区分,也按速度和成本形成不同分支。该节点保留这一版本层次。历史节点 · Ideogram阅读Ideogram 2a
2025Runway Gen-4:跨镜头一致性Gen-4 强调在多个生成镜头中维持人物、环境和视觉风格一致。生成视频从“单个漂亮 clip”转向可编辑、可连续叙事的 production system。历史节点 · Runway阅读Runway Gen-4:跨镜头一致性
2025Gemini 原生图像生成预览Gemini 2.0 Flash 的原生图像能力展示 text+image dialogue、连续编辑和多模态输出。它与 GPT-4o 同期表明 image generation 正从独立 diffusion product 融入 general multimodal model。历史节点 · Google DeepMind / Gemini team阅读Gemini 原生图像生成预览
2025Ideogram 3.0:文字、写实与风格参考Ideogram 3.0 继续强化 text rendering、photorealism 和 style references。它体现专业图像模型在 2025 进一步垂直化:不同产品围绕设计、文字、品牌资产形成明确差异。历史节点 · Ideogram阅读Ideogram 3.0:文字、写实与风格参考
2025GPT-4o 原生图像生成GPT-4o image generation 可以在对话上下文中理解上传图片、渲染文字、执行多轮修改,并利用模型知识生成视觉内容。这里发生重要 Interface Turn:用户不再“操作图像生成器”,而是与一个同时能看、理解、讨论、编辑和生成的多模态系统协作。历史节点 · OpenAI image generation and multimodal teams阅读GPT-4o 原生图像生成
2025Midjourney V7:个性化与快速迭代V7 强化 text/image prompt、细节一致性,并把 personalization 设为默认能力。Draft Mode 的对话式快速迭代显示,即使在独立图像平台中,交互也在从“一次一 prompt”转向持续的 conversational workflow。历史节点 · Midjourney team阅读Midjourney V7:个性化与快速迭代
2025gpt-image-1:图像生成 APIOpenAI 通过 gpt-image-1 把 ChatGPT 图像生成能力开放给开发者和企业。历史意义在于接口层再次迁移:native multimodal image generation 不只存在于一个聊天产品,而可以被嵌入电商、 设计、教育、游戏与企业工作流。历史节点 · OpenAI image generation team阅读gpt-image-1:图像生成 API
2025Firefly Image Model 4:创意平台中的模型调用Firefly Image Model 4 与 partner models 同时进入统一平台,Firefly 进一步从“一个生成模型”演变为创意生产操作层。生成能力开始像字体、插件或渲染器一样,被专业软件按任务调用。历史节点 · Adobe Firefly / Creative Cloud teams阅读Firefly Image Model 4:创意平台中的模型调用
2025Firefly 视频正式版与 BoardsAdobe 将 Firefly 扩展为涵盖图像、视频、音频、矢量及协作构思的多模型创意空间。视频正式开放与 Boards 的推出体现平台工作流的整合。历史节点 · Adobe阅读Firefly 视频正式版与 Boards
2025Veo 3:结合声音的视频生成Veo 3 将视频与音频生成结合,减少后期拼接不同模型的需求。它使 generative media 的单位从“图像/视频帧”扩大到带声音的完整片段,对影视劳动与权利链产生更直接影响。历史节点 · Google DeepMind阅读Veo 3:结合声音的视频生成
2025Ideogram 3.0 模型更新3.0 上线约五周后出现新的模型检查点,体现持续交付而非按年发布的更新方式。此节点与 3.0 的初次发布保留区分。历史节点 · Ideogram阅读Ideogram 3.0 模型更新
2025HunyuanCustom腾讯将多模态参考输入与 HunyuanVideo 基础模型结合,用于定制化视频生成。节点关注主体和参考条件如何进入视频生成的控制过程。历史节点 · Tencent阅读HunyuanCustom
2025Imagen 4:多媒体模型集合Imagen 4 与 Veo 3、Lyria 2 同时发布,显示图像、视频、音频生成已不再是孤立模型,而开始成为同一平台下的多媒体能力集合。历史节点 · Google DeepMind / Imagen team阅读Imagen 4:多媒体模型集合
2025Google FlowFlow 以专门的影视创作界面整合 Veo、Imagen 和 Gemini,围绕镜头与场景组织工作流。该节点记录平台界面,而不是把三个模型视为同一次发布。历史节点 · PRODUCT阅读Google Flow
2025HunyuanVideo-Avatar音频驱动的人体动画把开放视频生成进一步带入数字人表演。母版关注语音、动作和角色形象之间的条件控制关系。历史节点 · Tencent阅读HunyuanVideo-Avatar
2025FLUX.1 Kontext:上下文中的生成与编辑FLUX.1 Kontext 把经典 text-to-image 扩展为 in-context image generation:输入可以同时包含图像和文字,并在持续编辑中维持角色和场景关系。它代表 reference-native、editing-native 模型取代“纯文生图”成为新主流。历史节点 · Black Forest Labs research team阅读FLUX.1 Kontext:上下文中的生成与编辑
2025Seedance 1.0母版以原生多镜头叙事、1080p 输出和快速推理概括 Seedance 1.0 的方向。它把字节跳动的视频生成研究置于国际模型演进的同一时间线上。历史节点 · ByteDance Seed阅读Seedance 1.0
2025Midjourney V1 视频模型Midjourney 从静态图像扩展到图像生成视频,并将其置于交互世界模型的探索方向中。此处的 V1 是视频模型,不是早期图像模型的 V1。历史节点 · Midjourney阅读Midjourney V1 视频模型
2025FLUX.1 Krea [dev] 开放权重强调视觉审美的商业模型被蒸馏为与 FLUX 兼容的开放权重版本,把专有的风格调校与社区基础设施连接起来。权重开放不等于所有用途均无条件授权。历史节点 · Krea / Black Forest Labs阅读FLUX.1 Krea [dev] 开放权重
2025Gemini 2.5 Flash Image:参考图与连续编辑Gemini 2.5 Flash Image 将人物/对象保持、多图组合和 conversational editing 推向更高可靠性。它代表 2025 reference-native generation 的成熟:生成的核心不再只是从零造图,而是基于已有视觉对象持续工作。历史节点 · Google DeepMind / Gemini team阅读Gemini 2.5 Flash Image:参考图与连续编辑
2025Qwen-Image这一约二百亿参数的图像模型强调中文和英文文字呈现,并提供开放权重。它扩展了全球开放图像模型生态中的多语言生成能力。历史节点 · Alibaba Qwen阅读Qwen-Image
2025Leonardo Lucid OriginLeonardo 推出新的自研图像模型,强调审美多样性、提示遵循和全高清输出。母版用它记录创意平台发展自有模型的路线。历史节点 · Leonardo.Ai阅读Leonardo Lucid Origin
2025Qwen-Image-EditQwen 的图像编辑模型扩展了基础图像生成能力,面向保持语义或外观的修改、图中文字编辑和物体变换。它属于生成与编辑进一步结合的线索。历史节点 · Alibaba Qwen阅读Qwen-Image-Edit
2025Krea 实时视频Krea 将视频生成推进到可交互的速度,并通过画布、摄像头和屏幕流提供控制。母版强调比播放更快的生成如何改变创作者与画面的往返关系。历史节点 · Krea阅读Krea 实时视频
2025HunyuanImage 2.1母版记载这一约一百七十亿参数的开放模型支持 2K 文生图,结合多模态语言理解、双语字形感知编码及细化阶段,关注图像质量与文字控制。历史节点 · Tencent阅读HunyuanImage 2.1
2025HunyuanImage 3.0腾讯转向原生多模态图像生成,并提供开放权重及更强的指令理解能力。母版将其作为生成、理解和开放部署相互结合的节点。历史节点 · Tencent阅读HunyuanImage 3.0
2025Nano Banana 扩展至搜索、NotebookLM 与相册专门的图像模型被整合进搜索、知识工具和大众照片产品。此节点关注能力的分发与嵌入,不将其视为底层模型的再次首次发布。历史节点 · Google阅读Nano Banana 扩展至搜索、NotebookLM 与相册
2025HunyuanVideo 1.5较轻量的约八十三亿参数模型面向消费级 GPU,体现开放视频生成从研究级硬件向本地使用移动的方向。实际部署条件仍应对照项目文档。历史节点 · Tencent阅读HunyuanVideo 1.5
2026Niji 7动画风格生成继续改善连贯性、精细线条与可重复的角色,同时保持为独立的专门模型系列。母版以此延续 Niji 的版本演变线索。历史节点 · Midjourney / Spellbrush阅读Niji 7
2026HunyuanImage 3.0 Instruct 与蒸馏版原生图像生成加入指令推理、图像到图像编辑,并提供蒸馏部署版本。此节点记录 3.0 系列的新能力与部署形态,区别于基础版发布。历史节点 · Tencent阅读HunyuanImage 3.0 Instruct 与蒸馏版
2026Seedance 2.0 正式发布Seedance 2.0 将文字、图像、音频和视频作为参考输入,结合多镜头生成与编辑控制。官方公告日期为 2026 年 2 月 12 日,修正母版的六月记录。历史节点 · ByteDance Seed阅读Seedance 2.0 正式发布
2026Firefly 自定义模型公开测试Adobe 将以创作者自有图像训练风格、角色及摄影模型的流程产品化,并放入 Firefly。该节点关注定制能力如何进入日常创意平台。历史节点 · Adobe阅读Firefly 自定义模型公开测试
2026ChatGPT Images 2.0 与 GPT-Image-2ChatGPT Images 2.0 与 GPT-Image-2 把更强 instruction-following、布局、文字与高分辨率输出推向 production workflow。GPT-Image-2 同日进入 API 和 Codex,图像生成继续基础设施化。历史节点 · OpenAI image generation team阅读ChatGPT Images 2.0 与 GPT-Image-2
2026GPT-Image-2:API 与生产资产GPT Image 2 在 API 与 Codex 中推出,强调复杂视觉任务、布局、文本、指令遵循和最高 2K 的生产用途。它显示生成图像正在从“生成一张漂亮图”转向“生成可直接进入产品和设计系统的资产”。历史节点 · OpenAI image generation team阅读GPT-Image-2:API 与生产资产
2026Muse Image 发布与 Muse Video 预览Meta 推出可调用搜索与代码工具的图像生成,并预览具有原生音频的相关视频模型。图像模型发布和视频早期预览的可用状态应分别理解。历史节点 · Meta Superintelligence Labs阅读Muse Image 发布与 Muse Video 预览
2026Hailuo 3.0 接入 Runway APIRunway 开发者平台开始提供第三方 Hailuo 3.0 视频模型,显示创意平台也逐步承担多模型接入和路由的角色。该日期是 API 接入日期,不是模型首次发布日。历史节点 · Runway Dev阅读Hailuo 3.0 接入 Runway API
2026ChatGPT Images 2.5 与 Flare / SunburstChatGPT Images 2.5 强化细节、主体保持、多轮编辑和速度,同时加入 Sketch、Templates 与直接评论图片的编辑方式;API 则提供 GPT-Image-2.5 Flare / Sunburst。它标记 2026 年 image generation 的界面状态:生成、参考、标注、编辑、模板与协作几乎完全合并。历史节点 · OpenAI image generation team阅读ChatGPT Images 2.5 与 Flare / Sunburst
2026IMPF 与 IMPEL 发布生成式 AI 公平授权原则2026 年 9 月 30 日,IMPF 与 IMPEL 联合提出生成式 AI 音乐授权原则,要求区分对既往使用、训练、生成输出及未来利用的支付,并让权利人参与决定授权范围与价值。这是行业组织提出的谈判框架,不是已签订的统一许可协议或法定收费标准。 编者解释:该声明把对未经许可训练的反对转化为音乐出版权、录音权与模型商业化之间的分配问题。它为研究“拒绝如何进入授权基础设施”提供了材料,但不足以证明音乐行业已达成共识或艺术家的收益已经实现。历史节点 · IMPF / IMPEL阅读IMPF 与 IMPEL 发布生成式 AI 公平授权原则
2026康涅狄格州大型生成式 AI 提供者内容来源标记义务生效公共法 26-15 第 15 条自 2026 年 10 月 1 日起,对月用户超过一百万、向本州消费者公开提供个人使用服务的受涵盖生成式 AI 提供者规定来源数据义务。对象是模型创建或实质修改的音频、图像和视频,义务以商业及技术上的合理性为限。 编者解释:该制度使生成媒体的可识别来源成为基础设施责任,为研究作品如何被认证、传播和解释提供制度背景。它不认定作品的作者身份、艺术价值或训练许可是否合法,也不意味着所有 AI 文本与图像在全球均须遵守同一标记规则。历史节点 · Connecticut General Assembly阅读康涅狄格州大型生成式 AI 提供者内容来源标记义务生效