ANTI-AI ARCHIVE
艺术史节点 / 213 · 2023-01-29

AudioLDM:潜空间扩散的文本到声音生成

AudioLDM: Text-to-Audio Generation with Latent Diffusion Models

Liu, Haohe; Chen, Zehua; Yuan, Yi; Mei, Xinhao; Liu, Xubo; Mandic, Danilo; Wang, Wenwu; Plumbley, Mark D.

导读

AudioLDM将潜空间扩散用于一般声音合成,借助语言—音频对齐表示连接文字与听觉内容,把生成艺术研究延伸到环境声与声音编辑。

原始文献#213
图1:AudioLDM训练、文本条件采样及声音编辑的原始方法图。查看大图 ↗

图1:AudioLDM训练、文本条件采样及声音编辑的原始方法图。 来源为v3,图像版本与论文首次公开日分别记录。

Liu, Haohe; Chen, Zehua; Yuan, Yi; Mei, Xinhao; Liu, Xubo; Mandic, Danilo; Wang, Wenwu; Plumbley, Mark D. · original paper / arXiv · 原论文图文与所引作品权利归各自权利人;研究引用不代表开放授权,转载权利待独立复核。

资料出处 · AudioLDM: Text-to-Audio Generation with Latent Diffusion Models ↗

档案研究说明

AudioLDM将潜空间扩散用于一般声音合成,借助语言—音频对齐表示连接文字与听觉内容,把生成艺术研究延伸到环境声与声音编辑。

ANTI-AI ARCHIVE · 修订 2026-10-03

论文研究了什么

模型利用CLAP的对齐表示,在训练时使用音频嵌入,在采样时以文本嵌入作为条件。论文还展示声音修补、超分辨率及风格相关操作,说明声音合成不只是把图像模型换一个输出标签。

本节依据: AudioLDM:潜空间扩散的文本到声音生成

与生成艺术史的关系

编者解释:文字可以成为组织声音环境的输入,使音色、事件和空间想象进入生成制作。原项目试听比静态流程图更能说明结果,故保留作者的声音展示入口。

本节依据: AudioLDM:潜空间扩散的文本到声音生成

阅读边界与版本

一般声音生成与完整音乐结构生成不同;论文的主客观评估不等于对音乐或声音艺术价值的判断。

本节依据: AudioLDM:潜空间扩散的文本到声音生成

正文引用资料

AudioLDM:潜空间扩散的文本到声音生成 ↗

核读arXiv摘要、署名和版本记录,以及原论文第2页所选图页;未全文审查证明、未复现实验。

核读arXiv摘要、署名和版本记录,以及原论文第2页所选图页;未全文审查证明、未复现实验。 正文与译文使用 AI 辅助,尚未经独立人工审校;分节引文标明依据,不代表已独立验证全部史实。

带着问题继续阅读

MusicGen:简单且可控的音乐生成 ↗

AudioLDM:对照MusicGen:简单且可控的音乐生成的方法、控制或评价条件。

Jukebox:音乐生成模型 ↗

AudioLDM:对照Jukebox的方法、控制或评价条件。

IMPF 与 IMPEL 发布生成式 AI 公平授权原则 ↗

AudioLDM:对照音乐 AI 公平授权原则的方法、控制或评价条件。

日期与版本记录

节点标注日期:2023-01-29 · 来源记录的历史日期:2023-01-29

时间线采用arXiv首次公开日,不以会议发表、模型上线或2026-10-03补录日替代。正文及图像参照v3;该版日期见原文版本记录。

以上日期属于历史事件或资料所记版本,不是本站页面的上线日期;保留原有日期精度与待核事项。

原始资料与进一步阅读

以下链接通往来源的论文、文章、机构或会议页面。外部原文的语言以来源为准。

01
AudioLDM:潜空间扩散的文本到声音生成 ↗

AudioLDM: Text-to-Audio Generation with Latent Diffusion Models

https://arxiv.org/abs/2301.12503

当前引用地址

核读arXiv摘要、署名和版本记录,以及原论文第2页所选图页;未全文审查证明、未复现实验。

出处、翻译与核验状态

档案节点 #213 · 研究论文首次公开;方法、评估与制作条件

研究资料与补充出处 · 1

2022年以来重要论文补录与去重资料 · 核读arXiv摘要、署名和版本记录,以及原论文第2页所选图页;未全文审查证明、未复现实验。 · 012
原记日期: 2023-01-29
AudioLDM:潜空间扩散的文本到声音生成 ↗
AudioLDM: Text-to-Audio Generation with Latent Diffusion Models

站内说明依据所列研究资料撰写,非外链全文译本;AI 辅助翻译,待独立人工审校。

已按条目所列范围核读官方资料;核读范围与待复核事项见来源说明。

引用本节点

ANTI-AI ARCHIVE. AudioLDM:潜空间扩散的文本到声音生成. 艺术史节点 #213. https://salondesrefuses.cn/zh/art-history/335

引用具体史实时,请同时引用上方原始资料,并补充你的访问日期。本站说明不是外链全文译本。

相邻节点按时间顺序排列,不意味着二者存在直接影响或因果关系。