ANTI-AI ARCHIVE
艺术史节点 / 311 · 2025-01-29

Janus-Pro:理解与生成的多模态扩展

Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling

Chen, Xiaokang; Wu, Zhiyu; Liu, Xingchao; Pan, Zizheng; Liu, Wen; Xie, Zhenda; Yu, Xingkai; Ruan, Chong

导读

Janus-Pro通过训练策略、数据规模和模型规模调整,研究统一多模态系统中的理解与图像生成,为原有Janus路线提供后续证据。

原始文献#311
图1:Janus-Pro的理解与生成基准比较;为作者报告的数据。查看大图 ↗

图1:Janus-Pro的理解与生成基准比较;为作者报告的数据。 来源为v1,图像版本与论文首次公开日分别记录。

Chen, Xiaokang; Wu, Zhiyu; Liu, Xingchao; Pan, Zizheng; Liu, Wen; Xie, Zhenda; Yu, Xingkai; Ruan, Chong · original paper / arXiv · 原论文图文与所引作品权利归各自权利人;研究引用不代表开放授权,转载权利待独立复核。

资料出处 · Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling ↗

档案研究说明

Janus-Pro通过训练策略、数据规模和模型规模调整,研究统一多模态系统中的理解与图像生成,为原有Janus路线提供后续证据。

ANTI-AI ARCHIVE · 修订 2026-10-03

论文研究了什么

报告把改进分为优化训练、扩充数据和增大模型三个部分,比较多模态理解与文本生成图像的指令遵循表现。它明确继承Janus,并非将所有多模态统一思想首次提出。

本节依据: Janus-Pro:理解与生成的多模态扩展

与生成艺术史的关系

编者解释:当观看图像与制作图像进入同一系统,创作接口可能从单次提示走向围绕图像的交流。这个研究节点提供能力结构背景,实际艺术家使用仍需独立材料。

本节依据: Janus-Pro:理解与生成的多模态扩展

阅读边界与版本

采用2025-01-29预印本日期,不混同此前代码或模型公开日;基准提升不证明一般性的视觉推理。

本节依据: Janus-Pro:理解与生成的多模态扩展

正文引用资料

Janus-Pro:理解与生成的多模态扩展 ↗

核读arXiv摘要、署名和版本记录,以及原论文第1页所选图页;未全文审查证明、未复现实验。

核读arXiv摘要、署名和版本记录,以及原论文第1页所选图页;未全文审查证明、未复现实验。 正文与译文使用 AI 辅助,尚未经独立人工审校;分节引文标明依据,不代表已独立验证全部史实。

带着问题继续阅读

GenEval:对象、数量与关系的图文对齐评估 ↗

Janus-Pro:对照GenEval:对象、数量与关系的图文对齐评估的方法、控制或评价条件。

Gemini 原生图像生成预览 ↗

Janus-Pro:对照Gemini 原生图像生成预览的方法、控制或评价条件。

GPT-4o 原生图像生成 ↗

Janus-Pro:对照对话中的图像的方法、控制或评价条件。

日期与版本记录

节点标注日期:2025-01-29 · 来源记录的历史日期:2025-01-29

时间线采用arXiv首次公开日,不以会议发表、模型上线或2026-10-03补录日替代。正文及图像参照v1;该版日期见原文版本记录。

以上日期属于历史事件或资料所记版本,不是本站页面的上线日期;保留原有日期精度与待核事项。

原始资料与进一步阅读

以下链接通往来源的论文、文章、机构或会议页面。外部原文的语言以来源为准。

01
Janus-Pro:理解与生成的多模态扩展 ↗

Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling

https://arxiv.org/abs/2501.17811

当前引用地址

核读arXiv摘要、署名和版本记录,以及原论文第1页所选图页;未全文审查证明、未复现实验。

出处、翻译与核验状态

档案节点 #311 · 研究论文首次公开;方法、评估与制作条件

研究资料与补充出处 · 1

2022年以来重要论文补录与去重资料 · 核读arXiv摘要、署名和版本记录,以及原论文第1页所选图页;未全文审查证明、未复现实验。 · 030
原记日期: 2025-01-29
Janus-Pro:理解与生成的多模态扩展 ↗
Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling

站内说明依据所列研究资料撰写,非外链全文译本;AI 辅助翻译,待独立人工审校。

已按条目所列范围核读官方资料;核读范围与待复核事项见来源说明。

引用本节点

ANTI-AI ARCHIVE. Janus-Pro:理解与生成的多模态扩展. 艺术史节点 #311. https://salondesrefuses.cn/zh/art-history/353

引用具体史实时,请同时引用上方原始资料,并补充你的访问日期。本站说明不是外链全文译本。

相邻节点按时间顺序排列,不意味着二者存在直接影响或因果关系。