GitHub 项目:RPG-DiffusionMaster
仓库地址:https://github.com/YangLing0818/RPG-DiffusionMaster
星级:1842 | 作者:杨凌0818
项目描述:[ICML 2024] 掌握文本到图像的扩散:使用多模态法学硕士 (RPG) 进行重述、规划和生成
===================================================
自述文件内容:
## 掌握文本到图像的扩散:使用多模态 LLM 进行重述、规划和生成 - ICML 2024

该存储库包含我们的 [RPG](https://openreview.net/forum?id=DgLFkAPwuZ) 的官方实现,已被 ICML 2024 接受。
> [**掌握文本到图像的扩散:使用多模式 LLM 进行重述、规划和生成**](https://openreview.net/forum?id=DgLFkAPwuZ)
> [杨凌](https://yangling0818.github.io/),
> [于兆晨](https://github.com/BitCodingWalkin),
> [孟晨琳](https://cs.stanford.edu/~chenlin/),
> [徐敏凯](https://minkaixu.com/),
> [斯特凡诺·埃尔蒙](https://cs.stanford.edu/~ermon/),
> [崔斌](https://cuibinpku.github.io/)
>
**北京大学、斯坦福大学、Pika Labs**
## 简介
<表类=“中心”>
 |
| 我们的 RPG 概述
|
表>
**摘要**:RPG 是一种强大的免训练范式,可以利用专有的 MLLM(例如 GPT-4、Gemini-Pro)或开源本地 MLLM(例如 miniGPT-4)作为**提示重述器和区域规划器**以及我们的**补充区域扩散**来实现 SOTA 文本到图像的生成和编辑。我们的框架非常灵活,可以推广到任意 MLLM 架构和扩散主干。 RPG还能够生成超高分辨率的图像,下面是一个例子:
<表类=“中心”>
 |
| 文字提示:一道美丽的风景,中间有一条河,河的左边是傍晚和冬天,有一个大冰山和一个小村庄,有人在河上滑冰,有人在滑雪,河的右边是夏天,早上有一座火山,有一个小村庄,有人在玩耍。
|
表>
## 🚩 新更新
**[2025.2]** 我们使用拥有最强推理能力的LLM来增强RPG,包括[**DeepSeek-R1**](https://github.com/deepseek-ai/DeepSeek-R1)、[**OpenAI o3-mini**](https://openai.com/index/openai-o3-mini/)和[**OpenAI o1**](https://openai.com/index/learning-to-reason-with-llms/),并利用强大的扩散主干[**IterComp**](https://github.com/YangLing0818/IterComp),在复杂提示下实现出色的合成图像生成。
**[2024.10]** 我们提高RP