## StoryDiffusion:用于长距离图像和视频生成的一致自注意力 []()
[[论文](https://arxiv.org/abs/2405.01434)] [[项目页面](https://storydiffusion.github.io/)] [[Jittor 版本](https://github.com/JittorCV/jitordiffusion/tree/master)] [[🤗 漫画生成演示](https://huggingface.co/spaces/YupengZhou/StoryDiffusion)] [](https://replicate.com/cjwbw/StoryDiffusion) [](https://colab.research.google.com/github/HVision-NKU/StoryDiffusion/blob/main/Comic_Generation.ipynb)
---
**[StoryDiffusion:用于长距离图像和视频生成的一致自注意力]()** 的正式实现。
### **演示视频**
https://github.com/HVision-NKU/StoryDiffusion/assets/49511209/d5b80f8f-09b0-48cd-8b10-daff46d422af
### 更新历史
***您可以访问[此处](update.md)查看更新历史记录。***
### 🌠 **主要特点:**
StoryDiffusion 可以通过生成一致的图像和视频来创造一个神奇的故事。我们的工作主要有两部分:
1. 一致的自注意力,可在长范围序列上生成字符一致的图像。它是热插拔的,并与所有基于 SD1.5 和 SDXL 的图像扩散模型兼容。对于当前的实现,用户需要为一致的自注意力模块提供至少3个文本提示。我们建议至少 5 - 6 个文本提示,以便更好的布局安排。
2. 用于长距离视频生成的运动预测器,在压缩图像语义空间中预测条件图像之间的运动,实现更大的运动预测。
## 🔥 **示例**
### 漫画一代

### 图像到视频生成(为了速度,结果被高度压缩)
利用通过我们的一致自注意力机制生成的图像,我们可以通过在这些图像之间无缝转换来扩展创建视频的过程。这可以被认为是两阶段的长视频生成方法。
注意:为了速度,结果被**高度压缩**,您可以访问[我们的网站](https://storydiffusion.github.io/)以获得高质量版本。
#### 两阶段长视频生成(新更新)
结合这两部分,我们可以生成非常长且高质量的 AIGC 视频。
|视频1 |视频2 |视频3 |
| --- | --- | --- |
|