GitHub 项目:mini-omni
仓库地址:https://github.com/gpt-omni/mini-omni
星级:3573 | 作者:gpt-omni
项目描述:开源多模态大语言模型,可以一边听一边思考。具有实时端到端语音输入和流音频输出对话功能。
===================================================
自述文件内容:
# 迷你全向
Mini-Omni:语言模型可以在流媒体中一边听一边思考
🤗 拥抱脸 | 📖 Github
| 📑 技术报告 |
🤗 数据集
Mini-Omni 是一种开源多模态大语言模型,可以**边听边思考**。具有实时端到端语音输入和**流音频输出**对话功能。
## 更新
- **2024.10:** 我们发布了具有视觉和音频功能的[Mini-Omni2](https://github.com/gpt-omni/mini-omni2)。
- **2024.09:** 🤗 gradio 团队提供的令人惊叹的在线 [交互式 gradio 演示](https://huggingface.co/spaces/gradio/omni-mini)。
- **2024.09:** **VoiceAssistant-400K** 上传至 [Hugging Face](https://huggingface.co/datasets/gpt-omni/VoiceAssistant-400K)。
## 特点
✅ **实时语音到语音**对话功能。无需额外的 ASR 或 TTS 模型。
✅ **边说话边思考**,能够同时生成文本和音频。
✅ **流式音频输出**功能。
✅ 通过“音频到文本”和“音频到音频”**批量推理**来进一步提升性能。
## 演示
注意:需要先取消静音。
https://github.com/user-attachments/assets/03bdde05-9514-4748-b527-003bea57f118
## 安装
创建新的 conda 环境并安装所需的包:
````嘘
conda 创建-n 全方位 python=3.10
conda 激活全向
git 克隆 https://github.com/gpt-omni/mini-omni.git
CD迷你全向
pip install -r 要求.txt
````
## 快速开始
**互动演示**
- 启动服务器
注意:您需要在运行 Streamlit 或 gradio 演示之前启动服务器,并将 API_URL 设置为服务器地址。
````嘘
sudo apt-get 安装 ffmpeg
conda 激活全向
CD迷你全向
python3 server.py --ip '0.0.0.0' --端口 60808
````
- 运行streamlit演示
注意:您需要在安装了 PyAudio 的情况下在**本地**运行 Streamlit。如果出现错误:“ModuleNotFoundError:没有名为 'utils.vad' 的模块”,请先运行“export PYTHONPATH=./”。
````嘘
pip 安装 PyAudio==0.2.14
API_URL=http://0.0.0.0:60808/chat Streamlit 运行 webui/omni_streamlit.py
````
- 运行渐变演示
````嘘
API_URL=http://0.0.0.0:60808/chat python3 webui/omni_gradio.py
````
示例:
注意:需要先取消静音。 Gradio似乎无法立即播放音频流,因此延迟感觉有点长。
https://github.com/user-attachments/assets/29187680-4c42-47ff-b352-f0ea333496d9
**本地测试**
````嘘
conda 激活全向
CD迷你全向
# 测试运行预设的音频样本和问题
python 推理.py
````
## 常见问题解答
**