首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

GitHub 热门项目:mini-omni

2026-09-01 1 阅读 约6分钟阅读 GitHub Trending
分享:
字号:
GitHub 项目:mini-omni 仓库地址:https://github.com/gpt-omni/mini-omni 星级:3573 | 作者:gpt-omni 项目描述:开源多模态大语言模型,可以一边听一边思考。具有实时端到端语音输入和流音频输出对话功能。 =================================================== 自述文件内容: # 迷你全向 Mini-Omni:语言模型可以在流媒体中一边听一边思考

🤗 拥抱脸 | 📖 Github | 📑 技术报告 | 🤗 数据集

Mini-Omni 是一种开源多模态大语言模型,可以**边听边思考**。具有实时端到端语音输入和**流音频输出**对话功能。

## 更新 - **2024.10:** 我们发布了具有视觉和音频功能的[Mini-Omni2](https://github.com/gpt-omni/mini-omni2)。 - **2024.09:** 🤗 gradio 团队提供的令人惊叹的在线 [交互式 gradio 演示](https://huggingface.co/spaces/gradio/omni-mini)。 - **2024.09:** **VoiceAssistant-400K** 上传至 [Hugging Face](https://huggingface.co/datasets/gpt-omni/VoiceAssistant-400K)。 ## 特点 ✅ **实时语音到语音**对话功能。无需额外的 ASR 或 TTS 模型。 ✅ **边说话边思考**,能够同时生成文本和音频。 ✅ **流式音频输出**功能。 ✅ 通过“音频到文本”和“音频到音频”**批量推理**来进一步提升性能。 ## 演示 注意:需要先取消静音。 https://github.com/user-attachments/assets/03bdde05-9514-4748-b527-003bea57f118 ## 安装 创建新的 conda 环境并安装所需的包: ````嘘 conda 创建-n 全方位 python=3.10 conda 激活全向 git 克隆 https://github.com/gpt-omni/mini-omni.git CD迷你全向 pip install -r 要求.txt ```` ## 快速开始 **互动演示** - 启动服务器 注意:您需要在运行 Streamlit 或 gradio 演示之前启动服务器,并将 API_URL 设置为服务器地址。 ````嘘 sudo apt-get 安装 ffmpeg conda 激活全向 CD迷你全向 python3 server.py --ip '0.0.0.0' --端口 60808 ```` - 运行streamlit演示 注意:您需要在安装了 PyAudio 的情况下在**本地**运行 Streamlit。如果出现错误:“ModuleNotFoundError:没有名为 'utils.vad' 的模块”,请先运行“export PYTHONPATH=./”。 ````嘘 pip 安装 PyAudio==0.2.14 API_URL=http://0.0.0.0:60808/chat Streamlit 运行 webui/omni_streamlit.py ```` - 运行渐变演示 ````嘘 API_URL=http://0.0.0.0:60808/chat python3 webui/omni_gradio.py ```` 示例: 注意:需要先取消静音。 Gradio似乎无法立即播放音频流,因此延迟感觉有点长。 https://github.com/user-attachments/assets/29187680-4c42-47ff-b352-f0ea333496d9 **本地测试** ````嘘 conda 激活全向 CD迷你全向 # 测试运行预设的音频样本和问题 python 推理.py ```` ## 常见问题解答 **
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱