GitHub 项目:Qwen3-VL
仓库地址:https://github.com/QwenLM/Qwen3-VL
星级:19873 | 作者:QwenLM
项目描述:Qwen3-VL是阿里云Qwen团队开发的多模态大语言模型系列。
===================================================
自述文件内容:
#Qwen3-VL
💜 Qwen 聊天   |   🤗 拥抱脸   |   🤖 ModelScope    |   📑博客   |   📚 食谱    |   📑 论文  
🖥️ 演示 |   💬 微信 (微信)    |   🫨 不和谐   | 📑 API |   🖥️ PAI-DSW
## 简介
Qwen3-VL 是迄今为止 Qwen 系列中最强大的视觉语言模型。
这一代提供了全面的全面升级:卓越的文本理解和生成、更深入的视觉感知和推理、扩展的上下文长度、增强的空间和视频动态理解以及更强的代理交互能力。
提供从边缘扩展到云的密集和 MoE 架构,并具有指导和推理增强型 Thinking 版本,可实现灵活的按需部署。
#### 主要增强功能:
* **视觉代理**:操作PC/移动GUI——识别元素、理解功能、调用工具、完成任务。
* **视觉编码增强**:从图像/视频生成 Draw.io/HTML/CSS/JS。
* **高级空间感知**:判断物体位置、视点和遮挡;提供更强的 2D 基础,并为空间推理和体现 AI 提供 3D 基础。
* **长上下文和视频理解**:原生256K上下文,可扩展至1M;处理书籍和长达数小时的视频,具有完整的回忆和二级索引。
* **增强型多模式推理**:擅长 STEM/数学 — 因果分析和逻辑、基于证据的答案。
* **升级视觉识别**:更广泛、更高质量的预训练能够“识别一切”——名人、动漫、产品、地标、动植物等。
* **扩展 OCR**:支持 32 种语言(原来为 10 种);在低光、模糊和倾斜情况下具有鲁棒性;更好地使用稀有/古代字符和行话;改进了长文档结构解析。
* **与纯法学硕士同等的文本理解**:无缝文本-视觉融合,实现无损、统一的理解。
#### 模型架构更新: