开发者生态
morning
Desert Ant Labs:在设备上运行的本地快速模型
2026-09-09
1 阅读
约7分钟阅读
willwhitedc
字号:
今天,我们推出 Desert Ant Labs,这是一个欧洲前沿人工智能实验室,致力于构建固执己见的设备智能。我们相信实现高效智能的最佳途径从设备开始。我们正在为音频、视觉和文本构建小型的专用模型——每个模型都会在几毫秒内给出答案,并且运行无需任何成本,因此您可以将智能融入到每个产品交互中,而不受令牌成本或推理速度的限制。足够小,可以在五年前的手机上运行,足够快,可以在每一帧或每一次按键上使用,并且比您已经付费的 API 调用更好。前 18 个模型现已上线(12 个稳定版,6 个测试版),可通过一个适用于 Swift、Kotlin 和 JavaScript 的 SDK 访问。每个任务一个模型,每个模型都是在设备上完成该任务的最快方式:Voz:在 iPhone 上在两秒内转录 10 分钟的音频 - 比 Whisper 快 4.7 倍 - 每个单词都有开始和结束时间。 Clear:9MB 型号,可以在一秒钟内将五分钟的笔记本电脑录音转变为录音室质量的音频。编辑:以 27 种语言实时掩盖姓名、地址和卡号,这样它们就永远不会到达您的服务器。 Tongue:从三个单词中识别 84 种语言,模型大小为 2MB。语言 ID 准确度,Tongue 中的三个单词 · 2MB 0.933 293MB 检测器 0.887 Tongue 根据三个单词命名语言,2MB 时得分为 0.933,而 293MB 检测器得分为 0.887。这仅举几例。您可以在 Desertant.com/models 和 Hugging Face 上找到其他 14 个产品的完整规格和基准。每个型号每月最多可免费使用 10 万台活跃设备。没有令牌,没有登录。系统捕获的个人数据 Redact · 12MB 88.8 GLiNER-PII · 2.3GB 91.1 Rampart · 14.7MB 61.4 OpenAI 过滤器 · 3GB 60.2 Redact 从 12MB 模型中捕获了文本中 88.8% 的个人数据,接近 2.3GB GLiNER-PII。我们正在欧洲建立这个项目,在那里“设备上”是主权默认设置。数据永远不会离开客户的手,功能永远不会依赖于其他人的云,从未上传的内容永远不会被强制。我们是如何走到这一步的 五年来,我们一直采用设备优先的方法来构建我们的视频应用程序 Detail 。但当我们引入自动编辑来创建短片或播客音频增强等功能时,我们不得不退回到云 API。随着 Detail 的普及,我们的基础设施费用也随之增加。每隔几个月我就会寻找有用的设备上模型。我会在 Hugging Face 上寻找可以找到填充词或清理录音的模型。而且,每年六月,我们都会获得很棒的新工具来构建,但行业的发展速度不够快。基础就在那里:芯片、Core ML、研究。缺少的是该基础和在应用程序中实际实现功能之间的所有内容:您可以放入并附带几行代码的模型。因此,我们自己训练模型。事实证明,训练模型是一项产品设计挑战,而产品就是我们所知道的。我们设计的模型和本地推理在速度、质量和成本上击败了云服务,并且在任务本身上优于其他本地和云模型,而规模只是其规模的一小部分。我们使用 Clear 取代了杜比 (Dolby),以实现更好、更快的音频增强,并使用 Voz 使我们的设备上转录速度提高了 5 倍。我们还用 Clips 取代了 Claude Sonnet,这是我们的 284MB 模型,可在 5 秒内将 10 分钟的视频转换为十几个剪辑 - 速度比 Sonnet 快 10 倍,使用的能源少 470 倍,且质量相同。清晰音频增强速度,5 分钟音频 iPhone 16 Pro 302x MacBook Pro (M5) 345x Clear 可对设备上的剪辑进行增强、母带处理和重新编码,三者两胜,来自 9MB 模型。在手机上实现 302 倍实时。转录速度,30 分钟音频 Voz 319x Apple SpeechAnalyzer 78x Whisper large-v3-turbo 50x 在 M3 Ultra 上连续超过 30 分钟的实时因素。 iPhone 17 Pro 上的 Voz 达到 298 倍。 Detail 6 将随 iOS 27 一起发布,用我们自己的模型替换我们所有的云 API,完全在设备上运行。在过去的几年里,我们都在使用 LLM 进行构建,就好像它们只是另一个 API 一样。而且,在围绕通才前沿大脑的大肆宣传中,我们几乎忘记了它们并不是唯一的选择。我采访过的每一位开发人员都有一个愿望清单,上面列出了如果成本不是一个因素的话他们会构建的设备上模型,或者他们正在花费代币的功能,他们很乐意将其换成本地模型。每天以同样的方式运行十万次的调用:清理录音、标记照片、从句子中提取日期、在文本到达服务器之前捕获名称。这些都不需要前沿模型。 NVIDIA 自己的研究人员拆解了三个代理系统,估计他们对大型模型的 40% 到 70% 的调用可能会转至小型专用模型。计算费用已经支付 今年该行业将在数据中心上花费约 4500 亿美元。与此同时,全球出货量超过 10 亿部手机、平板电脑和笔记本电脑,其芯片的功能日益强大,非常适合
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱