开发者生态
morning
推出 HN:Speko (YC S26) – 用于语音 AI 的 OpenRouter
摘要
Hi HN! I'm Bek, founder of Speko, a platform that finds an optimal combination of speech-to-text, LLM, and text-to-speech models, given your constraints, among all our public benchmarked options, and ...
and
the
models
Speko
speech
you
voice
new
The
for
2026-08-18
1 阅读
约5分钟阅读
abdik
字号:
嗨,HN!我是 Bek,Speko 的创始人,该平台根据您的限制,在我们所有的公共基准选项中找到语音到文本、LLM 和文本到语音模型的最佳组合,并告诉您原因。演示:https://youtu.be/no2LY2gRh-c 典型的生产语音代理是三个模型的集合:STT、LLM 和 TTS。每一层都提供十几个可靠的供应商,并且每个月都有新型号上市。几乎每个人都会评估一次,选择自己选择的堆栈,并且从不重新检查,因为从供应商切换到另一个供应商涉及另一次集成和有关数字的争论。结果是您使用运行上一季度模型的语音代理,同时还有更好、更便宜的选择。在创立 Speko 之前,我作为联合创始人兼首席技术官花了四年时间为亚洲各地的企业构建 10 多种语言的语音代理。每次出现新的语音模型时,我们都会重复相同的仪式:聘请母语评估员,将其与我们现有的堆栈进行基准测试,如果有改进则更新产品。 Speko 将此流程转化为 API。一个每天处理数千个电话的团队告诉我们:“我们实际上可以进入这个仪表板,切换模型,它会为我们做这件事。”工作原理:您发送包含优化标准(准确性、延迟、成本或平衡)、语言和区域的请求。路由器过滤我们针对给定约束组合测量的模型,对它们进行基准测试,选择获胜者,并返回包含提供者、模型名称和分数的标头的响应。网关预取签名的会话计划,因此新会话直接从内存中拨打提供商;当呼叫者等待时,没有控制平面往返。故障转移仅在连接设置阶段发生:如果提供者拒绝连接尝试,我们将开始连接到亚军。一些客户故事:一位创始人来找我们,根本不知道该选择什么:他给了我们他的用例,现在通过平台路由所有内容。一个物业管理人工智能在 Python 中运行 LiveKit,并且自推出以来就没有更新 STT 或 TTS:他们不知道他们的 STT 在通话中的错误率很高,存在更好的选择,而且交换总是看起来像一个研发项目。一个团队不知道为西班牙语选择哪种模型。医疗团队不知道哪种 STT 能最好地处理医学词汇。在每种情况下,我们都帮助从基准中找到正确的堆栈,现在它们通过了我们。测量部分是公开的:我们在不同日期的运行中将相同的输入传递给一个区域中的每个模型,并发布面板,包括那些我们的选择比替代方案表现更差的面板。发布演示回答了哪一个 30 秒的剪辑听起来更好;制作询问哪一个模型能在第八分钟内幸存下来,因此我们测试了即兴演讲、金钱和日期、十分钟的镜头,然后排名发生了变化。我们在盲目的头对头聆听投票中训练了一个自动评分器,以确保 TTS 的自然度;对于从未见过投票的提供商,它会根据评分者彼此同意的次数,选择我们评分者所做的相同获胜者。我们自己不训练或销售模型,这正是我们保持排名公正的方式。我们还为那些想要避免音频路径上的额外网络跃点并且不想与我们的云共享密钥的团队开源了网关(https://github.com/SpekoAI/gateway,MIT):一个 Go 二进制文件,在代理容器中作为 sidecar 运行,通过 Unix 套接字使用一种本地协议,固定提供商主机并附加您的密钥。在 BYOK 模式下,它根本不与我们通信。请注意,默认情况下启用匿名、无内容遥测,并且一个环境变量将其禁用。成本:网关和 BYOK 设置将永远免费,我们通过综合计费对托管路由器和托管密钥进行收费。自 6 月下旬开始批量以来,外部使用量平均每周增长约 25%,在发布几周前就已提前加载。我希望得到社区的反馈:您现在如何选择语音模型,是什么让您信任第三方基准?评论网址:https://news.ycombinator.com/item?id=49332751 积分:7 # 评论:0
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱