首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

Jev:新前沿模型便宜 40-400 倍,速度快 20-200 倍

2026-09-16 1 阅读 约5分钟阅读 albelfio
分享:
字号:
TypeSafe Models 创始人迪奥戈·阿尔梅达 (Diogo Almeida) 多年来一直在聊天方面表现出色,那么所有自动化都在哪里呢?这是过去四年来我一直在思考的问题。在 OpenAI,我帮助构建了一些方法,使语言模型在遵循指令和与人交谈时非常有用。这项工作最终成为 ChatGPT 背后的研究。当时,我认为聊天模型也许会带来通用人工智能,但尽管有大肆宣传,但我很明显地发现,其中确实缺少了一些东西。经过两年的潜行、无数的技术挑战和研究突破……我非常兴奋地宣布,今天,TypeSafe AI 发布了我们的第一个 System One 模型:一类新的前沿模型,旨在做出软件可以直接使用的快速、结构化决策。我们构建了一个完全专注于自动化的新堆栈:采用新的模型架构、可实现最大效率的并行采样器以及我们称为“校准决策强化学习”(RLCD) 的训练方法。我们的第一个公开模型是 Jev ,今天可以抢先体验。与现有的法学硕士相比,Jev 在系统一任务上实现了相似的智能水平,同时速度和效率提高了两个数量级。虽然 Jev 放弃了字符串生成,但它针对结构化输出进行了优化,并且不会产生幻觉。将 Jev 视为前沿智能函数调用:输入非结构化状态,输出键入概率决策。特别的索赔需要特别的证据,因此请参阅下面的收据。 💅 前沿、新旧现有法学硕士系统一 + Jev 通过人类反馈强化学习 (RLHF) / 可验证奖励强化学习 (RLVR) 校准决策强化学习 (RLCD) 针对人类偏好进行优化:人类评分者喜欢的评论和聊天回复。可验证的奖励:可以通过编程方式验证的输出。校准决策:以认知上诚实的概率回答系统一任务。输入非结构化数据(例如文本),重点是顺序消息。非结构化数据(例如文本),重点是结构化程序状态。输出字符串/生成的文本。字符串很灵活,可以是任何东西:聊天响应、代码、幻觉、拒绝,甚至类型安全的结构化值。要被软件使用,响应需要被解析+验证。人工智能脱轨的风险也始终存在。类型安全的结构化值。可能的输出和结构是预先定义的。该模型永远不会出现类型错误。所有答案都附有校准概率和置信度分数。顺序采样。一次生成一个令牌,每个令牌都以最后一个令牌为条件。平行线。在单个查询中生成所有输出。令人难以置信的高效和硬件感知。成本输入代币:从 0.20 美元到 10 美元/MTok。输出代币:比输入代币贵约 5 倍。输入代币:0.042 美元/MTok(每十亿代币 42 美元)。输出代币:免费(太便宜而无法计量)。速度 前沿型号的端到端响应时间为 3 至 329 秒。与人类交互的速度足够快,但集成到代码中时却是一个很大的瓶颈。 TypeSafe 的端到端响应时间为 70ms-500ms。对于 System One 形状查询的相同水平的前沿智能,速度可以提高 40 倍到 200 倍。置信度即使提示进行置信度估计,模型也往往过于自信且不一致。如果一个模型可以在 95% 的时间内完成某项任务,但没有说明何时是 5%,则它无法自动执行该任务。始终在每个输出中传达信心和不确定性。校准:更高的置信度意味着更高的准确性。更一致:针对相似的输入返回相似的答案。用例 人机交互任务(聊天机器人、副驾驶、编码代理)。普遍而强大,但需要人类监督,因为他们的自由也意味着他们可能会偏离轨道。可验证的问题(数学证明、内核优化)。当可以廉价且自动地检查正确性时,法学硕士可以生成、测试和迭代,直到找到可行的东西。演示。字符串的灵活性使其能够令人难以置信地快速制作有时只能工作的原型。人工智能驱动的工作流程/智能 if 语句。结构化输出作为模糊决策规则插入普通软件中:分类、路由、评分、提取或分支,其中手写逻辑太脆弱。周围的代码限制了它们的自由,使它们更容易组成可靠的系统。大数据上的地图缩减。将 PB 级数据转化为特征和见解。实时应用程序。 100 毫秒的速度意味着您可以在 UX 至关重要的应用程序中使用 AI。验证一切。对 LLM 提示、推理轨迹和/或输出进行评分、判断、验证、防护和检测越狱。证据/技术结果 我们喜欢怀疑论者,我们自己也是怀疑论者。有一些说法您可以轻松验证: 每次调用的速度:我们确实是那么快,尽管我们发布的评估是 g
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱