首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

JEV 和 System One 模型:校准胜过准确性

摘要

Last week TypeSafe AI released Jev , which it calls the first “System One model”: a model that does not chat, does not write, and does not reason step by step. It answers structured questions about an...

the and Jev not TypeSafe questions one model does structured
2026-09-25 1 阅读 约5分钟阅读 pansuriyakartik
分享:
字号:
上周 TypeSafe AI 发布了 Jev,它称之为第一个“System One 模型”:一个不聊天、不写字、不一步步推理的模型。它在一次前向传递中回答有关输入的结构化问题,并为每个答案附加一个概率。大多数报道都集中在速度上。我认为更有趣的说法是关于校准的,因为校准悄悄地限制了我发货的每一个生产分类器,包括我的 COMPSAC 论文中的分类器。这篇文章是我尝试弄清楚 Jev 实际改变了什么、它在真正的 ML 堆栈中的适合位置,以及我打算如何测试该声明而不是相信它。我的家乡是为一家批发分销商构建生产机器学习(ERP 内的路由、预测、分类),并且我在 IEEE COMPSAC 2026 上发表了一项关于预测拉取请求接受情况的泄漏感知研究。Jev 处于早期访问阶段,我还没有 API 访问权限,因此下面有关其性能的所有内容都是 TypeSafe 的声明,并标记为此类。最后的实验设计是我当天要做的。根据 TypeSafe 的发布帖子,Jev 围绕三个想法构建:非自回归输出。普通的 LLM 一次生成一个标记,并且每个标记都依赖于最后一个标记。杰夫立即给出了完整的结构化答案。这就是速度的来源:TypeSafe 表示端到端的时间为 70-500 毫秒,比同等任务的前沿法学硕士“快 40 倍到 200 倍”。 1 输入问题,而不是提示。您发送一个状态(文本、结构化数据或消息历史记录)和一组问题。每个问题都是以下三种类型之一:选择(从一组中选择,获取每个选项的概率)、得分(针对有序级别的比率,获取连续得分和分布)或 noul(是/否,作为陈述正确的概率返回)。 2 请求中的每个问题都是并行评估的,因此添加问题几乎不会改变延迟。校准培训。该模型使用 TypeSafe 所谓的校准决策强化学习 (RLCD) 进行训练。规定的目标是“认知上诚实的概率”,而不是聊天模型所调整的人类偏好或可验证的奖励目标。 1 约束与功能同样重要。 Jev 无法生成自由文本。一个选择题最多支持 255 个选项。还没有图像输入。定价为每百万个输入代币 0.042 美元,输出代币免费,目前通过候补名单进行访问。 1 所以它不是一个更小的 GPT。它更接近于一个非常快速、非常通用的表格分类器,它读取非结构化输入并以您应该信任的信心返回一个类型化的决策。这是我自己论文中我不断回顾的部分。我们仅使用提交时可用的信号来预测拉取请求是否会被合并。随机森林的 F1 为 0.958。大多数类别的基线,即“合并”到所有内容,达到了 0.957。实际上区分有用模型和无用模型的数字是 ROC-AUC:森林为 0.676,而基线为 0.500。即便如此,我们也明确地写道,这些模型“不应被视为完美校准的概率模型”,并且适合分类,而不适合自动接受/拒绝决策。 3 这并不是某个数据集的怪癖。这是生产分类器的正常形状:精度很早就饱和。对于不平衡问题,大多数可用的精度都是免费的。困难的部分是排名和信心。下游逻辑需要概率,而不是标签。 “如果模型的确定性低于 80%,则将此订单转为人工审核”仅在 80% 意味着 80% 时才有效。如果模型对 70% 的时间正确的事情给出 0.95,那么您设置的每个阈值都是谎言。在通常的指标中,错误校准是不可见的。 F1、准确率、甚至 AUC 都是阈值或排名指标。模型可能具有良好的 AUC 和糟糕的校准,直到构建在其之上的业务规则开始失灵时您才会知道。标准修复是事后的:普拉特缩放、等渗回归、温度缩放。它们可以工作,但它们是另一个合适的组件,会随着数据的变化而漂移。如果我没看错的话,Jev 所说的是模型中的概率已经是诚实的,因为诚实是训练目标。如果这适用于 TypeSafe 自己的基准之外的任务,它就会从生产机器学习系统中消除一整层粘合剂。这个“如果”就是整个问题,并且是可测试的。我在一家批发分销公司从事机器学习工作。几乎没有一个是聊天。其中大部分都是位于两个系统之间的小而重复的决定: 今天的决定 为什么它很烦人 杰夫的形状适合吗?此入库订单是否属于需要人工处理的例外情况?规则加一个小分类器规则腐烂;重新训练分类器是一个项目 是:有阈值的 noul 这个新的 SKU 属于哪个监管产品类别?关键词规则,手动清理 厂商描述不乱
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱