开发者生态
morning
Redis之父质疑Jev狂热!绝大多数开发者其实不需要它
摘要
Redis 作者 Salvatore Sanfilippo(antirez)公开给 Jev 热潮泼冷水,称围绕它出现的炒作,暴露了 AI 泡沫中的多数人“分不清什么重要、什么不重要”。 2026年9月21日,antirez 在 X 上发文,对近日席卷开发者社区的新模型 Jev 发表评论。这条推文迅速获得超过11.6万次浏览,在 Jev 的支持者与质疑者之间引发了新一轮争论。 “Jev 或许有一些很...
Jev
TypeSafe
antirez
Almeida
RLHF
Diogo
ChatGPT
Code
什么不重要
开发者
2026-09-23
1 阅读
约10分钟阅读
Tina
字号:
Redis 作者 Salvatore Sanfilippo(antirez)公开给 Jev 热潮泼冷水,称围绕它出现的炒作,暴露了 AI 泡沫中的多数人“分不清什么重要、什么不重要”。 2026年9月21日,antirez 在 X 上发文,对近日席卷开发者社区的新模型 Jev 发表评论。这条推文迅速获得超过11.6万次浏览,在 Jev 的支持者与质疑者之间引发了新一轮争论。 “Jev 或许有一些很狭窄的应用场景,但围绕它出现的炒作,恰好说明了 AI 泡沫中的大多数人根本分不清什么重要、什么不重要。”antirez 写道,“与 AI 领域正在发生的其他事情相比,Jev 只是一件很小的事,热度却爆发了。” Jev 由 TypeSafe AI 于9月15日发布。该公司创始人 Diogo Almeida 自称参与了许多堪称 OpenAI“金曲合集”的项目,包括 GPT-4、ChatGPT,以及 RLHF,也就是 InstructGPT。“可以说,我所在的团队基本上创造了‘后训练’这个概念。” TypeSafe 将 Jev 定位为“System One 模型”:它不生成文本,只根据输入数据,从预先定义的选项中进行分类、评分和判断,并返回相应的置信度概率。 按照 TypeSafe 公布的数据,Jev 的调用延迟约为70至500毫秒,每百万输入 token 的价格仅为0.042美元,输出免费。在该公司自行设计的工作流评测中,Jev 比用于对比的前沿大模型最高快约194倍、便宜约445倍。 这些数字在开发者社区引发了近乎狂热的反响。上线24小时内,Vercel AI Gateway 上已有近13%的付费团队使用 Jev;发布36小时后,TypeSafe 收到的内测申请涉及约14万名开发者。AI 开发者 Theo Browne 形容,自己的 X 时间线上几乎一半内容都在讨论 Jev。用它玩《毁灭战士》、操作网页、压缩上下文、给邮件分类和审查 Agent 工具调用的演示层出不穷。 antirez 的质疑,指向的正是这种热度是否与 Jev 的技术分量相称。 在他的推文下,开发者 Giuseppe Cannizzaro 表示,自己只是对“0%幻觉”和“会做决定的 AI”这类宣传略带讽刺,就在多个社交平台遭到辱骂。“人们已经失去理智了。”他写道。 这场争论由此越过了 Jev 本身。开发者真正需要回答的是:TypeSafe 究竟创造了一类新的智能模型,还是把已有多年的分类技术,重新包装成了一个速度更快、接口更好用,也更擅长制造传播效应的产品? 解决大模型难以进入软件后台的问题 要理解 TypeSafe 对 Jev 的定位,需要回到 Diogo Almeida 创办这家公司的起点。 Almeida 曾参与开发让大模型学会遵循指令、与人对话的训练方法。但几年后,他开始对这条路线产生怀疑:大模型已经非常擅长聊天、写作和编程,真正能够脱离人类监督、在后台稳定运行的软件自动化却没有同步出现。 “尽管 LLM 已经展现出很强的智能,真正被自动化的工作目前仍然只是一个可以忽略不计的零头。” 他将原因部分归结于 RLHF,也就是基于人类反馈的强化学习。RLHF 的训练目标,是让人类更喜欢模型给出的回答。这套方法非常适合 ChatGPT、Claude Code 和 Codex 等有人参与的产品,却很难直接支撑无人值守的软件自动化。 按照他的划分,ChatGPT 和 Claude Code 仍属于 AI 的“辅助时代”,“因为Claude Code 仍然建立在 RLHF 之上”。而真正的自动化通常发生在服务器后台:模型接收程序状态,作出一个确定形态的判断,软件立即执行下一步,人类甚至不会看到模型返回了什么。 TypeSafe 想推动的是图中右侧的“智能软件”。模型不再包办整条流程,而是被拆成一个个嵌入软件分支的智能判断。代码继续负责确定性的计算、执行和流程控制,模型只在规则难以写清的节点判断“这是什么”“应该走哪条路”“风险有多高”。 TypeSafe 因此重新设计了模型的输出形式和训练目标。Jev 放弃自由文本生成,目前提供三类问题原语:判断一个陈述成立的概率、从给定选项中作出选择,以及依据一套标准进行评分。 TypeSafe 将这种接口概括为: 输入非结构化状态,输出带类型的概率决策。 TypeSafe 希望借此把 AI 从需要全程参与任务的助手,变成可以嵌入软件分支的基础组件。这个构想很有吸引力,但也划定了 Jev 的能力边界:它主要改变了语义判断的成本、延迟和输出形式,并没有因此获得复杂推理能力。 在近期接受 Latent Space 播客的深度访谈中,Diogo Almeida 本人也对 Jev 的定位和边界给出了清晰界定。他反复强调,Jev 是“为软件而生,而非为上帝而生”(Prod, not God),其核心目标是让代码成为消费者,而不是与 ChatGPT 争夺聊天场景。 但开发者真的需要它吗? “智能水平大致和一个switch语句相当” TypeSafe 公布的“快193.6倍、便宜444.6倍”,来自公司自行设计的四套工作流评测。四项任务以相同权重计算平均准确率、成本和耗时;评测所用的参考标签,由 GPT-6 Astra 与 Claude Fable 5.1 在高推理设置下的回答平均生成。官方同时承认,这些数字处在现实收益的高端,评测工作流由公司内部人员制作,可能存在偏差。 即便如此,Jev 在这类任务上的速度和成本优势仍然相当明显。它放弃自由文本生成,不需要逐个 token 写出字段名、标点、解释和完整 JSON,只输出预先定义的选择与概率。当一次任务包含多道相互独立的问题时,Jev 还可以并行计算。 但这也意味着很多人会本能地把速度优势理解成智能能力的跃升。 System One 的概念来自 Daniel Kahneman 的《思考,快与慢》。系统一对应人脑快速、直觉式的判断,也就是几乎不费力就能完成的那部分认知。你看到一个人,会立刻判断:“对,他的衬衫是蓝色的。”系统二则对应缓慢、审慎的推理。 按照 TypeSafe 的划分,Jev 负责第一类任务,推理模型继续负责第二类任务。 Theo Browne 对 Jev 的概括很形象:把它看成一个“聪明的 if 或 switch 语句”。程序提供当前状态和有限选项,它立即决定下一步走哪条分支。邮件是否属于垃圾邮件、工单应该交给哪个团队、哪条告警需要优先处理、搜索结果如何排序,都是适合它的任务。 但是,“它的智能水平大致和一个 switch 语句相当。它适合分类,却不知道怎样浏览整个代码库并作出高质量决定。” 这就是 Jev 的能力边界。它放弃长文本生成和测试时推理,换来稳定延迟与极低成本。遇到需要综合背景、建立中间结论、反复检查假设的任务,这种设计会受到明显限制。 还有人给antirez反馈说,这个“狭义”的使用场景是Agent Loop中的每次工具调用。 X上有一个巨火的视频也是源自这个场景。 开发者 Tamara Tran 用 Jev 为 Claude Code 历史中的工具调用逐项打分,删除被判断为无关的记录,将一段约15.6万 token 的对话迅速压缩到约6
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱