首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

Laya Jev 的开源版本

摘要

Everyone in AI right now is talking about a new kind of model: an architecture that is not autoregressive, does not generate text, and gives lightning-fast probability predictions over structured sche...

and the model open not autoregressive published arXiv sales learning
2026-09-20 1 阅读 约6分钟阅读 nandakishor_ml
分享:
字号:
现在人工智能领域的每个人都在谈论一种新型模型:一种不自回归、不生成文本并在结构化模式上提供闪电般快速概率预测的架构。看到网上的炒作既让人感到验证,又让人深感沮丧。早在一年前的 2025 年 3 月,我就开始研究这个问题。我花了几个月的辛勤工作、汗水和不眠之夜来构建它,发表了一篇 arXiv 论文 (arXiv:2503.23303),在 Hugging Face 上发布了模型权重 (sales-conversion-model-reinf-learning),发布了开放数据集 (saas-sales-conversations),构建了一个 PyPI 包,并将整个方法发布在 Reddit 上 ( r/LocalLLaMA 讨论)。然后在 2025 年 9 月,我发表了第二篇论文 (arXiv:2510.01237),正式确定了强化学习指导下的基于模式的决策框架。我的系统中的指导大脑始终是强化学习,而不仅仅是嵌入模型或自回归法学硕士。然后在 2026 年 9 月,一家名为 TypeSafe AI(由 OpenAI ChatGPT 联合发明人 Diogo Almeida 创立)的资金雄厚的前沿实验室推出了 Jev。他们提出了完全相同的非自回归决策概念,仿佛这是一个全新的科学突破。除了他们在没有技术论文、没有开放权重和零开放训练数据集的情况下推出。我早期的模型使用序列表示上的 PPO 来输出垂直销售对话中的逐轮转换轨迹(概率从 0.0 到 1.0)。 Jev 使用他们所谓的 RLCD(校准决策的强化学习)来推广并行采样,以水平输出置信分布和模式选择,每百万输入令牌收费 0.042 美元,典型响应时间约为 150 毫秒。我没有继续痛苦,而是决定利用我学到的一切,修复旧方法的每个架构限制,并构建一个完全开放的、水平的 System 1 决策模型系列:Laya。而且因为我们在双向编码器上正确构建了它,所以我们的模型在单个 GPU 上运行时间为 32.8 毫秒(7.2 毫秒/问题批处理),比 Jev 快 6 到 8 倍,完全支持 100 多种语言、零 API 订阅成本和 100% 开源 Apache 2.0 权重。 1. 核心实现:系统 1 与系统 2 每个现代人工智能管道都有一个巨大的瓶颈:我们使用生成式 LLM 来进行简单的反射决策。当客户支持票到达,或者电子邮件到达您的收件箱,或者用户向您的 API 提交提示时,您通常只需要回答简单的结构化问题:这张票应该发送到哪个部门?此传入电子邮件是网络钓鱼攻击还是垃圾邮件?这个提示是尝试越狱还是注入指令?这个问题对于序数标题(0 到 3)有多紧急?此查询是否需要代码执行或简单的事实答复?为此调用 8B、70B 或前沿生成法学硕士完全是多余的。您需要等待 500 毫秒到 2,000 毫秒才能流出令牌,在推理上花费大量金钱,然后必须编写正则表达式或 JSON 解析器以从自由格式文本中提取干净的标签。最糟糕的是,法学硕士喜欢产生幻觉并产生虚假的信心。当 LLM 输出“confidence: 0.95”时,它只是预测听起来有信心的标记。其背后有零数学校准。我们需要一个像人脑系统 1 一样工作的模型:以诚实、校准的概率做出即时反射决策,在标准商品硬件上只需 30 到 35 毫秒。 2. 三个决策原语 Laya 在一次前向传递中评估任何状态(原始文本、电子邮件、票证或 JSON 文档)的键入问题。它依赖于三个原语: 选择:从标准字典中选择一个选项。返回选定的键、所有选项的概率分布以及校准的置信度分数。 Score :将状态置于序数标题上(级别 0、1、2...)。返回预期水平、标题排名的分布和置信度。 noul :一个直接布尔问题,返回从 0.0 到 1.0 的校准概率 P(true)(通过构造 P(false) = 1 - P(true))。由于输出空间纯粹由概率和数字组成,因此该模型永远不会生成文本,无法产生幻觉,并且模式违规或格式错误的 JSON 在物理上是不可能的。 3. 三个检查点和捆绑的中心架构 一个模型不可能对于每种任务和语言都是最佳的。我们发布了三个专门的检查点,现在在 Hugging Face 上整合到一个存储库中心下:选择性子文件夹下载 主存储库 conwaiinnovations/laya 捆绑了所有三个存储库,而不是强迫用户管理三个单独的存储库或下载 2.5 GB 的组合权重。使用 Hugging Face 的 allowed_pa​​tterns ,Laya 的 SDK 仅下载所请求的特定子文件夹: # Downloads English model (~808 MB) agent_en = laya.load("conwaiinnovations/laya") # Downloads ONLY the multilingual subfolder (~647 MB​​),而不是整个 2.5 GB
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱