首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

Ornith-1.5:从自我搭建到自我完善

2026-08-20 1 阅读 约6分钟阅读 CommonGuy
分享:
字号:
今天,我们推出 Ornith-1.5,这是通过端到端自我改进构建基础模型的重要一步。 Ornith-1.5 将 Ornith-1.0 中引入的自我脚手架框架扩展为更完整的自我改进循环:模型提出新任务,生成特定于任务的脚手架,并生成强化学习的解决方案,不断创造新的学习体验并从中进行改进。 Ornith-1.5 跨越三个模型尺度:397B MoE、35B MoE 和 9B密集。 Ornith-1.5 专为跨推理、代理和编码任务提供强大的通用智能而设计,在各种基准测试中的规模相当的开源模型中实现了最先进的性能。 Ornith-1.5-397B 在 Terminal-Bench 2.1 上的得分为 86.1,在 DeepSWE 上的得分为 56.0,与 Claude Opus 4.8(85.0 和 59.0)相当,同时优于类似规模的领先开源模型,包括 GLM-5.2(82.7 和 46.2)和 DeepSeek-V4-Flash-0731(82.7 和 59.0)。 54.4)。另一方面,Ornith-1.5-9B 及其量化的 Ornith-1.5-9B-Mobile 版本可以轻松部署在 iPhone 和 Android 设备上,同时大大优于 Gemma 4-31B 和 Qwen 3.6-35B 等较大型号。在旗舰规模上,Ornith-1.5-397B 在 Terminal-Bench 2.1 上达到 86.1,在 DeepSWE 上达到 56,在两个基准测试中与 Claude Opus 4.8 相当,并且优于类似规模的领先开源模型,包括 GLM-5.2 和 DeepSeek-V4-Flash-0731。 Ornith-1.5-35B 在所有编码和代理基准测试中都显着优于其类似大小的同行 Qwen 3.6-35B,尽管每个令牌仅激活 3B 参数,但它在代理编码方面的表现也明显优于密集模型(Gemma 4-31B 和 Meta 的 Muse Glimmer-30B)(在 Terminal-Bench 上为 68.5 vs. 43.4 和 51.7) 2.1;79.0 与 SWE-Bench 验证的 52.0 和 76.0)。可边缘部署的 Ornith-1.5-9B 也提供了非常强劲的结果,在 Terminal-Bench 2.1 上获得 47.0,在 SWE-Bench Verified 上获得 70.6。尽管是紧凑型 9B 参数型号,但它的性能可与 Gemma 4-31B 和 Qwen 3.6-35B 等更大型号的性能相媲美或超过。通过自行生成的任务、工具和解决方案进行自我改进 Ornith-1.5 扩展了 Ornith-1.0,将自我改进循环从脚手架和推出优化扩展到联合优化任务生成、脚手架构建和解决方案推出。 Ornith-1.5 不依赖于一组固定的人工管理任务和手动设计的工具,而是不断生成新的训练任务,发现解决这些任务的有效策略,并通过强化学习改进策略。每个训练周期分三个阶段进行。给定环境或代码库、有关任务类型的高级指令以及对模型之前的任务解决历史记录的访问,系统会提出逐渐困难的任务,这些任务超出了模型已经解决的范围,暴露了能力差距并不断推动训练前沿。对于每项任务,模型都会生成或完善特定于任务的支架——用于解决问题的指令、工具、分解策略和编排。根据任务和脚手架,该政策会推出解决方案。推出的奖励会在所有三个阶段传播,因此系统不仅可以学习产生更好的解决方案,还可以生成更有用的训练任务并构建更有效的支架。通过重复训练,这会创建一个封闭的自我改进循环,其中更强大的策略能够生成更困难、信息更丰富的任务,不断发展的支架会发现更好的方法来激发模型的能力,而更高质量的推出会提供越来越有效的学习信号。 Ornith-1.5 不依赖静态训练分布或手工设计的代理设计,而是不断扩展自己的课程并调整其解决问题的策略,推动推理、编码和代理任务的持续能力提升。任务奖励对于问题→脚手架→推出设置,我们使用三个信号定义任务奖励:有效性、前沿难度和新颖性。令 \(q\) 表示生成的问题,\(s\) 表示其支架,\(\{\tau_i\}_{i=1}^{N}\) 表示一组解决方案推出。我们定义 \[ R_{\text{task}} = \underbrace{V(q,s)}_{\text{是否有效且可验证?}} \times \underbrace{D\!\left(q,s,\{\tau_i\}_{i=1}^{N}\right)}_{\text{是否处于正确的难度?}} \times \underbrace{N(q)}_{\text{是否足够小说?}}。 \] 这里,\(V\) 衡量生成的任务和支架是否形成有效且可验证的学习环境,\(D\) 衡量任务是否基于推出性能接近模型的当前能力边界,\(N\) 衡量相对于先前生成或训练的任务的新颖性。乘法公式鼓励提议者生成同时满足所有三个属性的任务:有效、适当
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱