智能AI
morning
逼近Claude!中国黑马27B模型与OpenAI同榜
摘要
新智元报道 就在上周,黄仁勋在高盛科技大会上说了一句让整个 AI 圈亢奋的话: 网络安全,很可能是 AI 的下一个杀手级应用。 几天前,OpenAI 刚刚官宣兑现了一年前的承诺——「自动化 AI 研究实习生」正式上岗,每 1 个人类研究员工作日的背后,已经有 3.1 个 Agent 工作日在跑。 巨头在抢跑,但最让人意外的事情发生在一张榜单上。 一支不到十个人的中国团队,把自己训练的 27B 模型...
CyberGym
Feyospace
OpenAI
Anthropic
Claude
507
Agent
27B
DeepSeek
Vera
2026-09-16
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 就在上周,黄仁勋在高盛科技大会上说了一句让整个 AI 圈亢奋的话: 网络安全,很可能是 AI 的下一个杀手级应用。 几天前,OpenAI 刚刚官宣兑现了一年前的承诺——「自动化 AI 研究实习生」正式上岗,每 1 个人类研究员工作日的背后,已经有 3.1 个 Agent 工作日在跑。 巨头在抢跑,但最让人意外的事情发生在一张榜单上。 一支不到十个人的中国团队,把自己训练的 27B 模型送上了 CyberGym。 这是一个让 AI 在真实软件环境里复现漏洞的高难度评测,同榜的是 OpenAI、Anthropic、DeepSeek 这些名字。 这家公司叫万衍(Vera P raxis)。它研发的网络安全模型 Feyospace,在 CyberGym 的 Model-focused 纯模型能力对比中取得 63% 的成功率,逼近 Claude Sonnet 4.6 的 65.2%。此前,这类榜单的前列长期由 OpenAI、Anthropic 等巨头及其大模型占据;如今,一支不到十人的小团队凭借面向安全场景的专业化训练,进入了这场由巨头主导的竞争。 但比跑分更值得关注的,是他们想做的事: 把真实业务变成 AI 持续进化的引擎。做安全、做量化、做音频、做 App——每一块业务都不只是为了挣钱,而是要在经营过程中不断撞上模型还搞不定的问题,让专家帮模型补上这一课,然后让模型下次自己搞定。 业务跑得越远,模型学得越多;模型越强,业务就能挑战更难的事。 万衍赌的就是这个飞轮。 从 CyberGym 上的专业模型突破出发,万衍 Vera Praxis 正在构建一家以模型研发为核心、从真实经营中持续获得新能力的 AI 公司。 它瞄准的长期机会,是让业务增长与模型进步相互推动。 不到十人的团队 打开高难度专业智能的突破口 一支不到十人的安全研发团队,将自己的模型带上了汇集 OpenAI、Anthropic、DeepSeek 等机构模型的 CyberGym 榜单。 截至 2026 年 9 月 13 日,万衍的 Feyospace-v1 在该榜单上的漏洞复现成功率达到 63.0%,接近 Claude Sonnet 4.6 的 65.2%。 图 01 :Feyospace-v1 进入 CyberGym 榜单 官方 Model-focused 榜单局部,Feyospace-v1 成功率为 63.0%。所示条目于 2026 年 9 月 14 日核验。成绩由各团队自行评测提交,各条目的运行框架见图。来源:CyberGym 官方榜单。 CyberGym 将模型放进可以执行的软件环境,要求它理解代码、构造触发漏洞的测试,并根据运行反馈不断调整。评测包含来自 188 个软件项目的 1,507 个真实历史漏洞任务,考验模型能否把分析、行动与验证连接起来,真正完成复杂工作。 图 02:在真实软件环境中检验模型 CyberGym 官方评测示意:提供漏洞描述与修复前代码,让 Agent 生成测试,再通过实际执行检验漏洞是否复现。本文引用其历史漏洞复现基准,包含 188 个软件项目的 1,507 项任务。来源:CyberGym 官方测评说明。 安全是检验这种能力的高难度场景。Anthropic 的 Nicholas Carlini 等研究者在研究未知漏洞发现时指出,成熟代码长期接受审计,容易发现的问题大多已经被修复,剩余问题因此更能检验模型能力。面对复杂系统,模型需要找到关键线索、提出正确假设,并让判断经得起实际运行的验证。 图 03:同一套后训练,提升三个基座 论文 Figure 10:完整 1,507 项任务上的成绩。三个 Feyospace 版本均优于各自基座;其中 27B 提升 8.73 个百分点。闭源模型为开发者报告值,开源模型与 Feyospace 使用共同的 Claude Code 设置。来源:Feyospace 公开论文 Figure 10。 这组结果展示了小团队通过专业化的训练设计与工程能力,显著提升模型表现的可能。万衍已经交出可量化的专业模型训练成果:在统一评测设置下,同一套后训练方案提升了三个不同基座的任务表现。 更重要的是,在另一项针对完整漏洞利用的专项实验中,团队将 Qwen3.8-Flash-Next 的 ExploitBench 成功率从 12.96% 提升至 19.05%,增加 6.09 个百分点;后训练检查点在两道 V8 任务上达到 T3(target-specific primitive,目标特定原语)层级。这说明,针对性训练能够推动模型从“复现漏洞”进一步迈向构造目标相关利用原语,为小模型走向安全领域的工程化应用提供了积极信号。 安全也正在成为 AI 行业关注的重要应用方向。9 月 10 日,英伟达 CEO 黄仁勋在高盛科技大会上表示,网络安全可能成为 AI 下一个主要应用场景。 对万衍而言,Cyber 是这条路径的起点。公司要进一步回答的是:怎样让高价值专业工作的经验,持续成为模型进步的来源? 把少数专家的关键判断 变成模型可以规模化运用的能力 在 Feyospace 技术报告披露的一项浏览器引擎任务中,模型已经在调试环境中触发异常,却无法在默认设置下复现。安全专家补充了一个关键的运行条件判断,帮助它继续推进。 团队将这条洞见纳入完整的推理与行动记录,再继续执行和验证。这一方法被称为 Kreator:把专家在关键节点的判断,转化为模型可以学习的解决问题过程。技术报告第 2.5 节 把专家洞见变成可学习的过程 在 Feyospace 技术报告披露的一项浏览器引擎漏洞利用任务中,模型已经在调试环境中触发异常,却无法在默认设置下复现。安全专家补充了一个关键的运行条件判断,帮助模型继续推进。团队将这条洞见纳入完整的推理与行动记录,再继续执行和验证。这一方法被称为 Kreator:把专家在关键节点的判断,转化为模型可以学习、复用和检验的解决问题过程。 专家与模型的思考方式存在结构性差异:专家往往依靠多年经验形成的隐性判断,能够迅速识别关键条件;模型则需要看到清晰、可观察、可复现的中间步骤,才能理解判断依据,并在新任务中复用这一方法。若只保留最终答案,模型可能学会表面表达,却无法掌握排查、决策和验证的过程。因此,Kreator 不只是记录“做了什么”,还要保留“为什么这样做”以及“如何确认有效”,让专家经验真正转化为训练信号。 其中一项重要的技术选择,是保留足够的中间推导与行动依据,让学生模型能够学会解决问题。团队观察到,过度压缩的强模型推理记录,可能让较小模型模仿了表达,却没有掌握推导。因此,教师模型、训练材料与学生能力需要彼此匹配,并以训练后的实际结果检验这种匹配是否有效。 图 04:环境、执行与证据共同把关 论文 Figure 2 左半(局部):构建代码、安全与硬件环境,收集轨迹,再进行执行验证和证据审计。85% / 9% / 6% 分别表示已成功轨迹的接受、复核与拒绝比例。来源:Feyospace 公开论文 Figure 2、第 3 节。 围绕这一目标,万衍将可重复执行的环境、任务验证、专家介入与后训练组织起来。团队最终保留了约 16.4 万条训练轨迹,组成包含代码、安全及硬件任务的混合训练
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱