首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

神秘“牛阿尔法”突袭OpenRouter,性能超过神鬼寓言5?全网盲猜智谱还是小米

2026-08-22 1 阅读 约10分钟阅读 李冬梅
分享:
字号:
电影圈的“牛来”刚刚火遍全网,大模型圈也来了一头身份不明的“牛”。 今天上午,OpenRouter 没有举行发布会,也没有公布技术报告,只用一个忍者表情放出了一款代号为“Ox Alpha”的神秘模型。“Ox”在英文中正有“牛”的意思,于是,一场属于 AI 行业的“牛来”也开始了。 OpenRouter 对这款神秘模型的介绍很短,基本就一句话概括了:这是一款面向高效编程、长时间 Agent 任务和真实生产环境的前沿模型,拥有100万Token上下文窗口,同时支持文本、图像和视频输入。 除此之外,模型参数、训练数据、架构、基准成绩以及开发团队全部处于保密状态。 神秘模型 Ox Alpha 引发热议 目前能够确定的是,Ox Alpha 并不是 OpenRouter 自己开发的模型。OpenRouter 只负责将用户请求路由给背后的第三方供应商,而后者选择在预览期间保持匿名。 这让 Ox Alpha 在上线几小时后迅速变成一场大型“猜模型”游戏。 从 Google Gemini、小米 MiMo V3 到腾讯混元新模型,不同猜测陆续出现。 更重要的是,在人们试图识别它到底是谁之前,OpenRouter 表示它目前是免费的。 根据 OpenRouter 公布的信息,Ox Alpha的完整模型标识为: stealth/ox-alpha 它是一款以推理和编程为主要方向的模型,重点面向三类任务:长周期软件工程、复杂推理,同时结合文本与视觉信息的Agent工作流。 据介绍,Ox Alpha 拥有超 100 万 Token 上下文窗口,最大输出长度达到 13 万 Token。 这意味着,它理论上可以一次读取规模较大的代码仓库、长时间积累的Agent执行记录,或者由文本、图片和视频共同组成的复杂任务。 模型支持文本、图片和视频输入,但输出形式仍然只有文本。 值得一提的是,在 Ox Alpha 介绍页面的 FAQ 部分,有一个问题是问 Ox Alpha 是否支持工具调用和结构化输出? 显示的回答是:它能够支持工具调用、tool_choice以及 JSON 格式的结构化输出,不过暂不支持严格的 JSON Schema 约束。 这些特征说明,Ox Alpha 并不只是面向聊天或单次代码补全,还可能是为了 Coding Agent 准备的执行模型。 长时间Agent任务对模型的要求,与普通编程问答并不相同。 它不仅要生成一段正确代码,还需要持续读取文件、调用工具、跟踪修改状态、运行测试,并在失败后重新规划。如果上下文稍长就忘记目标,或者连续调用几次工具后开始偏离任务,即便模型在代码基准上得分很高,也很难真正进入生产环境。 OpenRouter 因此没有把 Ox Alpha 描述为单纯的“代码模型”,而是反复强调“sustained agentic work”,即能够持续进行的Agent工作。 截至目前,OpenRouter页面显示,Ox Alpha 的中位首 Token 延迟约为 1.95 秒,输出速度约为每秒 49 Token,最近三天的可用率接近100%。 不过模型刚刚上线,这些数据的采样周期和调用规模都非常有限,后续很可能继续变化。 更值得注意的是,OpenRouter 没有公布任何 SWE-bench、Terminal-Bench或其他编程与Agent 基准成绩。 换句话说,OpenRouter 使用了“frontier model” 这一定位,但目前还没有公开证据证明 Ox Alpha 在性能上已经进入GPT、Claude 或 Gemini 旗舰模型所在的第一梯队。 它究竟是新的旗舰模型,还是针对速度、成本和 Agent 任务优化的中型模型,根据已知信息,还暂时无法判断。 不过,这款模型目前虽然还不知道出自谁手,但最大的好处是,它现在免费呀! Ox Alpha 目前在OpenRouter上的输入和输出价格均为零。 对于一款拥有100万Token上下文、支持视频输入和工具调用的模型而言,完全免费的API并不常见。 作为对比,同样拥有百万级上下文的 Gemini 3.7 Flash,在 OpenRouter 上的价格为每百万Token 输入 0.375 美元、输出 1.875 美元;GPT-5.6 Sol Pro则为每百万 Token 输入2.5美元、输出15美元。 不过,Ox Alpha的免费并不是永久定价。 OpenCode 随后宣布,Ox Alpha 将在其平台上免费开放一周,提供较宽松的速率限制和接近无限的使用额度。 OpenCode 发文称他们为这次测试准备了每天 100T Token(Trillion,表示万亿)的容量,其联合创始人 Dax 在X上向开发者喊话:“快来猜猜是啥模型吧!” 有一说一,100 万亿 Token 确实是一个很有诚意的公开测试邀请了。 这意味着,隐藏在 Ox Alpha 背后的模型厂商可能不只是想收集几百条聊天反馈,而是希望观察模型在真实Agent Harness、代码仓库和长周期任务中的表现:它会在哪些工具调用中失败,面对多长上下文开始遗忘,连续修改几十个文件后是否仍能维持目标,以及开发者最终是否愿意继续使用。 测试效果如何? 模型放出后,在国外技术社区引发了一波集中测试。 在 X 平台,有用户测试过后,表示用起来很不错。 还有用户拿出了最难的 AI 测试题——鹈鹕骑自行车SVG任务。 该用户对 Ox Alpha 的不同推理档位进行了 15 次对照测试:在相同提示词、相同温度下,分别以 low、high 和 max 三档推理强度各生成 5 次。 从结果看,模型基本都理解了任务,能够稳定画出鹈鹕、自行车、车轮和骑行动作,说明其代码生成与空间关系表达具备一定稳定性。 但仔细观察仍能发现,部分样本中鹈鹕的腿没有踩在踏板上,车架结构不完整,翅膀、身体与车把之间也偶尔出现不合理连接。 更值得注意的是,推理强度提高后,质量提升并没有与计算开销保持同步。 low 档通常只需约 13 至 21 秒,推理字段几乎为空或只有十几个字符。 high 档耗时仍维持在 19 至 23 秒左右,画面细节和结构一致性有所改善。 最后到了max档,模型的推理字段骤增至约1.7万至6.2万个字符,单次生成耗时也拉长至124至355秒,Token消耗最高超过2.6万。 最终图像确实增加了云朵、太阳、头盔、速度线和更复杂的车轮结构,但核心构图并没有出现同等幅度的提升,个别样本甚至仍存在脚与踏板错位、车架比例失衡等问题。 这组测试其实很能说明问题:一是它能够比较稳定地完成需要生成可视化代码的任务;二是其最高推理档位存在明显的“过度思考”倾向——模型花费数十倍的推理字符和十几倍的时间,换来的主要是装饰细节,而不是结构准确性的根本改善。 另一部分用户更关注它是否适合Agent任务。 有人表示,Ox Alpha能够在经过两次需求澄清后,完成自己预期的功能;也有人尚未开始测试,就已经因为免费额度和百万上下文把它接入OpenCode。 还有用户把注意力放在“100万亿Token”上,认为这更像一场公开压力测试,而不是常规产品发布。 社区中目前比较一致的态度是:免费、上下文足够长,可以尝试;但在身份、稳定性和真实能力得到确认之
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱