游戏
morning
Grok 4.6上了牌桌,马斯克还差一部《奥德赛》
2026-08-14
1 阅读
约10分钟阅读
AIX财经
字号:
文 | AIX财经,作者 | 陈丹,编辑 | 魏佳 马斯克想让Grok在今年年底前拍完一部《奥德赛》。 这听起来像一个典型的马斯克式Flag:用AI挑战诺兰、好莱坞和2.5亿美元制作预算。但真正值得关注的,并不是Grok能不能在五个月里生成几千个镜头,而是它是否已经拥有把一项复杂任务从头做到尾的能力。 Grok 4.6发布后,这个问题有了更具体的答案。 在最新一轮模型竞争中,它已经挤进美国大模型的第一梯队:能力接近OpenAI和Anthropic的旗舰模型,编程成绩甚至在部分榜单领先,API价格却明显更低。与此同时,它在长链条Agent任务上的短板依然存在——会理解问题、会搭框架、会快速启动,却还不够稳定地收尾。 这恰好也是眼下大模型竞争的缩影。 当能力差距缩小、Token越来越便宜,真正决定商业价值的,已经不只是“模型有多聪明”,还要看一次任务能否稳定完成,以及完成一次到底要花多少钱。 对于一年向AI投入上百亿美元资本开支的马斯克来说,Grok也不能只是偶尔冲上一次榜单。它必须持续留在第一牌桌,并把算力、数据和分发真正变成收入。 01.Grok 4.6上了牌桌,但还拍不了《奥德赛》 诺兰的《奥德赛》上映前,马斯克已经骂了这部电影好几轮。骂选角,骂改编,骂诺兰为了奥斯卡“亵渎荷马”。电影上映后,他干脆在X上立了一个Flag,今年年底前,Grok Imagine要做出一部“符合历史、忠于荷马艺术”的完整《奥德赛》。 马斯克转发的三分钟《奥德赛》短片确实不错。盔甲、海岸、人物特写都有电影预告片的质感,但三分钟精修短片和九十分钟长片之间,还隔着几千个镜头,以及一群AI演员。 趁着Grok 4.6发布,我们没有再测试视频,而是给它出了两道更适合语言模型的题。 第一道,看它能不能读懂荷马。第二道,看它能不能搭出一套把三分钟样片扩展成九十分钟长片的制片系统。 第一题,Grok答得比马斯克本人靠谱。 “符合历史”和“忠于荷马”听起来不难,真翻开《奥德赛》就会发现,这两个维度很难同时实现。《奥德赛》经过数百年口述传播,青铜时代的武器、铁器时代的习俗和诗人的神话想象全叠在一起。你可以考证奥德修斯该用什么剑、坐什么船,却没法从遗址里挖出独眼巨人、女神和冥界。 Grok把问题拆成了四层,青铜时代考古、荷马史诗里的混合时间层、作品本身的诗学,以及诺兰的现代改编。 它给出的办法是,考古负责约束器物、服装和地理,荷马负责约束人物、叙事和诗学。它还顺手纠正了一个流传很广的错误,「让千艘战船起航的面孔」出自马洛,不是荷马。 这题说明Grok 4.6不仅会查资料,还能拆开一个内部冲突的命题,替争议双方构造最强论证。 第二题更接近真正的制片工作。 Grok搭了一个《奥德赛》制片计算器,把成片时长、平均镜头长度、首轮可用率、复杂镜头占比、并发任务数、人工审核时间、成本和工期全部做成可调参数。 Grok4.6生成的电影制片系统 按照默认参数,它估算一部90分钟长片需要约208个工作日。Grok自己算完都觉得有点悬,最后给出了一条“识时务”的建议:做一部12到20分钟的荷马选篇。 当然,208天不能当作实测结果。首轮可用率、连续性失败率、每个可用镜头需要生成几次,都是模型设定的假设。计算器证明Grok会拆解工程、建立公式和搭建生产系统,没有证明这套系统真的能在208天内交片。 而且,它点出了AI电影最难的部分。现在生成一个漂亮镜头已经不稀奇。难的是让几千个镜头中的脸、衣服、船只、空间和叙事保持一致,同时把废片、重做和人工审核压到制片方能承受的范围。 外部榜单给出的结论差不多。 在Artificial Analysis的榜单上,Grok 4.6的综合智能指数是61分,与GPT-5.6 Sol同分,距离Claude Fable 5只有1分。CursorBench 3.2上,Grok 4.6 High拿到69.9%,超过Sol的67.2%。它完成一次任务的成本约2.34美元,Sol约5.69美元。Grok 4.6的API的起价在每百万输入Token 2美元、输出6美元——价格确实有杀伤力。 图源 / SpaceX 但到了DeepSWE和TerminalBench这类长链条任务,Grok分别拿到65.9%和26%。Sol是73%和34.6%,Fable 5是70%和34.1%。 Grok已经很会理解问题、启动项目和搭建框架,到了需要连续执行、处理意外和稳定收尾的阶段,仍然会掉链子。 综合来看,Grok 4.6已经坐上美国大模型的第一桌,而且在OpenAI和Anthropic旗舰模型面前,打出了一张很凶的性价比牌。 它会读荷马,会写分镜,会算工期,也会搭制片系统。只是奥德修斯漂了十年才回到伊萨卡,想让Grok在年底前带着几千个连续镜头顺利“返乡”,现在看还很难。 02.35天一代,马斯克先要确保Grok别掉队 从7月8日Grok 4.5开始对外推送,到8月12日Grok 4.6发布,中间只隔了35天。马斯克还预告,拥有2.1万亿参数的Grok 4.7将在几周后到来,能力更强,Token效率更高,只是推理稍慢。 4.7还没发布,参数和能力也只有马斯克一家的说法,但4.5到4.6至少完成了一次有效的月度升级。如果4.7按时落地,SpaceXAI就更显示出自己能够停留在第一梯队的能力。 这件事放在两年前,还有点难以想象。 2023年11月,Grok-1发布时,OpenAI已经拿出GPT-4,Anthropic已经发布Claude,Google背后则有TPU、搜索和云。那时候,Grok更像X Premium附赠的聊天机器人,企业客户、开发者生态和模型透明度都没建立起来,B端的市场占有率也很低。今年4月,在Ramp客户的企业付费样本里,xAI的采用率只有1.9%,而Anthropic和OpenAI的这一数字分别是34.4%和32.3%。 在很多从业者的眼中,和Meta一样,SpaceXAI的大模型也长期困于第二梯队。 但现在Grok端着凳子挤过来了。 它能追上来,主要是大力出奇迹,靠算力、数据和工程速度一起硬堆。 xAI用122天建成了首期10万张Hopper GPU的Colossus,随后又用92天扩到20万张。服务器到场19天后,集群已经开始跑训练任务。黄仁勋把这段部署速度称为“超人级”。X给Grok提供实时信息、用户和分发入口。Cursor则提供真实的编程任务和开发者与Agent的交互数据。Cursor称,Grok 4.5的训练使用了数万亿Token的Cursor数据。 模型也不必每个月从头练一遍。Grok 4.6建立在4.5的基础上,主要升级监督微调、强化学习和Agent训练环境。Colossus负责把训练规模堆上去,X和Cursor负责不断喂回真实任务,SpaceXAI再用后训练把这些任务压进下一版模型。 这套流水线跑顺以后,版本号就能按月往前拱。 Grok也必须跑这么快,因为SpaceX已经把太多钱押在AI上了。 SpaceX招股书显示,2025年AI分部收入32亿美元,经营亏损64亿美元,资本开支127亿美元,占公司总资本开支约61%。2026年一季度,SpaceX又向AI分部投入77亿美元,占全公司资本开支的76%。到了2026年二
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱