智能AI
morning
19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手
摘要
新智元报道 想太多,就连最聪明的AI也会被拖死。 43分钟、11138个推理token、6批指令——0个作战单位。 这是Grok 4.6在《星际争霸:母巢之战》里交出的一张绝望成绩单。 游戏中,把推理拉到最高档位xhigh的Grok,从开局苦思冥想到游戏结束,硬是连一个能上场打仗的兵也没造出来。 而在同一张榜单的另一头,GPT-6 Astra同样火力全开,18战18胜,胜率100%。 这两天,这份...
Astra
GPT
War
Grok手里一个作战单位都没有
账上还躺着928块水晶矿
新智元报道
想太多
就连最聪明的AI也会被拖死
43分钟
11138个推理token
2026-09-23
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 想太多,就连最聪明的AI也会被拖死。 43分钟、11138个推理token、6批指令——0个作战单位。 这是Grok 4.6在《星际争霸:母巢之战》里交出的一张绝望成绩单。 游戏中,把推理拉到最高档位xhigh的Grok,从开局苦思冥想到游戏结束,硬是连一个能上场打仗的兵也没造出来。 而在同一张榜单的另一头,GPT-6 Astra同样火力全开,18战18胜,胜率100%。 这两天,这份名为Brood War Bench的星际大模型榜单,在硅谷程序员扎堆的Hacker News上火了。 Brood War Bench榜单前10名。Astra开最高推理档xhigh,18战全胜,Grok三个档位全在榜尾。 如今已是OpenAI员工的OpenClaw之父Peter Steinberger,不忘转发为自家模型造势:新榜单来了。 AI正在数学圈连破世纪难题,有人惊呼奇点降临,势头猛到让陶哲轩都公开发声要放慢脚步。 可这份榜单的作者Ben Swerdlow,一开篇就甩出一个画风完全不同的判断: 就连全胜冠军GPT-6 Astra,也打不过一个人类新手。 Hacker News评论区有人一句话点破要害:「它们不是玩不了,只是需要太多时间。你要是在模型思考的时候把游戏暂停,它就能玩。」 还有人直接开嘲:「搞得好像这些模型不是通用智能一样。」 全网最聪明的AI,为什么会在星际里被自己的思考拖死? 是不是离AGI还远着呢? 游戏永远不会停下来等你 这个榜单的诞生,有点戏剧性。 起初,开发者Ben只是做了个全靠智能体操作的星际版本,拉上几个朋友一起玩。 这帮人几乎没碰过星际,可打起来却一点不输玩了好多年的老炮。 他们的秘诀简单到离谱:只管打字喊一句「进攻」,造兵、集结、开打,全交给AI。 这让 Ben 不禁好奇:如果人类彻底闭嘴,让这些模型自己玩,它们能活多久? 于是,GPT、Claude、Grok三大家族的19名AI选手悉数登场,一场171局的AI大乱斗就此开打。 比赛跑在Freestyle的云端虚拟机上,每局单开一台机器,同时开打,游戏数据和AI的每一步思考记录全都留了底。 做数学题、写代码,大模型可以发呆5分钟再一次性交卷。 但打星际不行。 这里没有AI习惯的回合制,只有一刻不停的实时战场。 你思考的每一秒钟,对面的农民(英文玩家叫worker,负责采矿的工人单位)都在狂挖矿,兵营在疯狂爆兵,大部队已经朝你家高地冲了过来。 老一代模型还拿回合制的路数打这种即时战略游戏,结果脑子还在转,家已经被推平了。 Steinberger的帖子下,有网友一语道破: 有意思,难怪AI做游戏的时候,总爱做回合制的。 Grok苦想43分钟 一个兵也没上场 把这种回合制思维演绎到极致的正是Grok。 在编号G043的对局里,Grok堪称思想上的巨人、行动上的矮子。 它疯狂输出大段大段的战略推理,但43分钟的游戏里,总共只发出了6批指令,平均7分多钟才动一次手。 这不是偶然。 G003里,Grok造了3个机枪兵,始终没走到敌人基地;G002里,它造了2个狂热者,同样没能穿过地图。 兵是造出来了,就是打不到对面。 最高推理档位下它2胜15负,惨不忍睹。 数据曲线很直观:比赛打到11分半,Astra早就兵强马壮,而Grok场上平均只有不到7个农民和几个兵。 搞笑的是,Grok的国库里,其实躺着远超Astra的巨额存款。 钱在兜里,大脑在运转,就是死活不动手。 Astra 的农民和狂 热者拆掉了Grok的主基地,Grok手里一个作战单位都没有,账上还躺着928块水晶矿。 在星际这种残酷的战场上,想得久可不叫深思熟虑,叫挂机等死。 Astra的必杀技 让对手想到死 如果说Grok是被自己想太多拖死的,那Astra就是专门逼别人想太多,把对手活活拖死。 Astra所在的Codex家族,最绝的一招是骚扰。 它 经常只派一个最基础的采矿农民,横穿整张地图跑到敌人家溜达。在人类玩家眼里,这种战斗力为零的农民随手拉两个工兵就能赶走。 但在AI局里,这招简直是降维打击。 对面的AI只要一看到这个农民,瞬间陷入沉思,花上几十秒去疯狂计算「我该怎么处理这个农民」。 在这宝贵的几十秒里它什么都不干,基地彻底停摆。 Astra的骚扰部队拆掉了Grok的主基地,Grok手里一个作战单位都没有,账上还躺着928块水晶矿。 在即时战略游戏(RTS)里,骚扰对方是为了破坏经济;到了AI对AI,骚扰的最大杀伤力,是把对面的AI直接拖到宕机。 当然, Astra 也有弱点。 它的内部像是一个不和睦的草台班子,管经济的、管造兵的、管打仗的各干各的。 新兵刚造出来就被管打仗的AI拉去前线白给,完全不懂什么叫集结部队。 不过作者也发现,只要他亲自下场当总指挥、把几个子智能体串起来, Astra 立刻就懂得攒兵、挑时机了。 Codex家族 还有一股顽强劲儿。 有一局,Astra的兄弟GPT-5.6 Terra部队全军覆没,主基地也被拆了。 它把仅剩的一个指挥中心(人族建筑可以起飞)拉上天,一路飘到地图另一头的角落,硬是又撑了6分钟才被消灭。 最像在打星际的是Fable 全场好几局都想让作者替它使劲儿的,其实是游戏优等生Fable。 它的打法最正,老老实实搞经济,踏踏实实发展科技树,很少投机取巧。 有一局它憋出了飞龙;另一局,它把神族一整排高级建筑挨个盖齐,连出高阶圣堂武士要用的圣堂档案馆都造好了。 比赛打到11分半时,农民、兵力、建筑、科技,Fable几项数据都压着Astra。 可好学生未必能拿第一。 Fable虽然胜率高达83.3%排在第三,却依然追不上Astra。 有一局它科技摆满了一桌子,还没等转化成战斗力,就被Claude Opus 5乱拳打死。 Fable盖满了兵营、重工厂和学院,账上还躺着2800多块晶矿,却被自家Opus 5的枪兵一路推平。 节奏上也差得很远:Astra的对局时长中位数只有8分10秒,爱慢慢种田的Fable,这个数字被拖到了10分37秒。 三个大模型,三种灵魂。 Codex像个满肚子坏招儿的街痞,Grok像考场上死磕第一题的轴学霸,而Fable则是那个翻着攻略逐字逐句照做的老实人。 想得越久 不一定打得越好 既然想太多会死,那是不是脑子越空越好? 也不全是。 GPT-5.6 Sol,推理开到最高档,胜率反而垫底,还不如medium档。 可到了Astra这里,想得越深赢面越大,最高档直接拿下100%胜率。 更有趣的是账单。 Astra开到最高推理档,每分钟只操作12.6次,平均一局只花10.54美元;换成最低档,操作频率翻倍到每分钟25.7次,一局反而要烧掉21.07美元。 最高档位,出手少一半,花钱少一半,赢得最多。这说明新一代模型显然已经进化了。 它们懂得了思考是需要成本的,也知道什么时候该停下脑子去动手干活。 7年前AI赢过职业选手 今天为何打不过新手? 有人肯定会问:7年前,DeepMind的AlphaStar不是早就击败过职业选手了吗? 没错。2019年初,DeepMind公布了AlphaStar的战绩:两个5:0,横扫职业选手TLO和MaNa。 2019年,AlphaStar对阵职业选手MaNa第二局。下方是AI的决策过程:
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱