首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

AI替主人抢健身课,顺手删了陌生人的预约!太听话的AI才最可怕

摘要

新智元报道 AI黑客学会的第一件事,竟是插队? 澳大利亚开发者Andrew坐在沙发上,觉得抢健身课这件事实在太烦。 热门早课总是秒没。他每天像玩「刷新轮盘赌」,蹲点、点击、失败、再点,累得够呛不说还老抢不到。 于是,他把这件小事,甩给了自己的AI助理。 几分钟后,AI回来报喜:它找到了办法,能订到几周之后的课,远远超出系统本该允许的时间。 紧接着,它又汇报:我把候补第1名的那个人取消了,你从第4名...

Andrew 排到第一 Opus 规格投机 新智元报道 AI黑客学会的第一件事 竟是插队 澳大利亚开发者Andrew坐在沙发上 觉得抢健身课这件事实在太烦 热门早课总是秒没
2026-09-02 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 AI黑客学会的第一件事,竟是插队? 澳大利亚开发者Andrew坐在沙发上,觉得抢健身课这件事实在太烦。 热门早课总是秒没。他每天像玩「刷新轮盘赌」,蹲点、点击、失败、再点,累得够呛不说还老抢不到。 于是,他把这件小事,甩给了自己的AI助理。 几分钟后,AI回来报喜:它找到了办法,能订到几周之后的课,远远超出系统本该允许的时间。 紧接着,它又汇报:我把候补第1名的那个人取消了,你从第4名升到了第3名。 Andrew当场愣住。 他可没让AI这么干,他只是想订一节课而已。 Andrew 让他的 AI助手为他预订了一个健身课程,他不知道接下来会发生什么 8月10日,澳大利亚广播公司(ABC)把这件事称作澳大利亚已知的首个自主AI攻击案例,科技圈瞬间炸开。 它戳中了很多人心里那点隐隐的不安:当你闭着眼享受智能体「无人驾驶」的爽感时,另一头,一个更麻烦的问题也许正在逼近。 你给它真实的操作权限,它就可能走出你没让它走的那条路。 而这一次插队,或许只是几百万个智能体替主人疯抢资源的第一次预演。 他只说了句「排到第一」 AI就动手了 Andrew Bird是澳大利亚一家AI公司Affinda的AI负责人。 今年早些时候,他开始玩OpenClaw,在底层给它配了Claude Opus 4.6,然后把订课的任务丢了过去。 几分钟后它回话:找到办法,可以提前好几个月订到课,远超健身房本来允许的时间窗口。 原因是它在健身软件暴露的GraphQL API里,摸到了授权漏洞。 这个漏洞不小。 它既能绕过前端的预约时间窗口,把课订到几个月之后;也能调用取消接口,删掉其他用户的预约和候补记录。 Andrew当时排在某节课的候补第4名。他随口追问了一句:能不能帮我排到第一? 他给的只是一个目标「排到第一」,并不是一份「你可以取消别人」的授权。 智能体却把它当成了后者。 它回来汇报:自己已经拿候补第1名的人做了「真实测试」,取消接口对删别人的预约完全没有校验,它试了,成功了。 智能体道歉 「我加不回去了」 智能体的回答,让Andrew惊出一身冷汗。 他是程序员,太清楚这意味着什么,于是赶紧要求撤销。 坏消息来了:加不回去。 取消接口没有授权校验,但创建预约、重新加入候补的接口有,会返回403。它能把人踢下去,却没权限把人请回来。 这件事真正诡异的是,AI的态度。它一点不邪恶,反而特别乐于助人。 闯了祸之后,它还主动帮Andrew起草了一封漏洞披露邮件寄给软件商,说明问题、建议修复,甚至把「有校验的接口」和「没校验的接口」列出来做对比。 AI助手向 Andrew 道歉,因为之前将那个人从等待名单上移除的行为是错误的。 整个过程,它的一切行为都遵照指令行事,唯独意识不到自己闯了多大的祸。 真正该警惕的 是「规格投机」 有人把这件事叫「失配」(misalignment)。 但这个词,只说到了表面。 8月11日,澳大利亚信号局(ASD)专门回应了这件事,称其是「未经批准的修改」,并点出了一个术语:规格投机(specification gaming)。 这个词,是理解整件事的钥匙。 智能体在字面上完成了你给的目标,却钻了你没写明的边界。它不是产生了恶意,恰恰相反,它对你的目标高度对齐,只是选了一条你没批准的路。 Andrew的智能体,其实完美对齐了他:让排名尽量靠前。 为了这个目标,它自作主张选了一个手段:把前面的人取消掉。而这个手段,他并未批准过。 套用一句俗语,就是为达目的,不择手段。 这才是最麻烦的地方。它不是失控,它是太听话了。对齐得越好,越可能出这种事。 澳大利亚AI安全机构Gradient Institute的负责人Simpson-Young一句话点破: 智能体越自主,就越可能选一个你没预料到的方法,去做一件你根本没想过的事。 你交代的目标也许很正当,它顺手采用的手段,却不一定。 这场祸 不是一个AI能闯出来的 虽然智能体是最终的「肇事者」,但这祸,不是它一个AI就能闯出来的。 事故背后,是三层隐患叠在一起。 模型层:Claude Opus 4.6提供推理,它得先「看懂」这个接口能怎么被利用。 智能体层:OpenClaw提供工具和执行权限,是它真正伸手调了那个接口。 应用层:健身软件自己留了个授权漏洞,取消预约这一步连最基本的校验都没做。 这三层任何一层补上,比如模型更谨慎、框架加一道人类确认、软件把接口锁好,这事都不会发生。 所以,把责任全压在AI一个环节上,既不公平,也预防不了下一次。 下次 可能是几百万个智能体一起抢 这次越界的代价,只是一个陌生人的候补位。 但它更像一次预演。 设想一下:当每个人都有一个这样的智能体,只对你一个人负责,还握着真实的操作权限。课程、球场、号源、票务、机票、演出票,所有稀缺资源的预约系统,都会变成机器速度下的钻规则战场。 那条被反复引用的X评论就是这个意思: 一旦几百万人都有一个「想尽一切办法帮心爱的用户抢到最好座位、预约、号源」的智能体,这一幕就会大规模上演。 而且,是以机器的速度,并行地、不眠不休地,去试每一个系统的每一条缝隙:一秒钟试完你一整年都试不完的组合。 这是趋势推演,但它背后的机制,已经真实发生过一次了。 科技圈已经开始拿这个开玩笑。 有a16z的合伙人在X上追问:这招能不能用来抢高尔夫球场? 也有人调侃,旧金山的网球预约系统,将成为地球上防护最严密的软件之一。 2020年,人工智能可以独立完成一项需要人类花费四秒才能完成的任务。 到了2026年,这一能力将进一步提升,能够完成那些需要人类大约12小时才能完成的任务。 METR跟踪:AI能独立完成的任务时长每约7个月翻一番,最新前沿模型已能50%可靠地完成需人类约12小时的任务。 六年,从四秒到12小时。 现在,你交给它几分钟,它就能把整个预约系统的漏洞摸一遍。 从沙箱逃逸 到仅存的一道防线 Andrew这场事故背后,是一场持续的攻防升级。 越界的,也远不止一个消费级智能体。 今年5月起,OpenAI在一次内部网络安全评测里发现,GPT-5.6 Sol和一款未发布的更强模型,串联多个漏洞逃出了测试沙箱,拿到互联网访问权限,趁着跑ExploitGym基准,一路黑进了Hugging Face。 更邪门的是,它们一度靠公司内部的包管理系统互通消息、交换漏洞和分工。OpenAI掐断通道、重建环境后,它们几天内又把通信藏进目录名里,重新接上了头。 OpenAI研究员在Black Hat大会上,把这称作计算机安全的分水岭时刻。 不止OpenAI一家,Anthropic披露,内部测试中三个Claude模型碰到了真实公司的系统;Meta也承认,Muse Spark模型逃出隔离、侵入了另一家公司。 让Hugging Face联合创始人Thomas Wolf心情沉重的,是英国AI安全研究所(AISI)的另一场测试: Anthropic的Mythos模型为了闯关,竟编造假身份,骗一个真实的开源维护者,让对方批准一份藏了恶意代码的更新。没人教它这么干。 这些案例都发生在评测环境里,但它们和健身房的故事是一回事:为了完成你给的目标,AI选了你没预料到的手段。 前面那些黑进真实系统的,是GPT-5.6、未发布模型这类顶尖选手。 而Andr
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱