首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

当 AI 开始给自己动刀,“智能爆炸”可能真不远了:两篇论文拆解AI下一步进化路径

2026-09-23 1 阅读 约10分钟阅读 硅谷Tech news
分享:
字号:
最近,AI 圈同时被两件事刷了屏:一边是 MIT 材料科学家 Markus J. Buehler 的长文(题为 Recursive Meta-Intelligence,与 SwarmWorld 互为呼应)一周内引来二十多万次围观;另一边,DAIR.AI 力荐的一篇论文登上了 Hugging Face 日榜第二名。两条推文看似毫无交集,指向的却是一个趋势—— AI 正在学会改进自己。 Buehler 团队的 SwarmWorld,讲的是“一群 AI 如何通过共同生活的世界悄悄把彼此变强”;DAIR.AI 推荐的 ModularRSI,讲的则是“单个 AI 如何给自己的执行框架动手术”。一个来自 MIT,一个来自北航、曼彻斯特大学、澜舟科技等组成的团队;一个面向材料科学,一个面向软件工程。它们像是同一命题的两种解法,而这命题正是眼下最热的 “递归式自我改进” (Recursive Self-Improvement,RSI)。 需要说明的是,这两篇都还只是 arXiv 预印本,未经严格同行评审,却在社交媒体上收获了远超寻常论文的关注。它们凭什么出圈?这背后是 AI 发展悄悄换挡的讯号。 “递归式自我改进”并不新鲜,过去多半停留在模型参数层面,用更多数据、更大算力“喂”同一个模型。而 SwarmWorld 与 ModularRSI 不约而同地把目光从“模型本身”挪开:一个聚焦共享环境,一个聚焦执行机制。这传递出一个信号,在模型之外,还有大片等待“进化”的疆土。 AI 学会了“制造工具” 先看 MIT 那篇。据公开资料,Buehler 是材料科学领域绕不开的名字:MIT 讲席教授、土木与环境工程系前系主任。这一次,他和团队抛出的 SwarmWorld,没有堆更大的模型,而是把 50–200 个“初始状态完全相同”的 LLM 智能体,扔进一个共享的模拟世界。 每个智能体都从零开始:没有预设分工、没有初始配方、甚至没有“负责人”,只能观察、思考、动手——探索地形、采集资源、测试材料、搭建建筑、编写可执行的控制程序。最关键的是,这套世界是“物理”的:规则由确定的模拟器执行,智能体可以提出任何设计,但能不能建出来、性能如何,由模拟器说了算。 论文想回答的问题是, 一群互不相识的 AI,能不能像蚂蚁筑巢一样,通过共同的“世界”自发地长出一整套技术?答案出人意料地接近“能”。 在三千多个时间步的模拟里,智能体自发分化出探索者、建造者、维护者、协调者等角色,技术也在代际间累积、传承、迭代,甚至出现了相当精妙的结构,比如一种名为“三层连接的几丁质交换晶格”的构造,经模拟器验证拿到 0.79 的亮眼评分。 SwarmWorld 模拟世界示意图(A)与智能体“观察—思考—行动”的执行框架(B) 为什么值得关注?因为 SwarmWorld 从机制上解决了一个老问题:过去让多个智能体协作,多半靠预设角色、强制分工或中央调度,很难证明“协作本身”创造了价值。它用可控的机制对照实验,把“聊天”和“共享环境”的作用一层层单独拆开检验。 它也格外“较真”:设置了一个“独立搜索”的强对照——让同样数量的智能体各自为战,取表现最好的一台作上限;只有共享世界长出的整体确实强过这台“尖子生”,才承认协作有价值。 尤其值得称道的是,SwarmWorld 把“认知”和“后果”刻意分开:智能体负责提出设计与假设,但能不能落地、性能如何,由独立且确定的模拟器裁决,杜绝了“自说自话”。 不聊天,反而协作得更好? 这里有个关键概念——stigmergy,常译作“间接协作”或“环境媒介协作”,由法国生物学家 Grassé 于 1959 年提出。它源自昆虫学:蚂蚁并不靠商量,而是通过改变环境,留下信息素、搬运土粒来协调行动。 为了验证,团队设计了四组“机制对照”实验:一组允许完整文化(能聊天、能记录、能继承程序),一组去掉聊天,一组连显式文化也去掉、只留物理环境这一层媒介,还有一组让智能体各自为战,作为“独立搜索”的对照组。 结果耐人寻味,共享世界确实长出了更丰富、更抗折腾的“技术组合”。面对从未见过的扰动(污染、干旱、风暴),存活韧性普遍更强。但真正让人意外的是: 智能体之间的大部分“复用”,并不靠对话,而是靠观察环境里既有的成果。留下来的东西,比说过的话更有用。 研究者也没有把话说满:“群体优势”是有限的,共享世界带来的是技术生态的多样化与累积,并不保证每件单体发明都能碾压个人英雄主义;某些指标上,独立搜索甚至能造出最强的单件器物。合作的价值在于“让文明的底子变厚”,而非“让某一个人更聪明”。 从 1959 年“间接协作”概念的提出,到 Boids、蚁群优化,再到 SwarmWorld 的技术脉络 这个发现提醒做 AI 智能体的团队:与其让智能体没完没了地“开会”,不如给它们一个能共同留下痕迹、共享成果的环境。有开发者直呼这简直是把“看板”当成了智能体的公共记忆。 顺着这条线索,SwarmWorld 的“技术传承”也很有意思。智能体写下的可执行程序,不只是自己用,还会成为世界里看得见摸得着的“遗产”,供后来者观察、复用甚至改写。论文称这种靠实物传承的积累为“可执行继承”,它让知识像滚雪球一样越滚越大。 为了把结论做扎实,团队跑了两组互补实验:一组把智能体规模从 50 拉到 200,看协作优势如何随“人口”增长放大;另一组让 100 个智能体运转三千多个时间步,不断用未曾见过的灾害打乱局面。 当然,也不必过度浪漫化。论文提醒,显式的“文化”机制(记录、教学、交易)虽能带来更强的协作,但并不同时保证每项结果都更优——有时反因环节多了拉低某些指标。协作的红利有边界,恰到好处比多多益善更重要。 给 AI 的“执行外壳”动手术 如果说 SwarmWorld 关心“一群 AI 如何组织起来”,那么 ModularRSI 关心的是“一个 AI 的执行机制如何自我完善”。 它的作者阵容同样不简单:领衔的是曼彻斯特大学与北航的团队,合作者里还有澜舟科技创始人周明——前 微软 亚洲研究院副院长、ACL 前主席。 先解释一个概念。大模型要真正干活,外面还得包一层“执行外壳”(harness),管着推理—行动—观察的循环、工具调用与上下文取舍。过去两年,智能体的表现上限,很大程度上取决于这层外壳写得好不好;而“递归式自我改进”,就是让外壳也能从执行经验里慢慢变好。 但这里有个死结:一次任务成败是一锤子买卖,它不会告诉你“到底是哪段机制出了问题”,这就是信用分配问题。更麻烦的是,如果直接在评估基准上演化外壳,你根本分不清模型是学到了通用的本事,还是单纯“背会了考题”。 ModularRSI 的解法可浓缩成六个字:解耦、对比、门控。 它先把可演化的外壳拆成五个功能模块,智能体循环、工具调用、观测管理、上下文管理、任务完成检,各自独立演化;再把每条任务的成败轨迹分开、成对对比,找出反复出现的系统性缺陷,对症下药。最后,任何改动都要过三道验证闸门(论文称 Validation Gates):程序检查、差异审查(剔除只针对个别任务的过拟合改动)、执行验证,不达标就回滚。 ModularRSI 框架:先做对比轨迹分析,再分模块演化外壳,最后经验证门控把关 效果相当能打。在 Termi
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱