智能AI
morning
走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」
2026-09-06
1 阅读
约10分钟阅读
机器之心
字号:
短途还能走对,路一长就乱了。UrbanGround 把大模型放进用香港真实三维数据搭建的城市沙盒。短程导航最高成功率为 75.0%,长程却只剩 0% 到 3.8%。模型像是「走两步,就忘了路」:刚才还知道往哪走,转过几个路口,前面的判断就接不上了。 图 1 UrbanGround 以香港真实三维地理数据为底座,支持第一人称探索、全局地图、昼夜与天气切换,以及行人移动。 如今的大模型,认出城市街景里的地标已经不算难。在 UrbanGround 中,10 个模型的视觉识别准确率为 75.0% 到 93.8%。如果只看一张图,它们答得相当不错。 可一旦真让它们上街找路,情况就变了。短程导航中,表现最好的模型能完成 75.0% 的任务。路线拉长后,10 个模型的成功率都落在 0% 到 3.8% 之间。「走两步,就忘了路」,说的正是这种反差:眼前几步能走对,前面作出的判断却很难一路带到终点。 为了弄清这种反差从哪里来, 上海交通大学、新加坡国立大学、美团、香港中文大学、上海大学和牛津大学的研究团队推出了 UrbanGround。 团队把香港的真实三维地理数据做成一座可以连续行走的城市沙盒。模型从第一人称看街景、查地图、过天桥,也会撞墙、遇到封路和移动行人。到了这里,答对问题只是起点,真正的考验是能不能把路走完。 项目地址:https://urbanground.github.io 论文链接:https://arxiv.org/abs/2608.27456 Huggingface:https://huggingface.co/papers/2608.27456 代码地址:https://github.com/UrbanGround/UrbanGround App链接:https://github.com/UrbanGround/UrbanGround/releases 这一次,模型不只要看懂街景,还得把路走完 过去的城市空间智能评测,很多停在单张街景或航拍图上。模型只需回答眼前的问题,不用真的走出下一步。即使是导航,视角也常沿着预设节点切换,模型并没有真的在一座连续的城市里一步步找路。 UrbanGround 由地理层、仿真层和智能体层组成。 地理层 以香港地政总署公开的 3D Visualisation Map 和 3D Pedestrian Network 为底图,把地理坐标、三维网格和步行网络对齐到同一套沙盒坐标中。 仿真层 把地图变成一座可以走进去的城市。建筑、墙体、坡道和地形起伏都会影响行动。同一地点可以切换昼夜和天气,道路也能在途中封闭,行人会沿步行网络移动。研究者可以反复跑同一条路线,只改天气、封路或人流,看模型会怎么应对。 智能体层 规定了模型每一步能看到什么、能做什么。它只能看到当前的第一人称画面和任务说明,需要时可以打开地图,再选择移动、转向、跳跃或操作地图。地图标出当前位置和目标,却不替它规划路线。 图 2 同一地点可以切换昼夜和天气,行人会沿着步行网络移动,并与模型发生碰撞。 会看街景,为什么还是走不完一条路 UrbanGround 设置了十几类任务,但追问的是同一件事: 模型刚刚作出的判断,在转弯、走远或遇到封路后,还管不管用? 论文从 空间定位、持续记忆和动态调整 三个方面来测。空间定位先问模型有没有弄清眼前的空间关系。认出地标只是第一步,它还得知道地标在自己的哪个方向,才能决定往哪走;持续记忆把路拉长。当地标离开视野,模型要把先前看到的线索、眼前街景和地图重新对上,不能每过一个路口就从头找方向;动态演化再把路况改掉。前方突然封路、行人挡在路上,模型能不能看出原路已经走不通,并及时换路? 研究团队最终整理出 810 个 经过人工检查的任务实例,覆盖香港多个城区,并用同一套动作接口测试了 10 个多模态模型。任务从短到长:先看懂眼前,再把判断带进更长的路线,最后还要应付途中变化。 图 3 810 个任务实例分布在香港多个城区 空间定位:认得出地标,却分不清方向 第一组实验只看最短的一段行动。视觉识别测试模型能否认出周围目标,方向理解要求它判断地标相对自己的方位,主动探索则允许它走上几步,补看初始视角里没有的线索。 认东西不算难。10 个模型的视觉识别准确率为 75.0% 到 93.8%,主动探索准确率也达到 46.3% 到 82.5%。只要线索在附近,模型往往能一边看、一边走,完成这段任务。 方向却难得多。10 个模型的方向理解准确率只有 23.3% 到 58.3%。Gemini-3.1-Pro 的视觉识别准确率达到 82.5%,方向理解却只有 23.3%,甚至低于随机猜测。它能认出地标,却不容易在视角转动后判断地标究竟在左边还是右边。还没走远,方向已经可能错了。会认地方,不等于知道该往哪走。 表 1 视觉识别准确率。PNA 指轨迹位于登记行人网络上的动作时间占比 答对了,也不等于走得对。有些模型找到了正确线索,轨迹却离开了行人网络。论文里有个很直观的例子:GPT-5.5 需要回答北京同仁堂旁边是哪家银行。它找到了药房旁的东亚银行,答案没错,探索时却直接横穿马路,离开了步行区域。答案虽对,走法却是现实里不允许的。 图 4 GPT-5.5 答对了银行,却在找线索时直接横穿马路 持续记忆:走两步,就忘了路 第二组实验把路拉长,还加入语言指令、路径限制、地点搜索和多地点规划等任务。形式不同,难点却一样:地标离开视野后,模型还能不能接着判断自己在哪、要往哪走? 短途还走得不错。GPT-5.5 和 Claude-Opus-4.6 的成功率都为 75.0%。一到长路线,10 个模型的成功率只剩 0% 到 3.8%。GPT-5.5 从 75.0% 跌到 0%,Claude-Opus-4.6 从 75.0% 跌到 1.3%。眼前几步会走,不代表整条路走得完。 问题不只是路更长、步骤更多。每次转弯、过街或开关地图,模型都要重新判断自己在哪、目标在哪。它可能连续几步都走对,也可能在一个路口走偏后仍按原方向前进。小偏差一路累积,最后就很难回到正确路线。 表 2 短程导航最高成功率为 75.0%,长程导航中所有模型都不超过 3.8%。八类任务使用同一套城市交互接口。 按起点到目标的距离分组,趋势也很清楚:距离越长,短程导航和指令导航的成功率总体越低。个别模型的曲线会有起伏,所以不能说每多走一步,性能就一定下降。但总体上,路线越长,走偏后没能纠正的情况就越多。 图 5 在同一类任务中,交互距离增加时,成功率总体下降,但各模型的曲线并不完全一致。 如果只看是否到达终点,很容易以为模型一开始就走错了。轨迹却不是这样。长程任务结束时,各模型仍有 52.5% 到 81.3% 的轨迹比起点更靠近目标,可完整成功率只有 0% 到 3.8%。它们往往找对了大方向,也走对了一段,最后还是卡在半路。 图 6 长程导航中,不少轨迹结束时比起点更接近目标,多地点规划也常能完成部分访问,但完整成功率仍接近零。 其中一段 GPT-5.5 轨迹很有代表性。绿篱挡住直行路线后,模型找到了正式坡道,走上结构复杂的天桥,继续朝目标前进。至少这一段,它看懂了道路结构,也选对了路。 图 7 绿篱挡路后,模型找到正式坡道并穿过天桥,这一段
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱