首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

明天直播 | AI 与现实脱轨?六项技术提升模型对真实世界的理解、模拟、适配度

摘要

(本文阅读时间:7分钟) 近年来,人工智能研究正在经历新的能力跃迁。随着大语言模型不断发展,学术界的关注焦点逐渐延伸到世界模型、智能体以及生成式表征学习等前沿方向。科研人员不再满足于让 AI 理解和生成语言,而是在探索如何帮助 AI 感知环境、建模现实世界,并以更高效的方式学习和适应复杂任务。 本期直播精选了微软亚洲研究院近期 6 项前沿研究成果。这些工作分别被 ACL 2026 和 ICML 2...

2026 ACL GUI Web 分享论文 World Models InfiniteWeb ICML Agent
2026-08-07 1 阅读 约10分钟阅读 微软研究院AI
分享:
字号:
(本文阅读时间:7分钟) 近年来,人工智能研究正在经历新的能力跃迁。随着大语言模型不断发展,学术界的关注焦点逐渐延伸到世界模型、智能体以及生成式表征学习等前沿方向。科研人员不再满足于让 AI 理解和生成语言,而是在探索如何帮助 AI 感知环境、建模现实世界,并以更高效的方式学习和适应复杂任务。 本期直播精选了微软亚洲研究院近期 6 项前沿研究成果。这些工作分别被 ACL 2026 和 ICML 2026 接收,内容涵盖文本世界模型、 Web Agent 训练环境生成、三维世界建模、生成式图像压缩、视觉表征学习以及大模型高效训练等方向。从不同视角出发,它们共同回应着同一个问题:当 AI 开始构建自己的 “ 世界观 ” ,我们距离更加通用、高效、智能的人工智能还有多远? 8 月 7 日(明天) ,我们特别邀请了这 6 篇论文的作者在微软亚洲研究院的直播间 ,带来第一手的研究解读,与大家共同探讨相关领域的最新进展。欢迎锁定直播间,与研究者面对面交流! 欢迎在评论区留言提问 ,我们将邀请讲者在直播中逐一解答。 直播信息 直播时间: 2026年8月7日 14:00-16:00 直播地址: 微信视频号 “微软亚洲研究院 ” 小红书 “微软亚洲研究院”直播间 B 站 账号 “微软科技”直播间 论文及讲者介绍 李乙侠 ,南方科技大学四年级博士生,导师为陈冠华博士。他的研究方向涵盖智能体、模型后训练、多模态与多语言模型以及高效大模型方法,关注提升大模型的能力、效率与泛化性。以第一作者身份在 ACL 、 NAACL 、 NeurIPS 、 TNNLS 等人工智能顶级会议与期刊发表多篇论文,并担任相关会议与期刊审稿人。当前主要致力于提升大模型在真实世界场景中的应用能力与泛化能力,探索从交互经验中持续学习的机制。 分享论文: From Word to World: Can Large Language Models be Implicit Text-based World Models? ( ACL 2026 Oral ) 论文摘要: 智能体强化学习日益依赖经验驱动的规模化扩展,但真实环境难以自适应、覆盖有限且扩展困难,形成了严重的 " 经验瓶颈 " 。世界模型通过模拟交互生成想象经验,有望缓解这一瓶颈,然而大语言模型能否可靠地充当世界模型仍是开放问题。本论文聚焦文本环境,将世界建模定义为交互式的下一状态预测,并提出涵盖保真度与一致性、可扩展性与鲁棒性、智能体实用性的三层评估框架。在五个代表性文本环境上的系统实验表明,经充分微调的大语言模型能够维持连贯的隐状态,预测性能随数据和模型规模可预测地提升,并通过动作验证、合成轨迹生成和强化学习热启动切实改善智能体表现。同时,实验也揭示了行为覆盖率与环境复杂度对世界建模有效性的关键约束,为大语言模型从 " 词语预测 " 迈向 " 世界建模 " 勾勒出清晰的能力边界与发展方向。 论文链接: https://arxiv.org/abs/2512.18832 张晓艺 , 微软亚洲研究院智能多媒体组高级研究员,主要研究方向为智能体和用户界面理解与生成。 分享论文 : InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training ( ACL 2026 ) 论文摘要: GUI 智能体在代表用户与图形界面交互方面展现出了巨大的潜力,也是构建实用 AI 助手的重要方向。然而,训练这些智能体缺乏能够支持大规模训练的合适环境。尽管已有一些基准测试提供了宝贵的测试平台,但它们使用的真实网站由于多样性单一、网站限流、任务不可撤销等等问题,难以作为训练环境进行稳定的强化学习。本文提出了 InfiniteWeb 系统,能够大规模自动生成适用于 GUI 智能体训练的功能性网页虚拟环境。该系统以网站种子描述和参考设计图为输入,通过统一接口规范,由任务推导共享数据模型与 API ,确保跨页数据的一致性。实验结果表明, InfiniteWeb 系统在构建真实网页环境方面超越了主流的商用代码智能体。研究员们发现,在构建的虚拟 Web 环境中强化学习的 GUI 智能体在真实环境中表现出了强大的泛化能力,在 Online-Mind2Web 和 OSWorld 等 benchmark 上都取得了明显的性能提升。 论文链接: https://arxiv.org/abs/2601.04126 王开新 , 微软亚洲研究院研究员,博士毕业于新加坡国立大学。他的研究方向包含强化学习算法,世界模型以及它们在具身智能方向的应用。 分享论文 : Beyond Pixel Histories: World Models with Persistent 3D State ( ICML 2026 ) 论文摘要: 现有交互式世界模型缺乏显式的三维环境表示,且受有限上下文窗口制约,在长程推演中容易 “ 边生成、边遗忘 ” ,难以维持空间一致性。为此,研究员们在本篇论文中提出了 PERSIST ,通过持续维护三维环境帧,为模型提供可更新的长期空间记忆,并结合相机状态预测和 world-to-pixel 模块生成画面。实验表明,该框架能显著改善长程生成的三维一致性与时间稳定性,在数千帧交互中保持场景结构连贯,并持续建模视野外的环境变化。 论文链接: https://arxiv.org/abs/2603.03482 贾兆阳 , 微软亚洲研究院联合培养博士,导师为吕岩博士。他的研究方向聚焦于多媒体领域,主要研究图像、视频的编解码技术,同时也在研究图像的生成算法、多模态理解大模型算法。 分享论文: CoD-Lite: Real-Time Diffusion-Based Generative Image Compression ( ICML 2026 ) 论文摘要: CoD-Lite 提出了一种面向实时部署的轻量级扩散生成图像压缩框架,系统研究了轻量模型的预训练策略与网络架构设计。论文发现,相较于通用生成预训练,面向压缩任务的预训练更适合小模型;同时,在蒸馏的辅助下,轻量卷积网络即可替代 Transformer 实现高质量生成重建。基于此,作者设计了单步扩散编解码器,并结合知识蒸馏与对抗训练,在保持与现有生成压缩方法相当感知质量的同时,实现 1080p 图像 60 FPS 编码、 42 FPS 解码,并较 MS-ILLM 降低约 85% 码率,推动了扩散生成压缩向实际应用落地。 论文链接 : https://arxiv.org/abs/2604.12525 郭宗昱 , 微软亚洲研究院高级研究员。其研究方向包括智能体式多媒体( Agentic Media ),多媒体数据压缩。一作论文曾获得 TCSVT 最佳论文奖,参与贡献业内首个端到端视频编解码器的算法开发和产品应用。 分享论文 : Compression as Adaptation: Implicit Visual Representation with Diffusion Foundation Models ( ICML 2026 ) 论文摘要: 现代视觉生成模型通过大规模训练获得了丰富的视觉知识;然而,现有的视觉表示
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱