首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

科学匠人 | 杨一帆:把时间交给真正值得研究的问题

摘要

(本文阅读时间:12 分钟) 编者按:在 AI 飞速发展的今天,论文、奖项、榜单和开源热度,能否作为衡量科研成果的唯一标尺?一项技术研究真正的价值究竟是什么?微软亚洲研究院高级研究员杨一帆的科研实践,给我们提供了一个独特的答案。 2026 年 8 月, SkillOpt 在开源社区迅速走红。上线仅一周,项目就在 GitHub 斩获 4600 颗星,两个月便攀升至 17,200 颗星。 作为 Ski...

2026 SkillOpt LLM2CLIP AAAI 杰出论文奖 本文阅读时间 编者按 飞速发展的今天 榜单和开源热度 能否作为衡量科研成果的唯一标尺
2026-09-24 1 阅读 约10分钟阅读 微软研究院AI
分享:
字号:
(本文阅读时间:12 分钟) 编者按:在 AI 飞速发展的今天,论文、奖项、榜单和开源热度,能否作为衡量科研成果的唯一标尺?一项技术研究真正的价值究竟是什么?微软亚洲研究院高级研究员杨一帆的科研实践,给我们提供了一个独特的答案。 2026 年 8 月, SkillOpt 在开源社区迅速走红。上线仅一周,项目就在 GitHub 斩获 4600 颗星,两个月便攀升至 17,200 颗星。 作为 SkillOpt 技术研究与开发的核心成员之一,微软亚洲研究院高级研究员杨一帆坦言 SkillOpt 所受到的关注既在情理之中,也在意料之外。 “ 我们从一开始就很笃定,这项工作的底层价值足够扎实,它瞄准的是智能体长期发展的基础性问题。我们尝试从一个新的角度切入,在模型本身保持不变的情况下,通过持续优化模型之外的技能与执行流程,让智能体在真实任务中不断迭代、持续进化。 ” 微软亚洲研究院高级研究员杨一帆 这份对底层价值的笃定,贯穿了杨一帆一路走来的科研探索。他关注的从来不只是榜单上的数字,更在意研究问题是否触及智能的本质,以及提出的方法能否在真实场景中落地生根。他习惯站在更长的时间尺度上审视研究,也愿意为那些暂时看不到结果的问题留出足够的思考时间。 在喧嚣的 AI 浪潮中,寻找长期思考的空间 杨一帆与微软亚洲研究院的缘分,始于 2018 年。那时他还在北京大学攻读硕士学位,了解到微软亚洲研究院在计算领域的技术积淀后,他主动投递了实习简历,并于当年底加入视觉计算组,从事视觉感知算法研究。 半年的实习经历,重塑了杨一帆对科研的理解。在校期间,他更多关注论文产出、指标提升这类显性成果。走进研究院后他才真切体会到,科研的核心是追问课题的本源价值,挖掘现有技术与方法仍未解决的本质矛盾。微软亚洲研究院的科研方法论、严谨的 科研 品味 与方式 ,以及自由开放的研究氛围,让他下定决心在这里长期深耕。 2021 年硕士毕业后,杨一帆正式加入微软亚洲研究院。工作五年,他做出了一个在旁人看来有些不寻常的选择:开启在职深造,于 2026 年进入上海交通大学攻读博士学位。这次“回炉 ” 是杨一帆主动拓宽自身研究视角的选择。依托微软亚洲研究院与上海交通大学的深度合作,读博期间,他可以继续推进原有的科研项目,并借助双方的资源深化对研究课题的探索。 杨一帆在上海交通大学致远学院进行分享 杨一帆能够在工作之后重返校园,得益于微软亚洲研究院一以贯之的人才培养理念:在提供自由、包容的科研环境的同时,也支持员工在职深造、不断提升自己。基于研究院与高校的长期合作,研究员们可以在产业前沿与学术思考之间自由穿梭。不同环境带来的多元视角,帮助杨一帆重新审视其研究思路与选题方向,挖掘更有价值的科学问题。 “ 当下的 AI 行业有些浮躁。 ” 杨一帆直言。不少项目的迭代周期都以月为单位计算,要求两三个月就产出阶段性成果。“在职读博对我最大的价值,是我可以静下心来思考更接近第一性原理的问题,并在快速变化的 AI 行业中保持自己的研究节奏,不被短期喧嚣裹挟。” 从视觉感知到智能体探索,持续拓宽智能边界 在微软亚洲研究院工作的五年里,杨一帆的研究领域横跨多个方向,从视觉内容生成、多模态基础模型,到近年来关注的视频世界模型和自进化智能体。尽管研究方向看似跨度很大,但其内核始终如一:拓宽机器智能的边界,探寻智能的本质。 这种思考首先体现在多模态研究上。在杨一帆看来,人类婴儿最初认识世界,依靠的是触摸、观察以及来自外部环境的真实反馈。语言则是人脑对物理世界高度压缩和抽象后的结果。 “ 真正的智能,不能只停留在纯粹的抽象世界里。 ” 带着这样的思考,他和团队将研究视线投向了多模态与视觉表征,希望突破单一语言维度的规模法则( Scaling Laws )。 当时原生文本模型的特征并不适合直接用于多模态训练,业内几乎没有成熟方案能够实现大语言模型与视觉表征的深层对齐。杨一帆和团队从表征本身入手,对不同模态的表示进行了深入的分析和校正,再利用图像 - 文本对重新对齐文本模型的输出空间,使长文本检索等任务的性能得到显著提升,也进一步拓展了大语言模型的泛化能力。他参与的 LLM2CLIP 论文 后来获得了 AAAI 2026 杰出论文奖。 微软亚洲研究院提出的 LLM2CLIP 荣获 AAAI 2026 杰出论文奖 多模态研究解决的是 AI 如何获取和理解更多类型的信息。随着研究继续深入,杨一帆开始关注另一个问题, AI 能否理解一个不断变化的环境。这也是世界模型试图解决的问题:智能体执行动作,环境随之产生反馈,智能体再根据反馈调整下一步决策。世界模型需要学习的,正是现实世界中的状态变化以及其中蕴含的规律。 视觉数据是理解物理世界的重要载体。对视觉信号建模,本质上是对视觉空间背后通用世界知识的压缩,从中学到可以泛化到物理世界的能力。 “ 视觉空间其实有很多与文本大模型类似的特性,例如最近具身智能领域备受关注的 in-context learning (上下文学习)。 ” 他说。而这一方向,杨一帆和团队 2023 年提出的 ImageBrush 方法就是一次早期探索,让模型从一组编辑前后的图像示例中理解操作意图,再对新图像完成类似编辑。 “ 与静态图像相比,视频不仅呈现物体的样貌,还记录了事件如何发生、动作如何导致结果。 ” 通过学习视频中的时空关系和因果线索,世界模型可以预测环境的未来状态,为智能体提供一个低成本的探索环境。 围绕这一方向,杨一帆和团队设计了 World-R1 框架 。在不引入庞大 3D 模块、也不依赖大量 3D 训练数据的情况下,该框架提升了视频生成内容的几何一致性和可控性,并可以作为智能体探索的仿真环境,降低其与真实世界交互时的试错成本。无论是物理世界中的具身智能,还是代码构成的数字环境,都可以借助世界模型加快智能体的迭代。 World-R1 让视频生成从 “ 逐帧合成 ” 迈向 “ 世界建模 ” ,输入文字提示,即可生成具备稳定镜头运动和 3D 空间一致性的视频世界。 当研究从感知和环境理解继续向前推进时,杨一帆将目光转向自进化智能体方向。他认为,智能体并不是 “ 让模型多调用几次工具 ” 那么简单。真正决定智能体能力的是一套完整的工作机制:规划、反思、记忆、工具和技能彼此配合,才能把一次性的回答变成一个可以持续改进的过程。 SkillOpt 正是这一思路下的重要成果。它把自然语言形成的技能视为冻结模型之外的一种可训练状态,再根据任务执行轨迹和反馈进行有约束、可验证的优化。模型本身的权重无需更新,部署成本也无需增加,智能体却能因此获得新的能力。 SkillOpt 的方法设计。可控的文本梯度优化方式带来了更稳定的性能提升。 杨一帆习惯把智能体看作对人类处理复杂任务方式的一种拆解, “ 没人能同时做一百件事,无非是走一步、看一步、想一步,有短期目标,也有长期决策。 ” 当前 Harness 相关研究就是将复杂任务拆解成模型可以处理的子任务,并建立校验和结构化记忆机制,避免长程任务里误差不断累积。模型也可以在完成这些复杂任务的过程中积累经验,持续提升执行能力。 谈及下一步计划,杨一帆说: “ 模型开始向更长程、更复杂的任务攻坚,这对上下文窗口、模型与 Harn
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱