智能AI
morning
当AI开始“看教程”:Resource2Skill 让智能体从多模态资源中学会技能
摘要
(本文阅读时间:12 分钟) 当大模型智能体开始制作演示文稿、搭建网页、编辑表格、创建 3D 场景时,决定最终质量的通常不只是一条指令,而是一套具体的 “ 做事方法 ” :先完成什么、调用哪个工具、检查哪些中间结果,以及失败后如何调整。这些程序性知识作为经验已经广泛存在于人类创造的大量资源中。我们会跟着视频学习操作顺序,从代码仓库理解工具接口,通过技术文章学习设计原则,再参考成熟作品判断最终效果。...
Resource2Skill
Wiki
Skill
代码仓库
PPT
Blender
Excel
MCP
本文阅读时间
当大模型智能体开始制作演示文稿
2026-08-06
1 阅读
约10分钟阅读
微软研究院AI
字号:
(本文阅读时间:12 分钟) 当大模型智能体开始制作演示文稿、搭建网页、编辑表格、创建 3D 场景时,决定最终质量的通常不只是一条指令,而是一套具体的 “ 做事方法 ” :先完成什么、调用哪个工具、检查哪些中间结果,以及失败后如何调整。这些程序性知识作为经验已经广泛存在于人类创造的大量资源中。我们会跟着视频学习操作顺序,从代码仓库理解工具接口,通过技术文章学习设计原则,再参考成熟作品判断最终效果。 但对智能体而言,直接使用这些资源并不容易。比如,教程视频往往较长且包含很多冗余内容;代码仓库能够介绍如何实现,但未必会说明何时使用;技术文章偏重概念、原理,缺少具体步骤;参考作品展示了结果,但常常看不到中间过程。 那么,一个智能体能否像人一样,从资源中学习技能? 对此,来自微软亚洲研究院、加州大学圣克鲁兹分校和上海交通大学的研究员们,联合提出了 Resource2Skill 。该系统能够将教程视频、代码仓库、技术文章和参考作品中的经验提炼为智能体能够浏览、组合且执行的多模态技能,并组织成分层 Skill Wiki 。 简单来说, Resource2Skill 的目标不是让智能体每次遇到任务都重新 “ 读完教程 ” ,而是先将经验沉淀为技能,再根据任务需要进行调用。 研究结果显示: 论文信息已整理至文末,欢迎点击相关链接,了解更多技术详情。 人类会 “ 看教程 ” ,为什么智能体不能直接照着做? 过去几年,不少研究都在尝试为智能体构建 “ 技能库 ” 。然而,大多数技能库主要依赖专家手工编写规则、智能体自身探索产生的轨迹,或者文本与代码形式的资源。这类方法能够记录操作步骤,却很难保存人类经验中那些难以用文字描述的部分。 以教程视频为例,一段操作演示不仅告诉我们 “ 做了什么 ” ,还呈现了先后顺序、界面状态、视觉变化、空间布局和动画节奏等,以及这些步骤之间的关联。直接把整段视频作为上下文输入模型,成本高 且重复信息多;若将其压缩成纯文字,又会丢失视频最有价值的时序和视觉信号。代码、文章和参考作品同样存在类似的问题。 因此, Resource2Skill 所解决的问题并不是再建一个资料检索库,而是把不同资源中互补的信息,转换为智能体可以重复使用的程序性知识。 技能,不只是一段文字 在 Resource2Skill 中,一项技能并不是简单的文本描述,而是一个由多种信息共同组成的能力单元。每项技能都位于领域知识树中的特定位置,同时包含文本、视觉、代码和元数据等多种内容。 不同模态各司其职:文字界定适用性,视觉保存设计意图,代码提供执行落点。 即使某项技能没有可直接运行的代码,仍可作为参考型技能存在,为智能体后续生成实现方案提供依据。 为了适应不同的软件领域, Resource2Skill 允许构建专门的技能分类体系。例如, PPT 按版式、字体、配色、图表、动效等组织; Blender 按几何结构、材质、灯光和镜头等组织; Excel 则围绕函数、图表和数据分析能力组织。虽然组织方式不同,但它们共享同一套浏览、检索和执行机制。 图 1:Resource2Skill 在网页、Excel、Reaper、PPT、Blender、CAD 和 UE5 等软件创作领域中的部分代表性结果。 一条从资源蒸馏到软件执行的统一链路 Resource2Skill 将技能的构建和使用连接成了一条完整的链路。 首先是 资源蒸馏 。系统会收集与目标领域相关的视频教程、代码仓库、技术文章以及参考作品,从中提取关键帧、代码片段、文本说明和示例结果,并借助具备视觉能力的大模型生成结构化技能。 接下来是 确定性验证 。与传统依赖模型的主观判断不同, Resource2Skill 使用明确规则检查技能是否满足完整性、可追溯性、去重、模态一致性以及代码结构可执行性要求。只有通过验证的技能才能进入 Skill Wiki 。未通过执行检查的代码会被标记为参考型内容,避免被默认当作已验证的工具使用。 然后是 分层选择 。面对新的任务需求,系统会先在相关领域内检索候选技能,再结合技能的文本、视觉和代码信息进行综合判断,选出最适合当前任务的技能组合。 最后进行 组合与执行 。智能体通过模型上下文协议( MCP )访问 Skill Wiki 与软件后端,在真实工具中完成规划、应用、渲染和修改等步骤。经过验证的技能代码能够直接作用于软件工具,无需再经过一次语言模型的翻译。 图 2 : Resource2Skill 流程。人类多模态资源被蒸馏为分层 Skill Wiki ,智能体检索并组合相关技能,再通过 MCP 在领域软件中执行。 这条链路也可用于 在线补缺 。如果离线 Wiki 没有覆盖某项能力,系统可以重新搜索相关资源,以同样的蒸馏和验证流程建立独立的临时技能池。离线积累与在线获取不是两套系统,而是同一个 “ 资源到技能 ” 算子的两种使用方式。 七类软件创作任务,平均提升 11.9% 研究 员们 在 PPT、CAD、Web、Excel、Blender、UE5 和 Reaper 七个软件创作 场景中对 Resource2Skill 进行 了 评测 。实验覆盖 GPT-5.5 、 GPT-5.4 、 GPT-5.4 Mini 和 GPT-5.4 Nano 四个模型后端,并包含 4,893 个活跃技能条目,其中既有经过验证的可执行技能,也有提供文字与视觉依据的参考型技能。 每个领域的主实验都使用了 80 个匹配任务,来比较完整的 Resource2Skill 、无技能智能体,及 Claude Code 和 Codex 两类现成智能体执行框架。 提升在操作步骤复杂、工具约束较强的任务中尤为明显。以 GPT-5.4 为例, Excel 从 58.6 提升到 76.4 , Blender 从 29.5 提升到 44.1 , UE5 从 29.1 提升到 67.3 。 Reaper 的提升相对较小,从 73.2 到 77.3 ,说明基础模型原本对这一媒介已有较强的先验。 除自动评测外,研究员们还对跨七个领域的作品进行了匿名人类 A/B 测试。在 200 个独立投票中,有技能版本获得了 136 票,无技能版本获得 23 票,其余为平局。剔除平局后,有技能作品的胜率达到 85.5% 。 为什么视频、多模态和分层 Wiki 如此重要? 研究员们进一步通过消融实验分析了性能提升的来源。 结果表明,视频资源发挥了关键作用。当移除视频,仅保留代码、文章和参考作品时,整体成绩从 68.9 降至 59.4 。而仅使用视频时,成绩仍达到 66.8 。换句话说,视频并不是其他资源的冗余版本,而是提供了独特的信息来源。对于高度依赖操作流程和视觉反馈的任务,视频的重要性更加明显: Web 任务下降了 11.5% , Excel 任务下降了 14.2% 。 研究还发现,多模态信息带来的提升并不仅仅来自 “ 更多文字 ” 。视觉与代码分别提供了独立增益,而分层 Skill Wiki 则显著优于传统扁平化技能库。 另一方面,技能数量也并非越多越好。当技能规模增长到约 200 项后,整体收益开始逐渐趋于稳定。在线获取新技能虽然对标准任务帮助有限,但当系统遇到离线技能库尚未覆盖的新能力时,可以带
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱