首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

一句话表达意图,AI完成视觉交付:DeepVisual Agent 重新定义智能创作

摘要

(本文阅读时间:15 分钟) 对于人类来说,视觉始终是信息获取效率最高的通道。神经科学研究表明,人类大脑每秒接收约 1100 万比特的感官信息,其中约 80% 来自视觉,但人脑有意识层面的信息处理速度仅有 10–50 比特 / 秒。 视觉不仅承载着绝大部分信息输入,也是人类理解复杂内容、组织知识与完成决策的重要方式。 但在生成式 AI 席卷全球的今天,绝大多数大模型与智能体依然停留在文本输出阶段。...

DeepVisual Agent PPT Demo Make Edit PPTX 本文阅读时间 对于人类来说 视觉始终是信息获取效率最高的通道
2026-08-27 1 阅读 约10分钟阅读 微软研究院AI
分享:
字号:
(本文阅读时间:15 分钟) 对于人类来说,视觉始终是信息获取效率最高的通道。神经科学研究表明,人类大脑每秒接收约 1100 万比特的感官信息,其中约 80% 来自视觉,但人脑有意识层面的信息处理速度仅有 10–50 比特 / 秒。 视觉不仅承载着绝大部分信息输入,也是人类理解复杂内容、组织知识与完成决策的重要方式。 但在生成式 AI 席卷全球的今天,绝大多数大模型与智能体依然停留在文本输出阶段。 由于文本输出的限制,原本旨在提升效率的 AI 反而给用户带来了大量需要二次加工的工作。对于知识工作者而言,超过 60% 的精力被消耗在资料检索、素材整理、版式设计、幻灯片制作等重复性的“元工作 ” 上。而现有 AI 工具大多只能解决单点任务,难以形成完整的工作流闭环,大多停留在一次性输出结果阶段,缺少和 AI 往复沟通、迭代打磨的能力。 针对这一痛点,微软亚洲研究院推出了 DeepVisual Agent 。该智能体以 “ 意图输入,视觉交付输出 ” 为核心目标,突破了传统 AI 生图与纯文本输出的局限,将用户从繁琐的资料搜集、内容组织与视觉设计工作中解放出来。用户不再需要在多个工具间反复切换, 只需输入一句任务描述,即可获得协作创作的视觉成果 ,如幻灯片、海报、信息图等。在这一过程中, DeepVisual Agent 始终贯彻 视觉优先、人类增强智能、动态自适应评估 三大理念,重构人机协同的视觉创作流程,为用户提供端到端的解决方案,也为多模态智能体的发展提供了新的思路。 相关论文信息已整理至文末,欢迎点击了解更多技术详情。 拆解 DeepVisual Agent :四步走通视觉交付全链路 从一个初步想法到可交付的视觉作品, DeepVisual Agent 能够自动完成完整的视觉创作流程。这并非传统意义上的文生图或文生 PPT ,它更像一位经验丰富的设计师和助理的共同协作:先理解需求,再搜集资料、设计版式,并在用户与智能体持续沟通中迭代优化,最终交付一份可以继续编辑和使用的视觉物料。 第一步,收到用户需求后, DeepVisual Agent 并不会立刻生成页面,而是先 理解用户的真实需求 。例如,确认幻灯片页数、输出语言、受众对象等关键信息,并据此自动规划整份演示文稿的逻辑框架。 D e mo 1 : DeepVisual Agent 对需求的理解 第二步,完成结构规划后, DeepVisual Agent 会 主动搜集所需信息 。例如,当用户制作关于 “Mit Rahina 遗址新发现 ” 的 PPT 时,智能体会自动搜索全球权威新闻网站和学术数据库,获取相关素材并下载至素材库,省去了用户在浏览器与创作软件之间反复切换的繁琐操作。 第三步,基于设计简报和收集到的图文素材, DeepVisual Agent 会 自动规划每一页的视觉布局 ,生成标题、正文、图片、图标及配色方案,并保持整份文档在字体、色彩、页面结构等方面的风格统一。 相比许多生成式工具容易出现页面风格割裂、内容拼接感较强的问题,它更强调整套视觉内容的整体性,让内容逻辑与视觉风格同步建立, 形成统一完整的表达 。 Demo 2 : DeepVisual Agent 进行版式设计 第四步, DeepVisual Agent 为用户提供了可编辑( Make Edit )功能,针对不同用户偏好、使用习惯与任务特性,构建了多层级、可灵活选择的人机协作方式。包括,用户可以使用简单的自然语言指令修改,只需用如 “ 删除页码 ” 这样的文字描述需求;用户还可以基于图像修改模型进行交互式修改,比如直接框选出修改区域,然后描述修改行为;一键将生成结果转换为标准 PPTX 格式,允许用户像常规的 PPTX 设计流程一样,精细调整每一处细节。 与此同时,系统支持同时产生多个不同设计的版本给用户预览,方便用户选择最满意的方案 ,真正实现 “ 所见即所得 ” 的高效人机协同创作。 Demo 3 : DeepVisual Agent 的 Make Edit 功能使用 另外,研究员们还为 DeepVisual Agent 构建了一套包含上千种可视化技能的技能库( Skill Library ) ,这些技能是智能体从大量公开教学视频中自动学习获得的。例如,行星环绕动态动画、滚动增长图表、多模块分层排版等,都可以直接应用到当前的文稿中。 Demo 4 :动态效果演示 目前, PPT 只是 DeepVisual Agent 选择的第一个落地场景。未来,它还将逐步扩展至海报、信息图、网页、数据仪表盘等更多商业视觉内容。 无论面对何种视觉交付需求,用户都能通过这一个智能体,实现从构思到交付的完整闭环。 多项核心技术构建面向持续人机协作的视觉智能体 多项微软亚洲研究院自主研发的核心技术,让 DeepVisual Agent 实现了能够将简单需求转化为结构完整、风格统一且支持持续迭代修改的一体化视觉创作。 主动获取信息,让 AI 告别 “ 被动等素材 ” 传统 AI 工作流通常依赖用户提前搜集并上传参考资料,但 DeepVisual Agent 则能够同时打通互联网公开信息与本地私有文档两类数据源,具备深度检索、数据自动清洗和信息结构化能力。 一方面,智能体融合 GUI Grounding (图形界面定位)与 CUA ( Computer Use Agent ,计算机操作智能体)技术,既能识别屏幕内容、理解界面控件并操作电脑,还可访问传统搜索引擎难以触达的 Web 数据库与动态表单,获取更全面的信息。 另一方面, DeepVisual Age nt 底层搭载 RE‑TRAC机制 。传统深度研究智能体在多轮检索中容易遗忘过往探索路径,高达 93% 的失败分支会被重复遍历。 RE‑TRAC 会在每轮检索结束后,将已有发现、验证结果和待解决 问题压缩为结构化经验,并向下传递。这使得每一次检索都建立在已有信息之上,持续提升检索效率,确保获取的信息与生成任务高度匹配。 灵活共创:让修改更精准、更自然 过去几年,生成式 AI 虽然能够生成越来 越精美的视觉作品,但大多数结果本质上仍是一张完整的图片:页面中的文字、图片、图标和图表融为一体。当用户希望调整其中某个细节时,如何让 AI 准确理解 要修改哪一部分、怎么修改,以及哪些部分需要保持不变 ,仍然是一个挑战。 针对不同的修改需求,研究员们为 DeepVisual Agent 自研了 4B 参数规模的轻量化 文生图系列模型 Lens ,给用户提供了三种灵活的编辑方式。 自然语言或语音描述。 用户可以直接通过文字或语音表达修改意图,模型支持超长提示词,能够理解复杂指令。目前已支持目标擦除、局部重绘、光影调整等能力,并持续扩展更多编辑场景。 手势涂画直观操作。 研究员们还引入了 Vibe Editing (氛围编辑),用户无需编写复杂提示词,直接在图片上用鼠标或触屏即可进行自然修改。例如,想删除某个物体,用户可直接圈出目标并画叉;想新增元素,框选位置并写下需求;想调整画风,圈选区域并输入 “ 色调更暖 ” 。这种 “ 边改边看 ” 的交互方式大幅降低了编辑门槛,也让 AI 能够真正融入人们熟悉的创作流程。 Demo 5 : Vibe
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱