首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

百度搭子追WorkBuddy,不能只拼“干活”

摘要

2026年,硅谷正在把办公从“人操作软件”,改成“人交代任务,Agent操作软件”。 微软继续围绕Microsoft 365做Agent,把Copilot Cowork、Office里的Agent能力以及Agent 365逐渐连起来;Google让Workspace Studio把企业SOP变成可复用的Agent流程;OpenAI 7 月发布 ChatGPT Work,让它跨文件和连接的应用持续工...

Agent Code Harness WorkBuddy Claude ChatGPT CodeBuddy use 2026年 硅谷正在把办公从
2026-08-20 1 阅读 约10分钟阅读 新立场Pro
分享:
字号:
2026年,硅谷正在把办公从“人操作软件”,改成“人交代任务,Agent操作软件”。 微软继续围绕Microsoft 365做Agent,把Copilot Cowork、Office里的Agent能力以及Agent 365逐渐连起来;Google让Workspace Studio把企业SOP变成可复用的Agent流程;OpenAI 7 月发布 ChatGPT Work,让它跨文件和连接的应用持续工作数小时。 产品形态不同,但方向逐渐靠拢: Agent 不重新做一套办公软件,而是争夺现有软件之上的任务执行层。国内的情况则稍微反常,第一轮真正跑出规模的,是 WorkBuddy、百度搭子这类更接近 Claude Code 的独立 Agent。 7月23日,腾讯发布了 WorkBuddy Bench,把七个头部模型装进 CodeBuddy Code 和 Claude Code 两套 Agent Harness,完成代码、网页、办公和安全四类共 260 项任务。 其中,办公恰好是模型与 Harness 变化后表现最稳定的一类。 在 CodeBuddy Code 环境里,七个模型得分落在77.47—82.37之间;换一套 Harness,七个模型里有五个得分变化不到2分,中位绝对变化只有0.86分。 这至少说明,在这组标准化办公任务里,模型和 Harness 暂时没有拉出像代码、安全任务那样明显的差距。“能把事情做出来”,正在接近一项越来越普遍的基础能力。 Agent 提高了任务完成速度,人的工作却没有按同样比例消失。一个研究员可以把五家公司的三年财务数据交给 Agent,让它找异常、查原因,再做成一页 PPT,过去最耗时间的步骤可以被大幅压缩。可如果研究员拿到结果后,还得重新打开财报、逐个检查数字、确认日期和来源,AI 省下来的制作时间,又有一部分变成了核对时间。 这是办公 Agent 接下来一道更难的题: 会干活之后,怎么让人敢直接用。 百度恰好在这个时间点追了上来,它手里的牌与腾讯并不一样。昨日发布的Q2财报显示,百度 AI 应用季度收入为25亿元,同比增长3%;6 月,搭子企业版上线;同期百度文库和网盘的AI DAU 渗透率同比增长27.4%。 这些收入和用户并不全部来自办公 Agent,但意味着百度不是从一个空白的桌面产品开始竞争——它身后还有搜索、文库、网盘等已经运行多年的信息和文件体系。 当“把事情做出来”越来越接近基础能力,办公 Agent 的竞争开始向两头移动:一头是用户为什么愿意把第一项真实任务交给它;另一头是任务做完以后,为什么敢不再重新检查一遍。 腾讯和百度手里的旧资产,恰好分别对应这两个问题。 第一项任务,比一次下载更重要 Agent 比 Chatbot 更需要别人教你怎么用。 ChatGPT 刚出现时,用户几乎不需要产品教育,打开一个对话框,问一句“北京明天天气怎么样”,用户就能理解它是什么。Agent 复杂得多,它能读本地文件、改 Excel、操作浏览器、调用 Skill、执行几十分钟的任务,还可以定时运行、连接外部软件。能力越多,用户反而会面临一个更具体的问题: 我现在到底应该把哪件事交给它? 对Agent来说,最有效的产品说明,往往是别人已经做出来的东西。7月1日,微软三名研究人员公布了一项关于公司内部 Claude Code 和 GitHub Copilot CLI 采用情况的研究。他们分析了微软数万名工程师在 2026 年初的真实使用数据。研究把“第一次使用”和“之后持续使用”分开,结果显示,两者由不同因素驱动:工程师之后会不会留下来使用,更多与自身编程活动相关;但一开始会不会试,明显受到周围同事影响。 论文对此的概括很直接:first use spread primarily through social networks,即第一次使用主要沿着社交网络传播。并建议企业在推广 Agent 时,把“visible peer use”,也就是让人看到身边的同事正在实际使用,纳入推广策略。 研究对象是微软工程师,产品是Coding Agent,不能直接推导所有办公用户都会重复同样的路径。但它解释了一个 Agent 产品很特殊的传播机制: 功能介绍没有任务演示有效。 腾讯正好有一张适合承载这种传播的关系网。WorkBuddy 已经支持用户从微信、企业微信、QQ、钉钉、飞书等通信入口远程给电脑下发任务并接收结果,腾讯至少拥有一张更容易让 Agent 使用方式在同事、朋友和群聊中被看见的关系网。 传统互联网经常衡量获客成本 CAC,Agent 时代可能需要多看一个传统互联网不太关注的指标: 获得第一项真实任务的成本, 广告可以购买安装量,免费 Token 可以换来注册量,但两者都不能保证用户知道第二天该拿它做什么,同时做出来的结果还可以。 这也是为什么 WorkBuddy 目前超过 1100 万的 PC 月活值得观察,但还不能简单解释成“腾讯流量大,所以腾讯赢了”。产品能力、补贴、上线时间和市场投放都会影响数字,现阶段没有证据可以证明微信关系链与 WorkBuddy 的增长存在单一因果关系。更准确的说法应该是: 腾讯拥有一项恰好适配 Agent 冷启动问题的资产。 百度搭子的增长速度则说明,市场还远没有定型。百度 3 月正式推出 DuMate,官方资料显示,它从一开始就定位为桌面级办公 Agent,之后保持了非常高的迭代频率。截至8月7日个人版已推进至v1.0.67,期间陆续增加网页发布、内嵌浏览器、远程任务和自动化模板等能力。 8月12日,百度披露,搭子上线以来日均提问次数已经增长60倍,近一个月又增长两倍。 但如果竞争一直停留在“谁能更快让用户知道 Agent 能干活”,百度面对的是一道不那么有利的题。腾讯可以利用人与人的关系,让一个任务沿着同事、朋友和群聊继续传播。搜索可以带来需求,文库和网盘可以带来内容,地图可以带来位置,云可以连接企业,但它很难短期再造一张微信式的人际关系网。 所以它需要换一道题, 不是继续证明自己的 Agent 也会干活,去证明当 Agent 干完活以后,用户可以少检查一遍。 这才是搜索、专业内容和知识体系真正可能重新变得值钱的地方。 搜索的“旧”资产,只有变成证据链才值钱 Agent 做得越多,人验证它的成本就越重要,这是办公 Agent 与 Chatbot 最大的区别之一。 让模型写一篇文案,里面有一句错误,修改一句就可以。让 Agent 完成一次行业研究,它会自己搜索、筛选材料、提取数据、计算、形成判断,再制作文件。 链条越长、任务执行得越完整,一个早期错误被放大的空间反而越大。 接入搜索也没有彻底解决这个问题。ACL 2026 的多项工作仍在专门研究 RAG 场景中的幻觉检测,其中一项方法直接将生成内容与检索证据对齐;另一项构建长上下文 RAG 基准的研究发现,现有幻觉检测器距离性能上限仍有明显空间。 换句话说,检索到了材料,并不等于最后生成的每一句话都得到了材料支持。 所以,“有搜索”和“可信”中间仍然隔着一层东西—— 证据。 模型不忠实于证据是一层问题;更麻烦的是,证据本身也正在变得越来越难选。 这个问题还因为 GEO 变得更复杂,过
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱