首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

Excel AI 辅助工作流横评:数据分析高手还是照葫芦画瓢?

2026-09-15 1 阅读 约10分钟阅读 Kostya
分享:
字号:
自从 Agentic AI 火起来,我就一直在期待一件事情:有一天我能用自然语言来操控我的电脑做事情,又或者可以用自然语言告诉一个程序它应该做什么。 两年多前,微软推出 Office Copilot Pro 时,铺天盖地的宣传语仿佛在向大家宣告 AI 已经无所不能。实际 测试 下来我才发现,Copilot Pro 不仅经常误解我发送的自然语言指令,而且实际 Office 操作水平也令我不敢恭维。 过去两年里,大模型的能力突飞猛进,各类配套插件与工具也如雨后春笋般涌现。这不禁让我越发好奇:在今天的日常办公中,当我们用 AI 辅助处理 Excel 时,哪些东西会影响到交付成品的质量? 但实测下来我发现,影响最终成品的因素远比想象中复杂。下面我就用具体的测试数据和盲评结果,聊聊当下 AI 辅助制作 Excel 的真实水平,以及我使用 AI 辅助制作 Excel 的心得。 TL;DR AI 写公式的能力已经相当成熟,但复杂工作流后的交付依然存在着不小的问题; 载体(Harness)的重要性不亚于模型,其中 Office 侧边栏加载项是最好的载体; 在用 AI 操作 Excel 文件时,一定要小心 AI 擅作主张的黑箱决策; 编写提示词时一定要足够严谨; 在拿到 AI 处理后的文件,务必修改一次原始数据,排查计算单元格是否能自动更新。 准备 模型与载体 本次测试用到的模型与各类载体主要对应关系如下表所示。 在此需要先界定一下「载体」(即所谓的 Harness)到底是什么?我觉得,载体可以简单理解为调用模型的方式。在 Excel 里,不同的载体会给模型配备不同的工具、接口、环境和规则。 比如,Pi for Excel 属于典型的多模型载体,Pi for Excel 可以安装自定义的技能和插件。我们也可以在 Pi for Excel 保持技能、插件不变的前提下,通过 OAuth 登录或 API Key 自由在模型之间切换,对比不同模型的效果。 又例如,Codex 是独立的工作台,OpenAI 的模型可以不再依托于 Office Add-in(加载项)操作 Office 文档。 对于原生支持推理能力的模型,我在测试中均统一开启 「High 或深度思考」。目前仅有 OpenAI 与 Anthropic 推出了官方 Excel 插件,因此这两家不仅会使用第一方的加载项,也会使用 Pi for Excel 加载它们的模型来测试。其余模型则统一通过开源插件 Pi for Excel(详见 GitHub 页面 )在 Excel 侧边栏中调用。 常规 Office 加载项主要基于 Office.js API 与表格交互;值得一提的是,Pi for Excel 额外支持执行 Python 代码片段来处理复杂数据,所以测试流程里我同样会开启这个功能。 与嵌入 Excel 内部的插件不同,独立工作台(如 Codex 等)采用「文件+提示词一同提交」的端到端交互形式,在独立应用内完成分析并生成最终文件。 测试用例 我根据我之前的文章 《常用 Excel「奇技淫巧」,助你在新的一年处理数据事半功倍,「马到成功」》 中所提到的大部分场景,编制了全新的测试用数据集,具体如下表所示。 所有的测试用例及题目所用到的提示词,可以在 我的 Notion 页面 找到。如果你有自己偏好的模型和载体,也非常欢迎下载本文提供的测试用例和提示词自行测试,看在你的实际工作流中,不同模型和载体的组合能不能复现这篇文章的结果。 测试流程与观测指标 其中,在相同的环境下,用所有软件最新的正式版测试。每轮测试均在全新的独立 Excel 文件中执行,文件统一按「题号-三位随机编号」命名。 各题主要观测指标如下图所示: 硬编码情况 用于评估 AI 输出的是 Excel 原生动态公式,还是通过 Python 在后台计算完成后直接向单元格写入静态数据(也就是硬编码)。这里会影响表格后续的维护成本。 无损原则 则考察 AI 在提示词未明确要求的前提下,是否擅自改动、覆盖或破坏了原始表格中的数据与版式结构。 在这次测试中,我们还会记录任务从发起到交付所需的 实际交互次数 ,当然理想状态是一次就交付。如果执行中出现中断卡死、格式错漏需要人工纠错或催促,则需要额外的交互,我也会记录具体的原因。 最后我想通过数据,回答这三个问题: 数据真能算对吗? AI 交付的 Excel,在数值准确性、公式逻辑和完整性上究竟有多可靠? 表现足够稳定吗? 在不同载体和复杂任务面前,模型的交付能力到底怎么样? 打工人该怎么用? 面对日常繁杂的 Excel 办公需求,我该如何构建正确的提示词与工作流,来最大程度地发挥 AI 的长处呢? AI 做的表还不错,但是任务越复杂越容易出问题 我平时用 AI 帮我处理 Excel 表格的场景,不外乎用来: 数据清洗 、 高频重复公式编写 以及 成品交付 。针对这三类场景,我分别设计了难度递进的测试,并在实测中发现了一些非常有意思的现象。 数据清理任务:发现了 ≠ 告知了 ≠ 正确处理了 在我的工作中,最耗费精力的就是数据清洗。因为不管是分类汇总、还是分析统计,都需要有可靠、统一的数据。那面对这些繁琐琐碎的脏活累活,AI 的实际表现又如何呢? 大模型从原理来看很擅长处理这类任务,能识别「表述不同但含义相同」的模糊数据;且在正则表达式或 Python 的帮助下,也能批量地处理文本。但不同的 AI 实际表现也不同。例如,在「按姓名匹配员工信息」(测试 A09)这个题目中,姓名存在重名,同时还有两个姓名是找不到的,AI 处理的方式各不相同。 表现最好的是 Claude Cowork,它会主动停下来问我重名员工应该如何处理,并提供了几个选项:备注、只匹配第一个,或者是两个都写上。 ChatGPT for Excel、Claude for Excel、DeepSeek(Pi for Excel) 虽然都在对话里提到了重名,却已经擅自替我做了决定,使用了 XLOOKUP 默认匹配第一个值的情况;Kimi-K3(Pi for Excel) 更进一步,直接在单元格里加了注释。 而 Claude(Pi for Excel)和 Gemini(Pi for Excel)则没有提到重名的情况,直接 XLOOKUP 默认匹配第一个值。 最离谱的是 Workbuddy,对于两个找不到的名字,直接凭空硬凑了两个最像的名字填进去。 面对数据冲突、重复项或匹配缺失等异常情况,在提示词未明确指定清洗与补全规则的前提下,绝大多数产品都选择了「擅作主张」,出乎了我的意料。 在我看来,任务场景越复杂,「主动向用户提问确认」 就越关键。测试里,AI 翻车也大多数是因为要求模糊,或者数据存在歧义。目前,解决这个问题最好的办法就是,告诉 AI: 有歧义要提问 。 后续,「图书销售数据分析任务」(测试 A11)复杂程度更高,在数据清理的基础上,还要分析。我也在提示词中规定了有歧义要提问: 这是某小型连锁书店2025年销售订单记录。现在需要完成以下任务,需要保证可读性。如有任何模糊不清的地方,停下来问我: 找出数据中任何不合理的地方并清理,包括但不限于重复订单、数据格式问题等。 使用数据透视表分析不同销售渠
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱