首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

Agent 成本失控背后:上下文、人工审核与维护成本正在被低估|请回答 WAIC 2026

2026-08-01 1 阅读 约10分钟阅读 李冬梅
分享:
字号:
WAIC 2026 的展馆里,最不缺的是关于未来的答案。 有人展示能够自主操作电脑的 Agent,有人讨论模型下一步的推理能力,也有人试图证明,AI 已经可以进入研发、办公和企业生产系统。 世博展览馆的会议室几乎场场爆满,热门展位前排起长队,社交平台上的大会话题持续升温。模型越来越强、Agent 越来越自主,构成了这届大会最直观的叙事。 但在 InfoQ 的第二直播间里,我们提出了一个不那么热闹、却越来越现实的问题:这些能力最终要花多少钱? 这不是一个简单的 Token 定价问题。 一次普通对话可能只调用一次模型,但一次 Agent 任务背后,往往包含目标理解、任务拆解、信息检索、工具调用、上下文读取、记忆存储和结果验证。任何一个环节出现偏差,Agent 都可能重新规划、重新调用,甚至从头执行。于是,模型单价虽然不断下降,企业的调用总量、基础设施压力和人工维护成本却可能持续上涨。 设定这个问题,也与 InfoQ 在 WAIC 2026 期间所做的整体尝试有关。围绕“请回答 WAIC 2026|AI 正在重写什么?”这一主题,我们在现场用三天时间进行了多场对话。 与追逐模型参数、产品发布和热门概念相比,我们更关心 AI 离开展台之后发生的事情:它如何进入企业,如何改变技术系统,又如何改变一家公司计算投入和产出的方式。 因此,在“为了钱包考虑,你必须关注的 AI 基础设施”这场对话中,我们邀请了优刻得 CTO 王凯和焱融科技 CTO 张文涛。王凯长期关注云计算、GPU 算力和模型推理服务,张文涛则从 AI 训练与推理存储的角度观察 Agent 基础设施的变化。 直播回放视频链接:https://www.infoq.cn/video/ZTqtrHdYa75f8FhvVOIR 讨论从一个看似简单的问题开始:为什么 Demo 阶段看起来成本不高的 Agent,一旦进入企业生产流程,账单就可能迅速失控? 但随着对话展开,两位嘉宾谈到的远不只是 Token。他们将这笔账逐渐拆解为任务成功率、上下文膨胀、人工审核、代码维护、多模型编排和企业内部治理。 到最后,问题也变得更加清晰:Agent 时代,企业真正需要控制的不是 Token 数量,而是一次有效任务所消耗的全部资源。 Agent 越来越聪明,企业账单为何反而失控? 在大模型调用价格持续下降的同时,企业的 AI 账单却未必同步下降。 原因并不难理解。普通聊天通常只需要一问一答,但 Agent 要完成的往往是一整条任务链:理解目标、拆解任务、调用工具、检索数据、生成内容、检查结果,失败后还要重新规划和再次尝试。随着上下文不断累积,任务链越来越长,计算、存储和人工干预成本也随之增长。 但一个越来越现实问题摆在行业面前:当模型单价不断下降,企业使用 Agent 的总成本为什么还在增加?企业真正应该优化的,究竟是每百万 Token 的价格,还是完成一次有效任务所付出的全部成本? 谈到 Agent 的成本,王凯首先提出,企业不应只问“Token 贵不贵”,而应该先问“这些 Token 花得值不值得”。 在他看来,随着 AI 应用快速增长,企业使用的 Token 数量出现大幅上升是正常现象。AI 正在尝试替代原有的软件流程和知识工作,一套生产流程在被重新设计的阶段,本身就需要大量实验和投入。 问题在于,许多企业尚未清晰定义自己希望 AI 完成什么任务、达到什么质量,以及愿意为这个结果付出多少成本。 “很多时候我们说 AI 贵,贵在我们为了一个自己没有定义清楚的问题,让 AI 不断地尝试,给出无数个答案。”王凯说。 例如,同样是让 AI 写文章,如果目标、受众、结构和评价标准足够明确,模型可能在少量尝试后完成任务;但如果企业只是要求模型先生成数百个版本,再从中挑选一个,同时又没有明确的筛选标准,成本自然会迅速上升。 因此,王凯认为,当前阶段企业最需要建立的并不是单纯的 Token 限额,而是一套可量化的任务评价机制:要解决什么问题,什么结果算成功,成功一次允许付出多少资源。只有先回答这些问题,企业才能判断 AI 到底是贵还是便宜。 张文涛也认同这一判断。他指出,Token 是模型厂商衡量资源消耗的一种方式,但从企业视角看,更重要的是 Token 最终转化成了多少业务产出。 以代码单元测试为例,企业不能只统计调用了多少 Token,而应该比较:过去一名工程师一天可以完成多少测试,引入 AI 后又能够完成多少;新增的产出是否足以覆盖模型费用和后续人工审核成本。 一旦工作流程明确并逐渐固化,Token 成本通常可以变得可预测。真正容易造成账单失控的,往往是目标尚未确定、流程尚未稳定时的重复试错。 企业最容易漏算的,是人、时间和维护成本 Token 账单至少是可见的。更难处理的是那些没有直接出现在云平台账单里的隐性成本。 张文涛认为,企业最容易忽略三部分成本:人的时间、结果质量和后续维护。 AI 生成代码后,企业通常不可能直接将其投入生产。工程师仍然需要进行代码审查、测试、安全检查和结果验收。即使代码最初能够运行,也不意味着它具备长期可维护性。 与此同时,Agent 的记忆和上下文还会持续增长。随着对话历史、任务状态和外部数据不断写入 Memory,每一次模型调用所携带的上下文可能越来越长。如果缺少记忆压缩、摘要提取和缓存机制,同一任务后期的调用成本可能远高于初期。 王凯进一步指出,Agent 在运行过程中需要反复重构上下文,而上下文叠加会推动计算资源快速增加。这也是 KV Cache、上下文压缩和信息提取逐渐成为推理基础设施关键环节的原因。 除了运行成本,企业还需要投入人员构建 Agent 工作流、评价体系和维护机制。AI 生成的代码如果只能继续由 AI 维护,企业还必须建立一套用于评价、更新和纠错的体系,而这些体系仍然离不开人。 “不能因为有了 AI,就认为所有事情都应该很快、很容易。”王凯表示。企业在没有明确边界的情况下将 AI 用到所有环节,最终可能不是减少成本,而是同时增加模型费用和组织管理成本。 AI Coding 不是生成代码,而是重构软件工程流程 AI Coding 被普遍认为是当前落地最快的 Agent 场景之一,但从生成代码到真正投入生产,中间仍然存在很长的距离。 张文涛提出,企业要构建 AI 原生的软件开发流程,需要的不只是一个代码模型,而是一整套完整体系:如何拆解需求、如何定义不同 Agent 的角色、如何设计测试、如何评价结果,以及新增功能后能否自动完成回归测试和验收。 只有需求、开发、测试和评价被完整串联起来,AI 生成的软件才有可能保持可控。 在此基础上,王凯总结出两条可能的 AI 软件工程路线。 第一条路线,是沿用传统软件工程的基本结构,使用 AI 分别改造需求分析、编码、测试、审查和运维等环节。人仍然负责流程设计,AI 逐步替代其中可以被明确评价的工作。 第二条路线则更加激进:企业只定义输入和最终输出,让 Agent 自主完成中间的规划、编码、测试和迭代,人主要负责评价最终结果。 对于真正从零开始的 AI Native 公司,第二种路径可能带来更高效率。一名工程师借助多个 Agent,理论上可以完成过去一个团队的工作。但对于大部分传统企业
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱