智能AI
morning
央企做了个通用Agent,直接杀进IDC实测前三!
摘要
央企做了个通用Agent,直接杀进IDC实测前三! 十三 2026-09-17 17:39:19 来源: 量子位 金磊 发自 凹非寺 量子位 | 公众号 QbitAI 起猛了, 央企 做的企业级 通用Agent ,排进了国内前三! 这便是 IDC 在最新发布的 国内首份 《中国企业级通用Agent产品技术评估》给出的结果: 而这家央企,便是 中国电信 。 并且这次IDC没有继续沿用大家熟悉的大模型...
量子位
央企做了个通用Agent
直接杀进IDC实测前三
2026
凹非寺
公众号
QbitAI
起猛了
做的企业级
通用Agent
2026-09-17
1 阅读
约9分钟阅读
十三
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 央企做了个通用Agent,直接杀进IDC实测前三! 十三 2026-09-17 17:39:19 来源: 量子位 金磊 发自 凹非寺 量子位 | 公众号 QbitAI 起猛了, 央企 做的企业级 通用Agent ,排进了国内前三! 这便是 IDC 在最新发布的 国内首份 《中国企业级通用Agent产品技术评估》给出的结果: 而这家央企,便是 中国电信 。 并且这次IDC没有继续沿用大家熟悉的大模型Benchmark,而是拿 近百道非公开任务 ,直接考察一款Agent在真实办公环境里到底能不能把事情做完。 具体来看,TeleAgent常规任务得分3.49分、复杂任务得分3.36分;九项能力中,任务表现拿到5分满分,成本效率为此次测评最高分。 而且TeleAgent正式上线的时间还不算久,今年4月,TeleAgent桌面端还在公司内部试用。到7月,V1.0才正式对外推出。短短一个多月,如今用户规模已经接近120万。 那么问题来了: 一家央企做出来的通用Agent,为什么能在这一轮竞争里跑得这么快? 近百道题考Agent,中国电信跑进前三 在深挖TeleAgent如何拿下第三名之前,我们且得先需要了解一下IDC这次到底考了什么。 以前我们熟知的Benchmark,更多是倾向于把问题简化成一组分数;数学、代码、推理、知识,一项项跑完以后,就能大致判断模型能力处在哪个位置。 但要考验通用Agent的能力,评测的打法就不一样了;毕竟它面对的是公司内部纷繁复杂的业务。 也正因如此,IDC这次把测试的重点放在了 端到端把事情办完 上。 按照IDC的定义,企业级通用Agent需要能够理解目标、调用工具和Skill、连接企业知识和业务系统,并且持续执行任务。 围绕这个目标,IDC设计了将近百道非公开任务,既包括邮件、日程、文档处理这类日常办公,也加入了长上下文、多步骤循环、复杂PPT、表格处理和浏览器操作等复杂任务。 其中有些题目已经很接近真实工作,比如Agent要处理3755行脏数据,或者从约3万字材料中提炼内容,生成11页PPT。 任务跑完还不算结束,IDC还会继续核验系统状态和最终文件,确认Agent是否真的完成了任务。 而从测试结果来看,现在大多数通用Agent已经能把复杂任务跑起来,但随着任务变长、步骤变多,交付质量和资源消耗的差距也会随之放大。 也正是在这套考法下,TeleAgent的任务表现拿到满分,同时又把成本效率做到此次评测最高。 随着任务复杂度、上下文长度和工具调用次数不断增加,各家产品之间的成本和交付差异也同步放大。 这说明通用Agent发展到现在,底层模型已经很难解释全部差距;一款Agent最后好不好用,越来越取决于模型外围那整套工程系统。 一个Agent能否干好活,模型只是一部分 IDC在这次报告里还专门提到了一个词—— Agent Harness 。我们可以把它简单理解成围绕大模型搭起来的一整套执行系统。 模型负责理解和推理,但一个复杂任务真正开始运行以后,系统还要安排上下文、调度工具、保存任务状态、控制执行环境。中途一旦出现异常,它还得判断是重试、换路径,还是恢复之前的进度。最后结果生成出来以后,系统还要检查任务到底有没有完成。 这些能力在短任务里不一定明显,可任务一旦拉长,差距就会被迅速放大。TeleAgent这次拿到的几个高分项,也基本可以从这条工程链路往下拆。 首先是上下文。 Agent工作时间越长,打开的文件、调用工具返回的结果、前面聊过的内容都会不断塞进上下文。如果系统一直往里堆,Token很快就会膨胀;可如果压缩得太狠,Agent又可能把用户一开始交代的要求一起忘掉。 TeleAgent为此做了一套分级处理。系统会先对价值相对较低的旧工具输出做轻量剪枝,如果上下文依然过长,再由专门的压缩模型对整段内容进行处理。同时,系统还会实时监测上下文是否接近上限,一旦触发窗口限制,就先自动压缩,再继续执行后续任务。目前TeleAgent的上下文窗口已经突破400K。 但仅仅让一次长任务不断线还不够,因为企业办公经常会跨天甚至跨项目。所以TeleAgent又加上了 autoDream长期记忆 。 它会定期整理近期对话,再把新的信息与已有记忆合并。如此一来,项目背景、用户习惯和个人偏好可以跨会话继续保留,用户第二天重新打开时,不需要每次从头解释自己在做什么。 而在更底层,中国电信并没有直接把一个现成的Coding Agent框架套进办公场景。 TeleAgent的核心内核包含约3万行自研Go代码,团队还专门处理了Windows PowerShell、麒麟、统信等系统里的兼容性问题。与此同时,产品侧也针对办公任务重新做了适配,因为做PPT、写报告、处理Excel,和在代码仓库里找Bug,本来就是两套截然不同的工作方式。 解决完长任务能不能跑下去,下一件事就变成了这么跑到底 贵不贵 。这也是企业使用Agent时很难绕开的账。 TeleAgent为此又做了一套 ModelRouter 。 每次请求进来以后,系统会先根据模态、长度、关键词等信息判断任务复杂度,再把任务分配到轻量、均衡和旗舰三档模型。像翻译、总结、格式化这类任务,会优先交给轻量模型;到了PPT、文档生成和办公自动化,系统会进入均衡档;如果用户要做深度研究、代码调试或者复杂方案,再调动旗舰模型。 这样一来,Agent不用每处理一个简单任务都调用最重的模型。 从优化的数据来看,这套智能路由可以把推理成本降低约40%,简单任务响应时间可以控制在3-5秒,路由延迟低于10ms。与此同时,TeleAgent还在推理侧加入了PD分离、KV Cache和负载感知调度等优化。 这也就不难理解,为什么TeleAgent这次在IDC的成本效率维度拿到了最高分。 但企业真的要把Agent接进内部系统,还得再解决一个问题,也就是 安全 。 当Agent只负责生成一段文字时,出错以后最多重新生成一次。可现在的Agent开始能够操作文件、调用系统、修改数据,甚至代替员工执行一些业务流程,一次错误操作带来的影响明显更大。 而TeleAgent从一开始就把这部分看得比较重。Skill进入系统以前需要检查来源、病毒和漏洞;短期记忆与长期记忆分别管理;文件读写被限制在指定工作目录;高危命令会被监控,代码和文件操作则尽可能放在隔离环境中完成。 当然,这套思路也直接影响了TeleAgent的上线节奏。今年4月,桌面端其实已经进入内部试用,但TeleAgent随后又花了两个月做安全测试和能力优化,直到7月才正式推出。 对于一款追求快速增长的互联网产品来说,这样的节奏可能显得保守;放到央企内部,这反而成了产品必须先过的一道门槛。 也正因如此,TeleAgent成为首批通过中国信通院相关安全评测的智能体产品之一;在中国电信研究院内部安全评测中,通过率达到98.2%;与外部安全厂商联合进行的28个场景、336个测试用例里,通过率达到99.7%。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱