首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

给 Agent 装上方向盘和刹车,Harness 时代的工程新范式

摘要

Agent 已成为 AI 应用发展的重要方向,从简单的信息问答走向代码生成、系统操作和业务流程执行。但当 Agent 进入真实业务环境,它需要理解复杂系统、调用各种工具、遵守业务规则,同时还要能被验证和持续优化。这就带来了一个新的工程问题:如何构建适合 Agent 工作的工程环境? 近日,InfoQ《极客有约》X AICon直播栏目特别邀请阿里云技术专家张鑫、NoDesk AI CTO王仿、腾讯高...

Agent Harness Engineering AICon 全球人工智能开发与应用大会 就像发动机马力不大的时候不需要方向盘和刹车 马力强了才需要配套安全防护 https infoq 为什么需要
2026-08-04 1 阅读 约10分钟阅读 AICon 全球人工智能开发与应用大会
分享:
字号:
Agent 已成为 AI 应用发展的重要方向,从简单的信息问答走向代码生成、系统操作和业务流程执行。但当 Agent 进入真实业务环境,它需要理解复杂系统、调用各种工具、遵守业务规则,同时还要能被验证和持续优化。这就带来了一个新的工程问题:如何构建适合 Agent 工作的工程环境? 近日,InfoQ《极客有约》X AICon直播栏目特别邀请阿里云技术专家张鑫、NoDesk AI CTO王仿、腾讯高级后台开发工程师/项目组 Agent 落地负责人任磊达一起,在 AICon 全球人工智能开发与应用大会 "2026深圳站 即将召开之际,共同探讨 Agent Infra 从“可用”走向“高效可规模化”的关键路径。 部分精彩观点如下: 就像发动机马力不大的时候不需要方向盘和刹车,马力强了才需要配套安全防护。Harness 不是消灭幻觉,而是用工程系统承接和约束不确定性。核心两点:让 Agent 做正确的事,以及正确地做事。可观测也很关键,只有观测到 Agent 的执行逻辑,才能从数据中学习它为什么错、错在哪,形成飞轮效应。企业内部的数据、知识、系统都是给人构建的,现在要让数字员工上岗,首先要把给人看的上下文翻译成 Agent 能理解的语言,这就是本体论。Agent 只会道歉,没办法背锅。专业性是人的核心价值,也就是判断力。 在 8月 21-22 日将于深圳举办的 AICon 全球人工智能开发与应用大会 "2026深圳站上,我们特别设置了【 Harness Engineering:模型之外的智能体工程 "】专题。该专题将邀请一线团队分享他们在构建、运行、演进 Agent Harness 过程中的真实经验与教训。查看大会日程解锁更多精彩内容:https://aicon.infoq.cn/2026/shenzhen/track 以下内容基于直播速记整理,经InfoQ删减。 完整直播回放可查看:https://www.infoq.cn/video/4a2B42u4btbcGi6295ut 为什么需要 Harness Engineering? 张鑫:从大家目前的实践来看,Agent 当前最大的可靠性挑战是什么?为什么需要 Harness Engineering? 张鑫:Agent 当前最大的可靠性挑战,不应该简单归结于模型幻觉或推理能力不强。模型能力越来越强,但进到真实业务环境以后的失败,绝大部分发生在模型之外。比如 Agent 怎么知道正在操作哪些业务对象?对象是什么状态?跟别的对象有什么关系?有哪些可靠数据来源?可以执行哪些工具?执行完怎么确定达到了预期状态?如果这些问题没解决,换更强的模型也是盲人摸象,甚至会以非常专业、非常确定的语气告诉你任务完成了,实际上并没有。真正的挑战是怎样让 Agent 在持续变化的环境里,形成理解、行动、观察、验证的闭环。从我做 UnifiedModel 的角度出发,我更关注怎么样让 Agent 真正理解一个真实的业务系统——把业务对象的关系、状态和证据组织起来,而不是面对一堆零散的文档和数据。它需要的是一个可以被理解、被观测、被操作的系统世界。 王仿:今年大家都在讨论 Harness,背后说明模型能力确实越来越强了。就像发动机马力不大的时候不需要方向盘和刹车,马力强了才需要配套安全防护。Harness 本质上不是限制模型能力,而是让它在可控范围内发挥作用。实习生答错问题有人兜底,但正式员工真的把款退了或做了不可控操作,影响就非常大了。不光应用公司在做,OpenAI、Anthropic 也在做模型之上的 Harness 能力建设。 任磊达:最近争议比较大的 Fable,从技术角度看它有个很有意思的地方——把读写 KV 存储的能力加进去了,本质上是在吸收工程技巧到模型里。这其实是一个跟模型互利共生的关系:一方面从好模型里学怎么让成本更低的模型 work 起来,另一方面在尝试怎么驾驭模型。我昨天一不小心烧了七八亿 token,给我吐了四万行代码,就一个很小的模块,这就是典型 Harness 失控。Harness 从二三月份火起来后,一开始说得很虚,什么都像 Harness。真正接触多了之后,我的感觉是,Harness 包括 Loop,本质上是一个人机交互的工程:我怎么跟 Agent 交互?我要做什么?Agent 吐什么能让我满意?怎么让产出有正向 ROI?找到跟模型交互的协同模式,就是所谓的 Harness。 王仿:实践上,面向企业的 Harness 工程核心要解决几件事。一是上下文管理,在什么阶段注入什么上下文。二是跨系统集成,企业有 ERP、OA、WMS,要在可控环境里调用。三是 skill 调度,复杂场景下 skill 越多模型反而越差,因为经常调错。企业任务不是跑通一次就完了,是每天几百上千个任务要稳定执行。还有权限、可观测、评测体系,企业要发展,市场在变,怎么通过 Harness 让 AI 快速适应变化。 张鑫:Harness 不是消灭幻觉,而是用工程系统承接和约束不确定性。核心两点:让 Agent 做正确的事,以及正确地做事。可观测也很关键,只有观测到 Agent 的执行逻辑,才能从数据中学习它为什么错、错在哪,形成飞轮效应。 任磊达:Harness 在我理解里是两层:一层是架构层面,聚焦怎么做 Agent,包括可观测性等底层架构;另一层是用 Agent 的层面,更关注流程,人在什么时候接入,怎么促进飞轮转起来。这也是我下个月AICon上的分享的主题,在真正的研发流程中,人怎么接入。当架构更清晰之后,人在里面的效率会更高,产出也更稳定可控。 张鑫:任老师现在还在用 RAG 做专有领域的知识检索吗? 任磊达:RAG 本身也是 build agent 的一个过程。我们更多是用 Agent 去 build 业务逻辑和流程,在现有流程下把 Agent in loop 放进去。之前推 Tokenmaxxing 的时候要求 Agent 100% in loop,但这是不是最好的形态?人在什么时候进去?包括最近 OpenAI 很火的 RSI 模型自进化,当模型自己能进化了,人在里面的价值是什么?我们最后要维护什么、掌控什么?我们会更关注这些边界问题。 Agent 需要什么样的“工作环境”? 张鑫:如果把 Agent 看成一个新员工,企业过去提供给员工的是文档、系统、流程和权限。进入 Agent 时代,我们需要为 Agent 构建怎样的工作环境? 任磊达:我们要给 Agent 结构化的信息、正确的边界。一开始推 Tokenmaxxing 的时候让大家 100% all in AI,去搞清楚 AI 的边界到底在哪里。搞明白了之后才发现,有些事情让它做能提效,有些事情让它做它负不了责。边界的定义一定要从试错中产生,没有一两个生产事故,可能感受不到这个边界到底会影响到什么地方。 张鑫:适合 Agent 的工作环境至少解决四个问题,跟新员工进公司是一样的。第一,看得懂,理解系统里的业务对象、模块关系和代码是怎么组织的。第二,做得到,有没有足够清晰的 tool description 交给它去完成这些事。描述是有边界的,给太细了上下文会被撑爆,给太大了它理解的东西和你的会有偏差,又陷入幻觉,
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱