首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

开放代码审查:百万真实任务验证的确定性工程与代理相处|QCon上海

2026-09-09 1 阅读 约10分钟阅读 QCon全球软件开发大会
分享:
字号:
从「构建 AI」到「驾驭 AI」,100+ 实战案例拆解 AI Native 时代的工程新实践! 推理模型持续突破能力边界,Coding Agent 深度参与研发流程,Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型,演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力,而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化:团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt,而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么,系统决定 AI 能否真正创造价值。 在这一背景下, 2026 年 QCon 全球软件开发大会大会 · 上海站 "正式启动。本次大会将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验,共同探索 AI 从能力到系统、从实验到生产的真实路径。 阿里巴巴高级研发工程师李峥峰已确认出席 “ AI 驱动的软件工程 "” 专题,并发表题为《 Open Code Review:百万真实任务验证的确定性工程与 Agent 协同 "》的主题分享。本次分享将结合阿里 Open Code Review 的建设实践,介绍如何通过确定性工程 + Agent 协同,将通用 Agent 收敛为适用于代码评审场景的垂直领域 Agent。分享将围绕分治并发、精准定位、规则模板引擎、工具链蒸馏、上下文分层管理等关键工程实践,探讨如何将工程逻辑与模型能力结合,让确定性的工作交给工程系统,让需要语义理解的任务交给大模型,实现更高的稳定性、更低的成本和更好的评审质量。同时,分享还将结合百万真实任务、阿里内部 2 万余名开发者的使用数据以及 Open Code Review 开源项目实践,介绍 AI Review 在生产环境中的效果验证,并进一步探讨 AI 深度参与研发后,如何建立新的评估体系,推动 AI Code Review 从"辅助工具"走向研发流程中的质量基础设施。 李峥峰,阿里巴巴高级研发工程师、Open Code Review 作者、阿里集团 AI 代码评审负责人。主要研究 AI Agent、程序分析等方向,先后负责了集团内代码导航、代码洞察、代码评审智能化等项目的落地,服务了数万阿里集团开发者,在实际业务中取得显著效果。在 AI Agent 系统设计、场景化工具链蒸馏、大规模生产环境下的质量-成本-速度平衡等方面积累了一定的经验。主导开源了 Open Code Review 项目及业界首个多语言、具备存储库上下文感知的 Code Review Benchmark(AACR-Bench),为行业提供了更精准的质量评估标准。他在本次会议的详细演讲内容如下: 演讲提纲:1. AI Coding 普及后,代码评审成为新的效率瓶颈AI Coding 改变了代码生产方式为什么交付质量成为新的核心问题AI Code Review 在研发流程中的价值2. 为什么通用 Agent 难以支撑生产级 Code ReviewDemo 与生产环境的差异覆盖率、定位准确率与稳定性挑战Token 成本与上下文膨胀问题根因分析:Prompt 驱动为什么不足以解决工程问题3. 确定性工程 + Agent 协同:五大工程实践分治并发 —— 提升覆盖率文件选择与智能分组策略从串行 Review 到并行 Agent 协同精准定位 —— 保证评审可落地三层定位机制(文件→代码段→行号)幻觉拦截:确保评论可对应到真实代码规则模板引擎 —— 提升稳定性与一致性从 Prompt 驱动到规则驱动按文件类型/语言动态注入评审上下文工具链蒸馏 —— 提升 Agent 可预测性和安全性从真实任务中收敛高频工具调用模式减少探索性调用,降低不确定性上下文分层管理 —— 降低 Token 消耗冻结区:不变的全局背景压缩区:可摘要的历史上下文活跃区:当前推理所需的最小上下文4. 百万真实任务验证阿里内部生产数据2W+ 开发者使用行为分析AI Review 使用趋势与渗透率变化Benchmark 量化对比准确率与召回率Token 消耗与成本效率Open Code Review 开源实践AI 写 → AI 审 → AI 改:完整研发闭环社区场景下的效果复现5. AI 时代如何重新定义研发度量体系为什么采纳率与 AI 评论占比开始失效?如何建立新的 AI Review 评估体系?6. 总结与展望从通用 Agent 到垂直 Agent 的工程范式AI Review 与 AI Coding 的协同演进AI 驱动研发质量体系的发展方向实践痛点1. 规则模板引擎的维护成本与泛化瓶颈模板引擎提升了精度和稳定性,但代价是每新增一种文件类型、框架或业务场景都需要人工编写规则模板。通用 Agent 天然具备零样本泛化能力,而模板引擎在遇到从未见过的模式时是沉默的。规则库本身也会腐化 —— 代码规范在演进,模板如果不跟着更新就会产生过时建议2. 度量体系本身的维护成本与时效性AACR-Bench 的 Ground Truth 是人工标注的某个时间切片。代码模式在变、框架在更新、AI 生成代码的缺陷分布也在漂移,Benchmark 如果不持续投入更新就会与生产现实脱节。而每次更新的标注成本极高,这不是一个能高频迭代的闭环演讲亮点完整呈现从通用 Agent 到垂直领域 Agent 的收敛路径 —— 不是理论推导,而是经过百万真实任务验证的工程实践,包含分治并发、精准定位、工具链蒸馏、上下文分层等可复用的设计模式深入探讨当采纳率等传统指标在 AI 深度参与时代失效后,如何构建科学的度量体系来驱动系统持续迭代 —— 这是当前业界普遍面临但少有系统性解法的问题听众收益理解 AI Code Review 在真实生产环境中的核心挑战,以及为什么通用 Agent 难以直接满足大规模研发需求掌握确定性工程、上下文管理、工具链蒸馏、规则模板等关键工程实践,学习如何构建稳定、可控、可扩展的垂直 Agent 系统了解百万真实任务验证下的 AI Review 落地效果,以及 AI Coding 与 AI Review 协同构建研发闭环的工程经验理解 AI 深度参与研发后的质量评估新范式,学习如何构建更加科学的研发度量体系,为 AI 驱动的软件工程实践提供参考 除此之外,本次大会还策划了 Loop Engineering "、 千行百业 Agent 创新实践 "、 Agent 自主进化:从记忆到持续学习 "、 Agent as a Service "、 Vibe Coding 时代的新质量债 "、 理性驾驭 AI 的 SRE 可靠性工程 "、 金融 AI Native工程实践:从研发提效到业务破局 "、 AI Infra:算力效率决定规模化落地
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱