首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

如何从历史中学习?基于RhymeRL的强化学习系统优化实践|QCon上海

摘要

从「构建 AI」到「驾驭 AI」,100+ 实战案例拆解 AI Native 时代的工程新实践! 推理模型持续突破能力边界,Coding Agent 深度参与研发流程,Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型,演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力,而开始成为软件系统的一部分。这意味着软件工程面对的...

Agent Rollout Infra Native Coding Runtime Loop Engineering GPU epoch
2026-09-17 1 阅读 约7分钟阅读 QCon全球软件开发大会
分享:
字号:
从「构建 AI」到「驾驭 AI」,100+ 实战案例拆解 AI Native 时代的工程新实践! 推理模型持续突破能力边界,Coding Agent 深度参与研发流程,Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型,演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力,而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化:团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt,而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么,系统决定 AI 能否真正创造价值。 在这一背景下, 2026 年 QCon 全球软件开发大会大会 · 上海站 "正式启动。本次大会将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验,共同探索 AI 从能力到系统、从实验到生产的真实路径。 上海交通大学副教授杜冬冬已确认出席 “ AI Infra:算力效率决定规模化落地 "” 专题,并发表题为《 如何从历史中学习?基于RhymeRL的强化学习系统优化实践 "》的主题分享。LLM 强化学习中,Rollout 占耗时的相当一大部分,长尾使最早完成 GPU 约 76% 时间空闲。通过大量数据,他们发现发现相邻 epoch 有大量的token 可匹配、因而结合历史推测解码与长度调度,提出 RhymeRL 系统。系统采用离线后缀树、奖励感知选枝、动态窗口、奇偶步互补及尾部迁移,解决在线索引开销、固定窗口无效验证和异常长样本失衡,并取得相比现有系统2.6x 的性能提升。 杜冬冬博士,上海交通大学副教授。长期从事操作系统、智能体系统等方面研究工作,成果发表在SOSP、OSDI、ASPLOS、FAST等国际著名会议和期刊,并获SOSP 2025最佳论文奖及FAST 2026最佳论文奖和杰出技术成果奖。一系列成果已经在工业界和开源社区得到广泛应用,包括(1)蓬莱可信执行环境系统,目前是RISC-V架构下最常用的开源TEE系统之一;(2)D-VSync,作为传统VSync渲染技术的,目前已经在鸿蒙操作系统得到大规模部署和应用(千万规模设备),有效提升了终端场景下的用户体验;(3)Serverless低时延沙箱启动技术,首次实现毫秒级Serverless沙箱启动,并且在蚂蚁金服得到了大规模部署和应用;(4)并行化GPU启动gCROP,并且已经合入CRIU主线代码,是CRIU默认开启的应用restore加速技术。他在本次会议的详细演讲内容如下: 演讲提纲:1. 背景:强化学习后训练时代,瓶颈在 RolloutRL 已成为大模型对齐与推理增强的标准手段实测 Rollout 占训练耗时 84%–91%(math/code RLVR),随训练响应从 2K 增至 11K+ token批内长尾导致最早完成 GPU大量时间空转2. 关键观察:相邻 epoch 的 Rollout 存在“相似性”基于真实轨迹分析:大量token可精确匹配上一 epoch响应长度排序稳定3. 设计目标不依赖额外小模型,复用 RL 已付费生成的历史响应保留 one-step-off 算法边界,避免全异步的样本丢弃与范式改变离线建索引、在线零额外开销,避免检索回到关键路径4. RhymeRL 的系统设计HistoSpec:每个提示词一棵后缀树,O(m) 前缀查询;奖励感知选枝;类 AIMD 动态草稿窗口HistoPipe:奇偶 step 长短互补调度;步内/跨步尾部迁移;两级 GPU 资源分配端到端闭环:响应、奖励、长度回写历史索引,先验随训练演进5. 实施效果与结论端到端吞吐最高为(基线版本的)的 2.6 倍;HistoSpec 单步 Rollout 吞吐最高 1.86 倍实践痛点:当前主要针对 math 和 code 进行比较深入的实践,更复杂动态的 agent RL 场景可能需求和问题不同。前沿亮点:不依赖于传统 speculative decoding 中对小模型能力的依赖能够充分利用空闲算力提效听众收益:了解当前强化学习在 Rollout 阶段 Infra 侧主要开销了解如何基于历史经验来优化当前的 Rollout 除此之外,本次大会还策划了 Loop Engineering "、 千行百业 Agent 创新实践 "、 Agent 自主进化:从记忆到持续学习 "、 Agent as a Service "、 Vibe Coding 时代的新质量债 "、 理性驾驭 AI 的 SRE 可靠性工程 "、 金融 AI Native工程实践:从研发提效到业务破局 "、 AI Infra:算力效率决定规模化落地 "、 AI Native 架构 "等20个专题论坛,届时将有来自不同行业、不同领域、不同企业的100+资深专家在现场带来前沿技术洞察和一线实践经验。 查看更多详情可扫码或联系票务经理 18514549229进行咨询。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱