首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

WebGrader:使用自我进化的程序化评分器培训法学硕士进行 Web 开发

摘要

arXiv:2608.06474v1 Announce Type: new Abstract: Large language models increasingly generate complete websites from natural-language descriptions, and reinforcement learning has become a central approa...

and the WebGrader reward browser policy language from functional training
2026-08-10 1 阅读 约2分钟阅读 Boshui Chen, Huiping Liu, Shaolei Zhang
分享:
字号:
arXiv:2608.06474v1 公告类型:新 摘要:大型语言模型越来越多地从自然语言描述生成完整的网站,而强化学习已成为缩小其剩余功能差距的核心方法。这种培训制度受到奖励设计的瓶颈。手工编写的浏览器脚本是可执行的,但针对开放式需求编写成本高昂,而 VLM 和 GUI 代理评分器可扩展,但可能会在观察决定性状态之前发布判决。我们提出了 WebGrader,这是一种自我进化的程序化评分器,它可以从每个网站请求中自主导出所需的交互流,将每个流表示为可执行的流合约,并将其执行结果用作 RL 奖励。 WebGrader 在实时浏览器中具体化生成的项目,根据源代码和实时 DOM 确定目标操作,并沿着相同的浏览器轨迹收集视觉、DOM、响应和持久状态证据。然后,残差驱动的离线循环会发现可重用的验证者技能,在不相交的验证页面上对其进行筛选,并在策略训练之前冻结提升的技能图。通过将测试计划、操作基础、证据收集和语义判断分开,WebGrader 仅在观察到所请求的转换后才发布“通过”判决。在 WebGen-Bench 上,WebGrader 将 8B 策略训练到了 52.01% 的功能成功率,比匹配的外观加脚本奖励高出 7.88 分,并超过了 o4-mini 和 DeepSeek-v4-flash。在 WG-core-250 上,该策略的满分达到 44.953,超过了 Qwen3-Coder-480B。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱