智能AI
morning
WebGrader:使用自我进化的程序化评分器培训法学硕士进行 Web 开发
摘要
arXiv:2608.06474v1 Announce Type: new Abstract: Large language models increasingly generate complete websites from natural-language descriptions, and reinforcement learning has become a central approa...
and
the
WebGrader
reward
browser
policy
language
from
functional
training
2026-08-10
1 阅读
约2分钟阅读
Boshui Chen, Huiping Liu, Shaolei Zhang
字号:
arXiv:2608.06474v1 公告类型:新 摘要:大型语言模型越来越多地从自然语言描述生成完整的网站,而强化学习已成为缩小其剩余功能差距的核心方法。这种培训制度受到奖励设计的瓶颈。手工编写的浏览器脚本是可执行的,但针对开放式需求编写成本高昂,而 VLM 和 GUI 代理评分器可扩展,但可能会在观察决定性状态之前发布判决。我们提出了 WebGrader,这是一种自我进化的程序化评分器,它可以从每个网站请求中自主导出所需的交互流,将每个流表示为可执行的流合约,并将其执行结果用作 RL 奖励。 WebGrader 在实时浏览器中具体化生成的项目,根据源代码和实时 DOM 确定目标操作,并沿着相同的浏览器轨迹收集视觉、DOM、响应和持久状态证据。然后,残差驱动的离线循环会发现可重用的验证者技能,在不相交的验证页面上对其进行筛选,并在策略训练之前冻结提升的技能图。通过将测试计划、操作基础、证据收集和语义判断分开,WebGrader 仅在观察到所请求的转换后才发布“通过”判决。在 WebGen-Bench 上,WebGrader 将 8B 策略训练到了 52.01% 的功能成功率,比匹配的外观加脚本奖励高出 7.88 分,并超过了 o4-mini 和 DeepSeek-v4-flash。在 WG-core-250 上,该策略的满分达到 44.953,超过了 Qwen3-Coder-480B。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱