智能AI
morning
CHORUS:高覆盖率测试平台激励生成的补充专家
摘要
arXiv:2608.10090v1 Announce Type: new Abstract: Large language models (LLMs) have advanced code generation, where executable feedback provides a more reliable learning signal than textual imitation al...
generation
CHORUS
training
code
learning
and
with
task
post
performance
2026-08-13
1 阅读
约1分钟阅读
Hejia Zhang, Sheng Lu, Zhongming Yu, Chia-Tung Ho, Brucek Khailany, Jishen Zhao
字号:
arXiv:2608.10090v1 公告类型:新 摘要:大型语言模型 (LLM) 具有先进的代码生成功能,其中可执行反馈提供比单独的文本模仿更可靠的学习信号。硬件验证是代码生成的重要应用,占现代芯片设计工作的很大一部分,其中高覆盖率测试平台激励生成是一项关键任务。我们推出了 CHORUS,这是一种训练后框架,其性能超越了传统的监督微调 (SFT) 到强化学习 (RL) 管道所能达到的水平。 CHORUS 建立在两个观察之上。首先,分阶段的 SFT 会产生行为多样化的检查点,而密集奖励的 RL 将它们转变为强大的专家,具有可比的总体表现,但具有独特的任务级别优势。其次,可以通过免训练模型合并或进一步的后训练来利用这些互补优势,以超越最好的个人专家。通过将所得专家整合到单个 4B 模型中,CHORUS 在 CVDP-ECov 上实现了 88.0% Pass@1,比 DeepSeek-R1 (671B) 高出 13.5 个百分点。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱