智能AI
morning
用于代码偏好优化的功能级执行反馈
摘要
arXiv:2608.23632v1 Announce Type: new Abstract: Process supervision has improved mathematical reasoning, where intermediate steps are naturally expressed as chains of thought. In code generation, howe...
and
supervision
code
STEP
KTODER
that
level
function
labels
reasoning
2026-08-26
1 阅读
约1分钟阅读
Idris Nechnech, Sehwan Kim, Jimin Seo, Yeongoon Kim, Minhae Oh, Sangwoo Hong, Jungwoo Lee
字号:
arXiv:2608.23632v1 公告类型:新 摘要:过程监督改进了数学推理,其中中间步骤自然地表达为思想链。然而,在代码生成中,由于没有标准的步骤概念,因此流程监督仍未得到充分探索。监督可以针对线路、推理轨迹或程序状态,从而不清楚要标记和优化什么。我们提出了 STEP-KTODER,一个代码偏好优化框架,它将步骤定义为分解的多功能程序中的模块级函数,并通过自动生成的单元测试分配二进制正确性标签。我们的方法提供了逐步 KTO 的代码特定实例,将功能级过程监督与整个程序的结果级反馈相结合。我们对 HumanEval(+)、MBPP(+)、BigCodeBench 和 LiveCodeBench 进行评估,结果表明 STEP-KTODER 比仅注重结果的 KTO 和 DPO 有所改进。进一步的分析表明,基于执行的标签至关重要:LLM 作为法官注释会系统性地过度预测功能故障、破坏积极步骤标签并降低下游偏好优化。代码位于:https://github.com/inechnech/STEP-KTODER。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱