首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

不要声称面向基准的优化可以提高通用编码能力——需要多样化的评估

摘要

arXiv:2608.13566v1 Announce Type: new Abstract: Post-training papers, model cards, and blog posts often treat scores on a small set of coding benchmarks (e.g., SWE-bench and LiveCodeBench) as evidence...

and for benchmark task coding benchmarks SWE bench research that
2026-08-17 1 阅读 约1分钟阅读 Egor Shibaev, Vera Kudrevskaia, Timur Galimzyanov, Mikhail Evtikhiev, Ana Terna, Rastislav Rabatin, Timur Kudashev, Timofey Bryksin, Arina Puchkova, Patrik Bartak, Egor Bogomolov, Sergey Titov
分享:
字号:
arXiv:2608.13566v1 公告类型:新摘要:训练后论文、模型卡和博客文章通常将一小部分编码基准(例如 SWE-bench 和 LiveCodeBench)的分数视为广泛编码能力的证据,无论是研究工件还是面向用户的系统。我们认为,对这些基准的优化会导致测量特定于任务的性能,从而在测量的分数和一般编码能力的声明之间产生有意义的差距。我们使用我们创建的基于 Django 的案例研究基准套件来检查这一差距。评估在 SWE 基准轨迹上训练后的基础模型和检查点,我们发现基准排名经常无法概括。训练后的检查点显示出很少的跨任务传输,并且 SWE 基准优化对我们的任务或 LiveCodeBench 产生的收益有限或没有收益。同样,对单个 Django 模式的微调也无法迁移。我们的结论是,少量的基准不足以在基准优化压力下评估不同的模型。我们鼓励社区使用差异化评估——针对前沿模型的整体评估、针对研究的多任务套件以及针对狭窄任务应用的人机循环研究。最后,我们主张创建一种能力分类法和持续的基准维护,而不是一次性的基准发布。如果没有可靠的评估标准,使用法学硕士和代理人的工程师和研究人员必须依靠不足的证据来做出研究、开发和部署决策。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱