智能AI
morning
CriticGen:世代感知评估作为可行的反馈
摘要
arXiv:2609.05439v1 Announce Type: new Abstract: Current evaluation methods for large language models are coarse-grained and decoupled from generation, producing generic explanations that fail to provi...
and
evaluation
for
improvement
CriticGen
answer
grained
from
that
actionable
2026-09-09
1 阅读
约1分钟阅读
Huifang Du, Zecheng Zuo, Sen Wang, Chenghao Fan, Haofen Wang, Yehui Yang
字号:
arXiv:2609.05439v1 公告类型:新 摘要:当前大型语言模型的评估方法是粗粒度的,并且与生成分离,产生的通用解释无法为模型改进提供可操作的反馈。我们提出了 CriticGen,这是一个细粒度、世代感知的评估框架,可将评估转化为可操作的控制,以改进答案。 CriticGen 首先在主观、客观和自衍生约束等高级类别下生成特定于样本的评估维度和评分标准。然后,这些标准充当动态评分标准,用于共同生成分数、原因、可执行的改进建议和改进的答案。这种以标题为条件的细化过程使模型能够诊断缺陷并执行有针对性的答案改进。实验结果表明,细粒度的评估应该既针对具体实例又具有可操作性。 CriticGen 引入了更高质量的评分标准,将相关性/覆盖率从 3.33/4.03 提高到 3.97/4.24。 CriticGen 还实现了最佳得分相关性,Pearson 为 0.9556,Spearman 为 0.9560,并将基于标准的理由和可执行建议的 F1 从 0.6369/0.5994 提高到 0.7554/0.7900。至关重要的是,它的反馈转化为可靠的答案改进,改进了 73.17% 的答案,且未降级率为 93.28%。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱