智能AI
morning
CoT-Core:通过 CoT 感知核心集选择加速 LLM 评估
摘要
arXiv:2608.00014v1 Announce Type: new Abstract: Evaluating Large Language Models (LLMs) incurs prohibitive computational overhead during continuous development processes. While coreset selection accel...
that
CoT
reasoning
Core
LLMs
selection
evaluation
the
underlying
questions
2026-08-04
1 阅读
约1分钟阅读
Qihua Pan, Zhenheng Tang, Peijie Dong, Xiang Liu, Huacan Wang, Bo Li, Xiaowen Chu
字号:
arXiv:2608.00014v1 公告类型:新 摘要:评估大型语言模型 (LLM) 在持续开发过程中会产生过高的计算开销。虽然核心集选择加速了评估,但现有方法要么遇到严重的“冷启动”瓶颈,需要大量历史日志(例如项目响应理论),要么表现出表面词汇偏差,错过了任务的底层推理流形。我们提出了 CoT-Core,一种新颖的免训练核心问题选择框架。 CoT-Core 认识到词汇上不同的问题可以共享相同的底层逻辑,因此促使法学硕士展开零样本思维链 (CoT) 推理轨迹。将这些路径投影到潜在空间中,通过内在的逻辑等价而不是表面的文本相似性来有效地聚集问题。在 GSM8K、MMLU、MMLU-Pro 和 GPQA 上进行的大量实验表明,CoT-Core 在保持高保真分数估计的同时极大地降低了评估成本,并描绘了推理感知剪枝的边界条件,揭示了其功效本质上是由任务复杂性决定的。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱