开发者生态
morning
Needle:你的搜索引擎无法记住的基准
摘要
Existing benchmarks can't compare search engines Most of the existing benchmarks are static: a fixed set of questions frozen in time. Static benchmarks allow easy overfitting. Systems can overfit on t...
the
and
can
search
answer
questions
for
benchmarks
are
model
2026-08-28
1 阅读
约7分钟阅读
matt4711
字号:
现有的基准测试无法与搜索引擎进行比较 大多数现有的基准测试都是静态的:及时冻结的一组固定问题。静态基准很容易导致过度拟合。系统甚至可能间接地过度拟合测试数据。 Qwen3-Max-Instruct 在 Epoch AI 的 SimpleQA Verified 排行榜上名列前茅,Epoch 本身将其标记为可能受到污染;重新整理 MMLU 答案选项会降低每个测试模型的准确性;对于大约 3% 的 HLE 问题,搜索代理只需直接从 HuggingFace 中提取带有真实标签的基准即可。最后一种故障模式值得关注,因为代理评估使其变得非常简单。 Web 搜索和获取工具可以访问 HuggingFace 数据集。 Fetch tools can even download and read dataset files, so a model being tested on a benchmark can locate that same benchmark mid-evaluation and read the answer key.我们已经看到许多前沿模型正是这样做的,并且允许自定义 Python 或 Bash 命令使其变得更加容易:一个 wget 和一个 grep,“搜索任务”就结束了。代理可以从 Huggingface 下载答案。即使测试时没有泄漏,记忆也会破坏测量结果。有时模型只是知道答案。 On BrowseComp, for instance, questions are built so that the answer is hard to find but easy to verify, yet a model that has already memorized the answer skips the "hard to find" part entirely.它立即知道要搜索什么并直接查询最终答案。特工可以记住晦涩难懂的答案,并将轨迹转向它。 Live benchmarks are much less prone to overfitting: if questions are newer than the model and change constantly, there is nothing to memorize and nothing to leak.这已经是其他领域的标准做法:LiveBench 每月刷新问题,LiveCodeBench 仅针对比训练截止时间更新的问题对模型进行评分,SWE-bench-Live 从新的 GitHub 问题重建任务。搜索应该采用相同的设计,但不存在网络搜索的实时基准。 NEEDLE: live benchmark for agentic web search To address these problems, we have built a live benchmark, NEEDLE ( N ews, E veryday, E xpert, D eep-tail, and L egal E valuation), set to measure the performance of search engines.该基准是根据公共来源构建的,涵盖了反映典型代理搜索意图的查询类型: 新闻:人们现在正在询问的突发新闻和正在开发的故事,每小时从精选的 RSS 提要和 Google 趋势生成。金融:日常公司和 SEC 备案查询,已知答案来自 Wikidata、GLEIF 和 SEC XBRL。学者:专家文献检索;任务是从降级的标题、全文细节或舌尖描述中找到一篇特定的论文(受到 Exa 的出版物搜索评估的启发)。 AgenticRare:晦涩的长尾实体;从 DeepResearchGym 、 LRAT 和 OpenResearcher 代理搜索日志中采样的罕见词查询。法律:查找特定的法院意见或《联邦法规》的部分。这些查询基于新数据:RSS 提要、Google 趋势、金融和科学 API。还有一个查询流,其中包含直接从公共代理日志中采样的稀有单词。每个任务每天或每小时都会在新的查询片段上重新运行。我们使用此基准测试将 Keenable 与主要搜索引擎进行比较:Google(通过 Serper)、Bing(通过 SearchAPI)和 Brave。还有人工智能搜索初创公司:Tavily、Parallel、Exa。为了将分数放在上下文中,NEEDLE 还报告了一个最终上限:一个合成引擎,可以保留比较中任何引擎找到的最佳结果,并由对所有引擎进行评分的同一评委进行排名。它不是一个真正的引擎,但它显示了所有引擎之上的完美重新排名器的得分。 NEEDLE 会产生不同的任务。垂直行业的查询复杂度有所不同。包含论文标题或公司事实的查询基本上得到了解决。基于全文详细信息构建的关键字查询将索引文档正文的引擎与仅索引元数据的引擎分开。对于自然语言和记不清的描述,词汇引擎几乎完全停止工作。最难的一组是从真实代理日志中提取的稀有实体查询,即使是最好的引擎也会错过该领域共同发现的大部分内容。这也是最接近真实代理流量的查询类。查询集越接近代理的实际搜索方式,交付的质量和可实现的质量之间的差距就越大。您可以在我们的 GitHub 存储库中阅读其代码以及所有查询收集和判断过程。衡量搜索引擎如何学习和改进 NEEDLE 的一个很好的功能是它可以让我们跟踪搜索引擎质量如何随时间变化。事实证明,这比任何单一快照都更重要:对于代理搜索来说,有趣的问题不是谁今天最好,而是谁进步最快。搜索引擎的使用方式应该有所改进,质量改进不是工程推动而是架构的属性
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱