开发者生态
morning
Perplexity 三分之一的引用不包含被引用的数量
摘要
Of 1,826 citations Perplexity's search models attached to a sentence stating a figure, 34.7% pointed at a page that either would not open or did not contain a single figure from that sentence; scored ...
the
not
and
that
sentence
claim
citation
models
figure
The
2026-09-02
1 阅读
约7分钟阅读
jakobgreenfeld
字号:
在 Perplexity 的搜索模型附加到陈述数字的句子的 1,826 次引用中,34.7% 指向无法打开或不包含该句子中的单个数字的页面; 872 项声明中有 14.4% 失败。我们向 Perplexity 的两个搜索模型询问了有关 210 家科技公司的 310 个事实问题,收集了他们引用的所有来源,并获取了所有这些来源,并检查该页面是否描述了其引用的内容。在附有说明数字的句子的 1,826 次引用中(无需第二意见即可检查的引用),34.7% 指向普通读者无法打开的页面,或者打开后不包含所附句子中的任何数字。这些模型总共放置了 2,511 个引用标记。上面的单位是引文,而不是权利要求。在 872 份带有数字的索赔中,三分之二的索赔上有多个标记,我们对每个标记分别进行评分。对每个声明进行评分,当声明所指向的任何一页带有其数字之一时,将声明视为通过,14.4% 的失败。我们以引文开头,因为标记是出处的个人声明:这句话来自该 URL。失败主要不是死链接。只有 1.3% 的引用 URL 已失效。两大类是读者无法进入的页面,以及读者可以进入但不说的页面。我们做了什么 十个问题模板,每个问题模板都是人们实际会查找的事实:创立、最新一轮融资、员工人数、入场价格、总部、收入、披露的违规行为、现任首席执行官、收购、付费层正常运行时间 SLA。每家公司都有一个;其中 100 人在不同的模板上获得了第二次机会。 310 个问题,温度为 0 的 perplexity/sonar 、 perplexity/sonar-pro 以及作为对照的带有网络插件的 GPT-4.1。两个 Perplexity 模型将它们的内联声明标记为 [n] ,并且 n 索引它们返回的引文数组。这就是使审核成为可能的部分:它不是答案底部的参考书目,而是一个特定的断言,表明这句话来自该 URL。我们将每个答案分成句子,并为每个标记生成一个声明-引文对。这两个模型都没有发出过指向其引用列表末尾的标记。然后,我们获取了每个唯一引用的 URL(仅声纳就获取了 2,915 个 URL),并将每个 URL 分类为死亡、封闭、空、无法访问或活动。任何失败的事情都会有两次机会:更长的超时,然后通过轮换代理重试,这样就不会仅仅因为一个数据中心地址不受欢迎而将页面记录为被阻止。第三遍拯救了 192 个 URL。分类只能朝着有利于页面的方向发展。标题检查根本不需要模型。我们从每一项索赔中提取其具体细节——金额、百分比、大小、年份、任何三位或更多数字——并询问引用页面的可见文本是否至少包含其中一个,进行标准化,以便 1.85 亿美元、1.85 亿美元和 185000000 美元全部匹配。一个数字就足以通过。光秃秃的一年就够过去了。因此,34.7% 是一个下限:每一对失败的页面都没有包含引用它的句子中的任何数字。打不开的引用 在 perplexity/sonar 的 2,915 个唯一引用的 URL 中:六分之一的引用是门禁的。这不是来源的错——PitchBook、ZoomInfo、Crunchbase 和路透社有权收费——但这是引文的错。读者无法打开的脚注是一种无法验证出处的声明,而这是引文要防止的情况。综合答案来看,sonar 的 310 个答案中,84.2% 至少引用了一个普通读者无法打开的 URL,10.6% 至少引用了一个彻底死亡的 URL。死去的页面值得命名,因为其中大约一半是同一类型的页面(声纳的 38 个页面中有 20 个),并且它们的 URL 泄露了它们。 komo.ai/directory/-offices 。 tempstack.com/plans/<公司> 。 devhelm.io/sla/<公司> 。 apollo.io/where-is/<公司> 。 porters Fiveforce.com/blogs/brief-history/ ,以及 matrixbcg.com 和 canvasbusinessmodel.com 上的相同路径。这些页面是每个公司针对每种问题类型创建的页面,大规模发布以准确捕获我们提出的查询,并以尽可能低的价格删除。我们在撰写本文的当天重新获取了三个。当被问及 Elastic 的总部在哪里时,声纳引用了 komo.ai/directory/elastic-offices :404。当被问及 Reddit 的总部时,两个模型都引用了 apollo.io/where-is/reddit :410 消失了。当被问及 Discord 最便宜的付费计划时,sonar-pro 引用了 tempstack.com/plans/discord :404。打开但未说明的引文在页面确实打开且可读的对中,16.1% 不包含索赔人自己的数据。最简单的例子是价格。当被问及 Vercel 最便宜的付费计划的入门价格时,sonar 回答说“免费的 Hobby 计划是 0 美元/月,所以第一个付费套餐的起价是 20 美元/月”,并引用 vercel.com/docs/plans 。我们在写入时获取该页面。它重新
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱