Perplexity 三分之一的引用未包含其所引用的数字
摘要
对 Perplexity AI 搜索模型的审计发现,超过三分之一的特定数字引用在链接页面上未包含这些数字,失败情况包括来源无法访问或无关。
暂无内容
查看缓存全文
缓存时间: 2026/09/02 17:50
# 三分之一的Perplexity引用并未包含所引用的数字
来源:https://hausresearch.com/reports/perplexity-citation-audit
在Perplexity搜索引擎模型附加在陈述具体数字的句子的1,826处引用中,有34.7%指向的网页要么无法打开,要么完全不包含该句子中的任何数字;若按主张(而非按引用)计分,872条主张中有14.4%存在失败。我们向Perplexity的两个搜索引擎模型提出了关于210家科技公司的310个事实性问题,收集了它们引用的所有来源,获取了所有这些来源,并检查该网页是否确实包含了它被引用以支持的内容。
在附加于陈述具体数字的句子的1,826处引用中——这些引用是无需借助其他意见即可核实的——**34.7%**指向的网页无法被普通读者打开,或者虽然打开但完全不包含它们所附句子中的任何数字。两个模型总共放置了2,511个引用标记。上面的计量单位是引用(citation),而非主张(claim)。在携带数字的872条主张中,有三分之二拥有不止一个标记,我们对每个标记分别评分。若改按主张计分,只要一条主张指向的任一页面包含其一个数字,即视为通过,则有**14.4%**失败。
我们首先关注引用,因为每个标记都是一个独立的来源声明:这个句子来自那个URL。失败的主要原因不是死链。被引用的URL中只有1.3%是死链。两大主要类别是:读者无法进入的页面,以及读者可以进入但页面内容并未提及相关内容的页面。
## 我们如何做
我们设计了十种问题模板,每个模板对应人们实际会查找的事实:创立时间、最新融资轮次、员工数量、入门价格、总部所在地、营收、已披露的安全事件、现任CEO、收购情况、付费层的正常运行时间SLA。每家公司被分配一个问题;其中100家公司还被分配了另一个不同模板的问题。共310个问题,在温度为0的设置下,分别输入给`perplexity/sonar`、`perplexity/sonar-pro`模型,并作为对照组的、带有网页插件的GPT-4.1。两个Perplexity模型都以内联方式将其主张标记为`[n]`,其中`n`索引它们返回的引用数组。这正是使审计成为可能的部分:它不是答案末尾的参考文献列表,而是一个具体的断言,说明这个句子来自那个URL。我们将每个答案拆分为句子,并为每个标记生成一个主张-引用对。两个模型从未发出指向超出其自身引用列表末尾的标记。
然后,我们获取了每一个被引用的唯一URL——仅`sonar`模型就有2,915个——并将每个分类为死链(dead)、需验证(gated)、空页面(empty)、无法访问(unreachable)或正常(live)。任何失败的请求都再获得两次机会:更长的超时时间,然后通过旋转代理重试,以确保没有页面仅仅因为一个数据中心地址不受欢迎而被记录为阻止。这第三次尝试挽救了192个URL。分类结果只能向有利于页面的方向变化。核心检查根本不需要模型。我们从每条主张中提取其具体细节——金额、百分比、数量级、年份、任何三个或更多连续的数字——然后检查被引用页面的可见文本是否包含其中至少一个,进行标准化处理使得`$185 million`、`$185M`和`185000000`都能匹配。一个数字匹配即足以通过。一个单独的年份也足以通过。因此,34.7%这个数字是一个下限:每一个失败的对子,都是指该页面不包含引用它的句子中的任何一个数字。
## 无法打开的引用
跨`perplexity/sonar`的2,915个唯一被引用URL来看:
六分之一的引用是需要验证(gated)的。这并非来源的过错——PitchBook、ZoomInfo、Crunchbase和路透社有权收费——但这是引用的过错。读者无法打开的脚注是一个无法验证的来源声明,而这正是引用存在要避免的情况。
汇总到答案层面,`sonar`的310个答案中,有84.2%至少引用了一个普通读者无法打开的URL,有10.6%至少引用了一个彻底死掉的URL。死链值得一提,因为大约一半是同一种页面——`sonar`的38个死链中有20个——它们的URL暴露了这一点:`komo.ai/directory/-offices`、`temperstack.com/plans/`、`devhelm.io/sla/`、`apollo.io/where-is/`、`portersfiveforce.com/blogs/brief-history/`,以及`matrixbcg.com`和`canvasbusinessmodel.com`上相同的路径。这些页面是按公司、按问题类型批量生成的,发布出来是为了精确捕捉我们所问的问题,并且上线和下线的成本都很低。我们重写了其中三个。当被问及Elastic的总部在哪里时,`sonar`引用了komo.ai/directory/elastic-offices (https://komo.ai/directory/elastic-offices):404错误。当被问及Reddit的总部时,两个模型都引用了apollo.io/where-is/reddit (https://www.appollo.io/where-is/reddit):410已删除。当被问及Discord最便宜的付费计划时,`sonar-pro`引用了temperstack.com/plans/discord (https://www.temperstack.com/plans/discord/):404错误。
## 打开但未提及内容的引用
在页面可以打开且可读的对子中,有16.1%不包含主张自身的任何数字。最明显的例子是价格。当被问及Vercel最便宜付费计划的入门价格时,`sonar`回答“免费的Hobby计划是每月0美元,因此第一个付费层从每月20美元开始”,并引用了vercel.com/docs/plans (https://vercel.com/docs/plans)。我们在写作时获取了该页面。它返回HTTP 200状态,它列出了计划名称,但字符串`$20`、`$20/month`和`20/month`在页面中任何地方都没有出现。这个数字可能是对的。但这个引用并非它的证据。
第二种模式更能说明问题,因为它在不同公司间重复出现。当被问及总部地址时,两个模型都生成了一个街道地址,并将其归因于该公司的维基百科文章:这四篇文章都是在写作时获取的,没有一篇包含被归因的街道号码、街道名称或邮政编码。一些答案本身就说了这点,使用诸如“多个来源列出”或“ several business directories list”这样的措辞,但仍然在维基百科上附加了一个标记。主张和引用是由同一个过程产生的,而这个过程并非信息检索。同一种情况的更温和版本:`sonar`表示GitLab的CEO是Bill Staples,他于2024年12月5日担任此职,并引用了GitLab自身的管理团队页面(https://about.gitlab.com/company/team/e-group/)。该页面列出了Bill Staples的名字。但没有包含这个日期。只有一半的句子有来源依据。
## 失败最严重的领域
将两个Perplexity模型的数据合并,按问题类型来看,被引用页面包含主张数字之一的比例:
这个排序并非随机。它反映了一个事实在一个权威位置被记录得有多好。员工数量和创立年份存在于为容纳它们而构建的网页的结构化字段中。CEO的上任日期和办公室的街道号码则是那种人人都重复但无人公布的事情,因此模型复制了共识,然后指向一个从未包含该信息的页面。
## 高级模型并不更好,也不更差
我们的初步测试表明,`sonar-pro`在支撑其主张方面不如`sonar`。但在完整规模下,这个差距消失了。`sonar`在65.9%的数字对子中通过(95%置信区间62.8–68.9),`sonar-pro`为64.7%(61.5–67.7)。置信区间重叠良好,并且两个模型的引用率几乎相同:每个答案9.8和9.7个来源。在此衡量标准下,它们是同一个产品。初步测试结果是一个小样本告诉了我们想听的话,但它未能复现。带有网页插件的GPT-4.1在一个方面表现不同,值得注意:它每个答案引用2.0个来源,而非9.8个,并且其中36.4%指向公司自身域名,而Perplexity为23.4%。它不发出内联标记,因此无法对其进行主张级别的检查,这本身就是一个发现——引用作为答案末尾列表的答案,无法按句子进行审计。
## 谁被引用了
跨`sonar`的3,031处引用,分布在989个不同的主机上,23.4%指向公司自身的域名,23.1%指向B2B目录、营收估算器或潜在客户名单——Tracxn、PitchBook、Clay、GetLatka、ZoomInfo、CB Insights、Growjo、Crunchbase及其众多仿效者。最大的单一主机是`linkedin.com`(5.6%),其次是`en.wikipedia.org`(4.3%),然后是`tracxn.com`(3.0%)。这些目录页面也是集合中最不持久的内容:只有66.0%可以打开,而整体引用为78.7%。它们是从数据库生成的,为了排名而批量发布,未经通知即设限或退役,而现在关于真实公司的四分之一的资料来源都流向了这里。
## 模型判定的数字,作为比较
我们还运行了一个传统的“支撑度”判断作为辅助指标:一个独立的模型查看每条主张及其被引用的页面,询问该页面是否支持该主张。在每个模型随机抽样的400个可读对子中,它判定`sonar`的主张中50.8%得到支持,24.5%部分支持,24.8%不支持。结合页面可以打开的比例,这是40.0%的端到端成功率。这两个指标衡量的东西并不完全相同,它们之间的差距正是关键所在。在一个可读页面上,确定性检查通过了`sonar`84.6%的对子,因为一个匹配的数字就足以通过;而评判模型被问及页面是否支持整个断言时,通过率是50.8%。端到端来看,这是65.9%对40.0%,相差26个百分点。我们仍然优先使用确定性数字。一个模型对另一个模型的工作进行评判,是这个设计中最薄弱的环节,这个差距诚实地反映了它引入的不确定性的大小。更宽泛的数字是读者可以用`grep`复现的那个,而且它已经糟糕到足以成为一个发现了。
## 没有人在保存副本
我们在Wayback Machine的CDX索引中查询了`sonar`被引用URL中的随机1,500个。在1,432个成功解析的URL中,有**25.1%**(95%置信区间23.0–27.5)从未被存档过——一次也没有,从未在该页面的生命周期中的任何时刻。对于目录和潜在客户列表页面,这个比例是39.3%。五分之二的此类页面只在托管它们的公司保持其在线时才存在,我们已经知道那会如何结束:本研究中的死链几乎完全来自同一群体。因此,AI答案下的引用层主要由那些为被找到而构建而非为被保存而构建的页面组成,其中四分之一在任何地方都没有副本。当其中一个URL消失时,依赖它的主张并不会随之消失。句子还在,标记还在,唯一消失的是验证的能力。
## 这项研究未显示什么
这是一个在2026年9月2日拍摄的快照。这不是一个衰减率,我们没有在后期重新运行这些URL。它涵盖了关于科技公司的英语问题。这里没有任何内容能证明其他语言或行业会发生什么。一个需要验证(gated)的页面并非错误页面。PitchBook的订阅者很可能在其中发现主张得到充分支持;我们衡量的是没有账户的普通读者能验证什么,这是一个更窄但也更有用的问题,但确实是一个不同的问题。我们获取HTML时不运行JavaScript,这就是为什么存在`empty`类别并被单独报告,而不是被计入死链数量。答案来自通过OpenRouter的`perplexity/sonar`和`perplexity/sonar-pro`,而非来自Perplexity消费产品,后者在其自身设置下进行检索和引用。我们以识别的机器人身份从数据中心地址进行抓取,因此需要验证(gated)的比例会比拥有浏览器和家庭连接的用户遇到的比例更高。这210家公司是手工挑选的知名科技公司,而非从一个确定的总体中抽取,因此主题构成是我们自己的选择,并非一个总体样本。而且,一个主张可以是真实的,即使引用糟糕,这些引用大多如此。我们衡量的不是Perplexity是否正确。我们衡量的是它作为证据提供的东西是否能起到证据的作用。在我们检查的三分之一的引用中,它没有起到作用。
## 数据与方法
完整数据集在CC BY 4.0许可下发布:问题集 (https://hausresearch.com/data/perplexity-citation-audit/questions.csv)、每一个被引用的URL及其解析结果 (https://hausresearch.com/data/perplexity-citation-audit/citations.csv)、每一对主张-引用及两种裁决 (https://hausresearch.com/data/perplexity-citation-audit/claim_citations.csv),以及Wayback Machine查询结果 (https://hausresearch.com/data/perplexity-citation-audit/wayback.csv)。收集和分析脚本 (https://hausresearch.com/data/perplexity-citation-audit/README.md)、完整方法 (https://hausresearch.com/data/perplexity-citation-audit/METHOD.md)、计算出的数字 (https://hausresearch.com/data/perplexity-citation-audit/numbers.json) 和写作时每个命名示例的证据 (https://hausresearch.com/data/perplexity-citation-audit/evidence.json) 都在同一个目录中。本报告的PDF版本可在hausresearch.com/data/perplexity-citation-audit/perplexity-citation-audit.pdf (https://hausresearch.com/data/perplexity-citation-audit/perplexity-citation-audit.pdf) 获取。
相似文章
三个网站为AI创建了215,128个"最佳软件"页面。Perplexity引用了它们。
一项研究显示,Perplexity AI模型在软件推荐中经常引用排名较低或新建的网站,其中三个网站生成了超过20万个机器生成的页面。
我审计了AI事实核查工具引用的来源。大约每18个中就有1个不存在。
一位作者分享了对其AI事实核查工具引用的审计,发现大约每18个中就有1个是失效或捏造的,并提供了实用修复方法来提高AI系统的可靠性。
Perplexity持续在产品答案中引用了一个只有560次观看的YouTube视频。这出乎我的意料。
一项实验发现,Perplexity AI搜索在产品答案中频繁引用低观看量的YouTube视频(部分带有联盟链接),这表明AI可见性并不等同于流行度,并引发了对来源质量的担忧。
@ArtificialAnlys:Perplexity Search 在 Artificial Analysis Search Index 上首次亮相,所有三种上下文大小变体均占据领先位置…
Perplexity Search 在 Artificial Analysis Search Index 中首次亮相即登顶,其中等上下文变体得分80,并且相比竞争对手提供更低的单任务成本。
斯坦福研究人员发现,OpenAI和Google的模型在30%的情况下引用错误来源
由James Zou领导的斯坦福研究人员发现,OpenAI、Anthropic和Google的AI模型在约30%的情况下引用错误来源,即使回答大部分正确。该研究突显了文本生成与准确引用之间的关键不匹配,给医学和法律等领域带来风险。