称量烟雾:为何AI可见性仪表盘基本无用

Hacker News Top 新闻

摘要

文章认为,声称能追踪AI搜索回答中品牌存在的AI可见性仪表盘并不可靠,且缺乏预测有效性,将其比作称量烟雾,因为AI输出结果的不一致性以及缺乏与业务结果的有意义关联。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/07 17:13

# 称量烟雾:为什么GEO仪表盘大多无用 来源:https://betterthangood.xyz/blog/weighing-smoke/ 作者 Iain (https://betterthangood.xyz/blog/iain/),2026年7月5日 一个黄铜天平,一边托盘称着一缕烟雾,另一边是实心铁砝码,背景为蓝色 > 一个能让你在搜索代理世界中获得类似过往可见度的工具,其承诺无疑具有诱惑力。但在你急切地为一款平台掏钱之前,不妨考虑一下:每月花一个下午的时间自己动手,或许是更具成本效益的选择。 我最近写过关于 GEO 幻象(https://betterthangood.xyz/blog/geo-practice-versus-snake-oil/)的文章,这是一个承诺将你的品牌优化进 AI 答案的手工作坊式行业。我的观点是,那些被兜售的杠杆大多并不存在。该行业的另一部分则是在销售仪表盘而非杠杆。据估计,目前每年在 AI 可见度追踪上的支出已超过 1 亿美元(https://authoritytech.io/curated/ai-rank-is-noise-consideration-set-is-real-2026),用于数百个仪表盘,像当年 Moz 追踪你在 Google 中的排名那样,绘制你的品牌在 ChatGPT 中的呈现情况。这种推销正落在品牌营销人员的肥沃土壤上——他们正站在过去所依赖的一切的悬崖边缘,凝视着即将到来的虚空。 这一切有种后千禧年的味道。好莱坞编剧威廉·戈德曼有句名言:“没人知道任何事。”他这句话中不太为人所知的部分是:“每一次……都是猜测,如果运气好,也只是有依据的猜测。”这正是代理搜索可见度的一句话总结。 目前大多数工具每天运行提示词,对运行结果进行平均,报告一个带有趋势线和置信区间的可见度百分比。平均本身并非问题所在。问题在于它所平均的一切——因为测量篮子里的提示词通常由分析供应商主导,用于加权的查询量是虚构的模型数据,所采样的查询表面并非人类实际使用的查询表面,而且没有人证明最终得分能预测出任何对业务重要的单一结果或转化。然而,这些工具却像衰败主街上雨后春笋般冒出的电子烟店一样在激增。 事实是,我们拼命想抓住的东西并不真正存在。几乎没有机制能提高你在搜索代理回复中的可见度。并且也没有可靠的方法来追踪和测量这种可见度。在经历了四分之一个世纪的 SEO 和 SERPs 之后,这是一颗许多人不愿意吞下的苦药。 目前被当作替代方案兜售的甜美糖果,我称之为**精准漂白**。足够频繁地运行一个空洞的测量指标,直到噪声被抵消,就会出现一个看似稳定、带小数点、可以冒充知识的数字。但是,虽然平均可以买到一个数字,却买不到有效性。 ## 骰子杯 一月,兰德·菲什金发表了一项关于搜索代理追踪行业的详细研究(https://sparktoro.com/blog/new-research-ais-are-highly-inconsistent-when-recommending-brands-or-products-marketers-should-take-care-when-tracking-ai-visibility/)。他与 Gumshoe.ai 的帕特里克·奥唐纳合作,招募了 600 名志愿者,通过 ChatGPT、Claude 和谷歌的 AI 运行了 12 个品牌推荐提示词,共 2961 次,涵盖从厨师刀到癌症医院的各类别。菲什金最初预期要证明追踪搜索代理回复毫无意义。结果却比那更奇怪。 向一个搜索代理询问品牌推荐一百次,得到相同列表的概率低于百分之一(https://searchengineland.com/ai-recommendation-lists-rarely-repeat-study-468076)。顺序完全相同的列表概率接近千分之一。品牌在变,顺序在变,甚至列出的项目数量也在变。菲什金对位置追踪的结论直言不讳。他写道,任何声称给出“AI 中的排名位置”的工具“都是胡扯”。 这并非一个独行侠的孤立观点。一项对重复 GEO 测量结果的 arXiv 研究(https://arxiv.org/pdf/2604.07585)发现,对于完全相同的提示词,返回的品牌集在不同运行之间重叠率仅为 45-59%,且方差很大,结论是单一观察搜索代理可见度具有误导性,可见度必须被视为跨重复运行的概率分布。第二篇论文(https://arxiv.org/pdf/2603.08924)则直接指出了统计问题:生成式引擎的引用指标是随机变量,而非固定值。Ahrefs 从侧面研究发现,对于同一查询,谷歌的 AI Mode 和 AI Overviews 在 87% 的情况下会引用不同的来源(https://www.searchenginejournal.com/ai-recommendations-change-with-nearly-every-query-sparktoro/566242/)。 这种变动是无法控制的。语言模型不会去查找答案。它一次生成一个 token,从一个可能的选项范围中随机选择每个单词(内置的随机性称为“温度”)。这种随机性是一个至关重要的设置,因为它使得输出读起来流畅而非生硬。问同一个问题两次,答案会自行偏离。 加上网络搜索,骰子会被多掷两次:一次是模型将你的问题拆分为自己的一套搜索查询(称为“扇出”),另一次是它从获取的页面中挑选哪些值得引用。即使是旨在保持稳定的设置,一旦系统上线也会摇摆不定——请求被分批处理,静默地路由到空闲的模型副本,并在你自以为正在测量的过程中悄然切换到新版本。 因此,菲什金测量到的方差并非类别发展过程中会平息的幼稚问题。它是产品按设计运行的结果,一个消除这种方差的平台将交付一个更差的产品——一个用相同生硬回复回答每个用户的产品。因此,搜索代理中的可见度是一个永久性的概率分布。 不过,在变动之下,菲什金至少发现了一些稳定的东西。**考量集合**,即模型从中提取品牌的品牌池,即使顺序混乱也保持稳定。索尼、Bose 和苹果出现在几乎每次耳机相关的运行中,在紧密类别中的顶级品牌出现在 90% 到 100% 的回复中,而像品牌设计机构这样的宽泛类别,出现率则分散在 30% 到 40%。 当阿曼达·纳蒂维达让 142 个人为同一意图编写他们自己的提示词时,这些措辞的语义相似度得分仅为 0.081,大约像一首俳句和一张购物清单那么相似。但考量集合依然保持稳定。看来,你要么在池子里,要么不在,而成员资格只能通过 60-100 次运行缓慢估算。这是一个狭窄但有效的信号,但也是唯一的信号。 ## 窗口错误问题 假设工具每周运行提示词一百次并报告一个概率。它仍然把仪器对准了错误的窗口。大多数追踪器查询供应商的 API,因为廉价且可脚本化。但是通过 API 端点访问的 GPT 4.5 并非 ChatGPT。消费级产品拥有记忆、自定义指令、对话历史、账户上下文、位置推断以及 API 调用者从未见过的系统提示。它会在不同模型变体之间路由,而这些变体常常互相矛盾。 一项对 ChatGPT 搜索栈的反向工程研究(https://searchengineland.com/inside-chatgpt-search-web-run-fan-out-queries-ai-visibility-477339)发现,GPT 5.2、5.3 和 5.4 共享知识截止日期和系列名称,但会产生不同的扇出查询并检索不同的来源,然后从同一提示词中引用不同的页面。超过 90% 的 ChatGPT 周活跃用户使用免费版,而免费版的默认体验运行更少的搜索,产生更少的引用,与工具通常采样的付费版本不同。 因此,一个追踪器就像一个神秘顾客,提交的报告平均了数百次对一个展示厅的访问,而这个展示厅没有顾客会去。你得到的是围绕一个人群的窄置信区间,而这个人群几乎不包含你的实际客户。雪上加霜的是,这个展示厅通常在一夜之间被完全重新装修,且毫无通知。 今年 5 月 7 日,OpenAI 开始在答案中渲染可点击的品牌链接,推荐流量环比飙升 157.7%(https://www.similarweb.com/blog/marketing/geo/gen-ai-stats/),而访问落在品牌首页的份额从大约 30% 跃升至 60% 并保持在那儿。3 月 4 日,默认模型切换到 GPT 5.3,每个答案引用的平均域名数量从 19 个下降到 15 个(https://www.botrank.ai/post/chatgpt-search-visibility-web-run-fan-out-queries)。试图优化和测量这个不断变化的地形似乎是一项愚蠢的任务。我们这些经历过 Google 的 Florida、Panda 和 Penguin 算法更新的人明白,脚下的大地可能会移动。但当它以持续不断且影响重大的方式移动时,很快会变得无法管理。 ## 发明分母 Google 的搜索引擎结果页面(SERPs)是有形可触的。这一点我深有体会:一个旗舰产品从第二位掉到第三位,高层管理者就会头发着火般冲过来,要求知道我们如何能立刻恢复。所以 SERPs 是一把双刃剑,但终归是一把剑。 代理提示词量是建模出来的,而非测量出来的。没有实验室发布查询数据,而那些兜售“AI 关键词规划器”的商家,要么是从捕获流量极小比例的 opt-in 面板外推,要么是将你的提示词解析回一个 Google 关键词,然后称之为“AI 需求”。AI 搜索可见度平台的供应商通常通过点击流面板和外推模型构建估算(https://searchengineland.com/measuring-ai-visibility-geo-performance-hard-truths-467197)。点击流面板偏向于一个小而缺乏代表性的群体:桌面端,主要是 Chrome,没有应用,没有移动端,来自那些被付费或不知情地同意其浏览行为被监控的人。 当 Profound 开始展示“social listening tool”等提示词每月 26,000 次搜索等数据时,SEO 专家 Steve Toth 和 William Alvarez 将这些数字与关键词量进行对比,并在公开帖子中将这些数字描述为骗局(https://www.jaeckert-odaniel.com/en/prompt-search-volume-real-data-or-all-guessed/)。Conductor 是一家出售相邻工具的公司,拥有保持沉默的一切商业动机,却发表了一篇文章,称任何 AI 提示词量指标从根本上具有误导性(https://www.conductor.com/academy/debunking-ai-prompt-volume/),并警告基于此的资源决策最多是一场赌博。 产品供应商或许意识到自己站不住脚,这就是为什么他们的介绍读起来更像咒语而非可靠方法论。例如,Writesonic 将其数字解释为“带有数学偏差校正的集成方法论”。从企业黑话翻译过来,就是猜两次然后取平均。更深层次的问题不在于来源,而在于对象本身。关键词量之所以有效,是因为数百万人在一个框中输入相同或非常相似的字符串,而拥有那个框的一方记录了它。 提示词量没有对应的东西。拥有那个框的一方没有发布日志,因此被当作提示词量出售的,要么是面板供应商的一小撮流量外推结果,要么是一个被解析回 Google 关键词并重新贴标的提示词。对话式提示词还会在意图相似的二十词措辞中碎片化,这正是上面提到的 0.081 相似度得分所测量的。因此,任何单个提示词的“量”在很大程度上都是供应商选择如何将众多同义改写版本进行分桶的产物。 综合得分彼此之间也存在分歧。Digiday 发现,营销人员通过竞争平台运行同一个品牌,得到不一致的结果(https://digiday.com/marketing/marketers-question-expensive-ai-visibility-tools-as-inconsistent-results-fuel-skepticism/),这正是当每个供应商对不同的采样表面平均不同的虚构篮子时会发生的情况。两个在不同错误房间里的温度计仍然能提供精确的读数。平均值必须是某个可用于决策的事物的平均值,而我找不到任何独立研究能够将可见度得分与收入或任何其他有形转化联系起来。 一些工具在仪表盘上附加了追踪像素和服务器日志读取器。它们捕获 AI 爬虫抓取你页面的情况以及来自 ChatGPT 等服务的引用点击。引用部分是真的。确实有人从 AI 答案访问了你的网站,这是一个基于观察而非模型的数字。同时,这也是你完全可以免费自行读取的同一个服务器日志。问题在于,像素记录的是谁来了,而不是什么让你的页面出现在答案中,并且这个到达记录通常与旁边绘制的可见度得分是分开记录的。将一个真实的引用数字放在一个建模的可见度得分旁边,并不会使得分更有效。这只是另一种伪装下的精准漂白——用一个真实数字为捏造的数字背书。 一个其整个产品就是测量的行业,本应淹没在已发表的方法中。但情况似乎恰恰相反。剥离掉经过漂白的平均值和虚构的分母后,剩下的残渣极少且廉价,并且大多数情况下并不需要购买昂贵的平台订阅。它归结为五个简单的步骤。 ### 测量成员资格,而非排名 考量集合是 SparkToro 数据中唯一幸存下来的概念。如果你必须追踪某样东西,就追踪在意图多样化的提示词篮子中出现的概率,每个篮子运行 60 到 100 次,并将这个数字视为一个粗略的存在感测量,而非方向盘。它会告诉你是否在池子里,以及是否有重大变化发生。它不会告诉你任何更细节的信息。 ### 从源头修正机器所说的内容 哥伦比亚大学的 Tow Center(https://searchsignal.online/research/ai-search-referrals-citations-2026)发现,在 1,600 个测试查询中,AI 搜索引擎有超过 60% 未能检索到正确的引用信息。这个错误率是监控自己品牌的最有力理由,因为不正确的定价和失效的产品特性会传播到答案中,而修正方法很简单:找到引擎引用的源页面并纠正它。 ### 做好检索管道工程 ChatGPT 的实时搜索主要运行在 Bing 的索引上(https://parse.gl/blog/bing-rankings-chatgpt-visibility)。Seer Interactive 发现,87% 的 ChatGPT 引用与 Bing 的顶级结果匹配,而谷歌的匹配率仅为 56%。因此,在 Bing 网站管理员工具中验证你的网站,并接通 IndexNow,然后允许 OAI-SearchBot 以及 OpenAI 公布的 IP 范围——这是 OpenAI 自身陈述的唯一收录要求(https://help.openai.com/en/articles/9237897-chatgpt-search)。提供纯服务器端渲染的 HTML,因为 OAI-SearchBot 不渲染 JavaScript(https://www.erlin.ai/blog/chatgpt-search-optimization),并且解析率从静态页面的 94% 骤降至客户端渲染页面的 23%。 然后使用存在的一个第一方测量工具。微软在 Bing 网站管理员工具中于二月份推出的 AI 性能报告(https://parse.gl/blog/bing-rankings-chatgpt-visibility),会显示哪些页面被 Copilot 和 Bing 的 AI 引用,以及获取它们的依据查询。它是免费的——这本身就说明了付费工具的真正价值。 ### 赢得机器查询,然后赢得编辑记录 当 ChatGPT 回答问题时,它不会搜索你的提示词。它会将其重写为几个机器生成的子查询(“扇出”),然后针对索引运行这些子查询。

相似文章

每个AI可见性工具都在欺骗你

Hacker News Top

本文批判性地审视了声称能衡量品牌在生成式AI回复中曝光度的AI可见性工具,指出由于非确定性、个性化和抓取偏差,这些工具提供了虚假精度。文章呼吁方法透明,并警告不要将不透明的仪表盘视为稳定真相。

AI广告与现实

Reddit r/singularity

一篇讨论AI广告宣传与实际应用表现之间差距的文章。

AI研究工具仍过于热衷将公开信号转化为确定性

Reddit r/artificial

作者批评AI研究工具对微弱信号过于自信,赞扬Komo AI的快速发现和附带来源的摘要,但强调需要更好地处理不确定性和矛盾。他们描述了一种工作流程,将发现、验证和结构化检查分散到多个AI工具中。