在位者优势:LLM推荐系统中的品牌偏见与认知操纵动态

arXiv cs.AI 论文

摘要

本文研究LLM产品推荐中的品牌动态,发现知名品牌存在条件性垄断,但可通过微小的评分优势或权威式营销语言打破,并揭示了多品牌GEO竞争中的社会困境。

arXiv:2606.17443v1 公告类型:新 摘要:大型语言模型(LLM)正成为消费者寻找产品的主要方式,但我们尚不了解品牌在这一新渠道中如何竞争。我们使用护肤品——消费者在购买前难以判断质量、必须依赖品牌声誉的类别——在三个商业LLM(GPT-4o-mini、Claude Sonnet、Gemini 3 Flash)上研究LLM推荐中的品牌动态,并对搜索品进行了稳健性检验。在三项实验中,我们发现:(1) 条件性垄断:当所有产品规格相同时,知名品牌获得100%的推荐(IAI = 10.0),但若竞争对手获得不足+0.1星的评分优势,这种主导地位便会消失;(2) 权威式营销语言(包括捏造的临床证据声称)以等于+0.17评分点的偏差剩余价值打破了这一垄断,且每个模型反应不同;(3) 多品牌GEO竞争中的社会困境:当所有品牌采用相同的优化策略时,个体收益在我们的收益代理中从+0.802降至+0.007,而参与测试的非参与品牌获得的推荐数为零。我们的结果表明,生成引擎优化(GEO)不仅应作为安全风险研究,也应作为影响市场竞争的新兴营销实践进行研究。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:36

# 在位者优势:LLM推荐系统中的品牌偏差与认知操纵动态
来源:https://arxiv.org/html/2606.17443
###### 摘要

大型语言模型(LLM)正成为消费者寻找产品的主要途径,但我们尚不清楚品牌如何在这一新渠道中竞争。我们通过护肤品——消费者在购买前难以判断质量、必须依赖品牌信誉的品类——研究了三个商业LLM(GPT-4o-mini、Claude Sonnet、Gemini 3 Flash)中的品牌动态,并以搜索品进行了稳健性检验。在三项实验中,我们发现:(1) **条件垄断**:当所有产品规格相同时,知名品牌100%被推荐(IAI = 10.0),但仅需竞争对手拥有+0.1星评级优势,这种主导地位便会消失;(2) 权威式营销语言(包括捏造的临床证据声明)以相当于+0.17评级点的**偏差盈余价值**打破这一垄断,各模型反应不同;(3) 多品牌GEO竞争中存在**社会困境**:当所有品牌采用相同优化策略时,个体收益从+0.802降至+0.007(在我们的收益代理量中),而未参与品牌在我们的测试中未获得任何推荐。我们的结果表明,生成式引擎优化(GEO)不仅应作为安全风险来研究,也应作为塑造市场竞争的新兴营销实践来研究。

## 1. 引言

越来越多的消费者使用ChatGPT、Claude和Gemini等大型语言模型(LLM)来获取产品推荐,而不是自己上网搜索。这些模型可能依赖参数知识,在某些情况下也会借助外部检索或网络搜索,因此其答案可能来自其中一种或两种来源。图1展示了一个真实示例:当用户询问哪种保湿霜最好时,ChatGPT将CeraVe列为“最佳整体”并排在首位。这引出了一个简单的问题:LLM是否已经对某些品牌存在内置偏好?

**图1:** ChatGPT(2026年5月)对“我想买一款好的面部保湿霜,哪个最好?”查询的真实回复。模型将CeraVe列为“最佳整体”并排在首位。对于其他保湿霜品牌,这引发了一个问题:LLM是否已成为已经主导品牌的免费宣传渠道?如果这种偏好始终偏向同一品牌,就会产生我们所说的**在位者优势**:LLM系统性地更频繁推荐知名品牌。这导致了不平衡的市场:成熟品牌获得更多曝光,而新兴或知名度较低的品牌——即使产品同样优质——也难以通过基于LLM的推荐获得曝光。

最近几项研究考察了LLM的推荐偏好。Kumar和Lakkaraju(2024)发现,在咖啡机推荐中,即使竞争替代品规格相同,现有产品仍占主导地位,且产品描述可以被操纵以改变排名。Filandrianos等人(2025)表明,产品描述中的权威和社会认同语言可以改变LLM在咖啡机、相机和书籍等多个品类中的推荐。Pfrommer等人(2024)将电子产品和家电的排名方差分解为产品名称、描述内容和列表位置。Kamruzzaman等人(2024)发现,以美国为中心的LLM在鞋类和服装等品类中偏好全球品牌而非本地品牌。这些研究共同确认了LLM在多个产品品类中携带品牌和流行度偏差。然而,它们尚未解答关于这些偏差背后因果机制、营销语言如何利用偏差,以及多个品牌同时争夺LLM可见性时会发生什么等悬而未决的问题。

为了在LLM时代竞争产品可见性,品牌可能需要改变其广告和营销方式。搜索引擎优化(SEO)是搜索引擎时代的主要策略。其在生成式AI领域的对应策略是生成式引擎优化(GEO;Aggarwal等人,2024):编写产品描述以最大化在LLM生成推荐中的可见性。其商业紧迫性显而易见:2026年2月,OpenAI开始在ChatGPT中向美国免费版和Go版用户测试广告,付费展示位置位于自然回答下方,并明确标注为广告(OpenAI,2026)。OpenAI表示,自然回答独立于广告生成;然而,品牌仍有强烈动机追求GEO,因为优化自然回答本身可能比其下方的付费展示更有价值。随着LLM取代搜索引擎进行产品发现,了解如何在生成式推荐系统中竞争对营销人员至关重要(Xu等人,2025)。但如果GEO有效,每个品牌都有理由使用它,这引出了第二个问题:**当所有品牌同时优化LLM推荐时会发生什么?**

在本文中,我们选择护肤品作为主要研究领域。护肤品属于**体验品**(Nelson,1970),意味着消费者在购买前无法判断质量。同一子品类(例如保湿霜)的产品拥有几乎相同的活性成分和相似浓度,专利配方阻碍了客观比较,且效果因人而异。在这种情境下,品牌声誉成为特别突出的差异化因素(Keller,1993),使护肤品成为研究LLM品牌动态的理论动机起点。对两种搜索品——USB线和AA电池(规格可客观比较)——进行的稳健性检验证实,核心发现可推广到该品类之外(附录H)。

我们进行了三项实验,研究品牌如何在LLM推荐中竞争,从基准偏差测量到GEO策略和多品牌竞争(参见附录A表4与先前工作的比较)。

**实验1:测量在位者优势。** 先前研究将LLM品牌偏差描述为稳定倾向,并使用捏造描述或提示注入等对抗性方法进行测量(Kumar和Lakkaraju,2024;Pfrommer等人,2024;Kamruzzaman等人,2024)。然而,这种偏差的动态性仍未被充分探索:它何时生效,何时失效?从市场竞争的角度看,知名品牌(在位者)相对于新品牌(挑战者)究竟有多大优势?这一优势能否被克服?我们发现,当所有产品看起来完全相同时,知名品牌每次都能获胜。但这种主导地位很脆弱:竞争对手即使只有很小的质量优势也足以打破它。我们将这种模式称为**条件垄断**。新品牌面临的真正障碍并非品牌资产本身,而是缺乏任何区分性信息。这推翻了小品牌无法与大品牌竞争的常见假设。

**实验2:营销语言作为竞争工具。** Filandrianos等人(2025)研究了常见营销技巧(价格促销、稀缺性声明、权威背书)对LLM推荐的影响,发现权威语言改变推荐的效果最大。我们进一步提出疑问:权威式语言能否打破实验1中发现的条件垄断?我们发现问题。权威式语言——例如捏造的临床证据声明——在头对头比较中可靠地战胜了在位者。为了使这一效果对营销人员具有可解释性,我们引入了**偏差盈余价值(BSV)** 指标,将语言效应转换为产品质量等价物。权威语言的价值约为+0.17评级点——这是一项无需成本即可获得的有意义的收益。这表明为何权威声明是高杠杆的GEO信号,也说明平台需要来源验证以防止捏造的背书扭曲推荐。

**实验3:多品牌GEO竞争。** Nestaas等人(2025)表明,在提示注入攻击者之间会出现囚徒困境。然而,提示注入是对抗性的,且可被检测和阻止。当品牌使用商业风格的权威式语言——包括我们实验中的上限捏造证据声明——而非提示注入作为GEO策略时,会发生什么?我们发现这种实践产生了同样的困境。每个品牌被迫采用GEO,因为一旦竞争对手开始使用GEO,选择退出的品牌将获得零推荐。然而,当所有人都优化时,LLM会忽略现在已统一的信号,回退到条件垄断,再次推荐知名品牌。个体收益几乎消失,但没有任何品牌能够承受停止优化的代价。

我们的贡献是:(1)我们衡量了LLM推荐中的在位品牌优势,并描述了条件垄断模式;(2)我们提出了偏差盈余价值(BSV)指标,将营销语言效应转换为产品质量等价物;(3)我们提供了关于使用合法营销语言的多品牌GEO竞争中的囚徒困境式激励的实证证据。

## 2. 实验1:量化在位者优势

实验1探讨一个基本问题:在LLM推荐中,知名品牌相对于未知竞争对手究竟有多大优势,这一优势有多容易被打破?我们通过四个子实验来回答,每个子实验建立在前一个基础上。

#### 设置

我们构建包含10个产品的产品集:1个真实品牌(例如CeraVe、Paula’s Choice)和9个虚构替代品牌。虚构品牌经过三步验证:名称生成、网络搜索去重以及LLM识别筛选,最终在四个护肤品子品类(保湿霜、BHA去角质产品、防晒霜、洁面乳)中产生了120个经过验证的虚构名称。所有实验使用三个LLM(GPT-4o-mini、Claude Sonnet、Gemini 3 Flash),包括英文和中文,温度为0.7,每个条件重复20-30次。

### 2.1 实验1a:品牌名称单独决定推荐吗?

我们从最简单的场景开始:所有10个产品规格相同——相同的评分、价格、评论数量和成分描述。唯一的区别是品牌名称。如果LLM平等对待所有产品,每个产品被推荐的频率约为10%(P随机=0.1)。我们将在位者优势指数(IAI)定义为:IAI = P(真实品牌被推荐)/P随机。

结果令人震惊:在670次有效试验中,真实品牌在100%的情况下被推荐(IAI = 10.0,理论最大值;所有p<.001)。这一结果在三个模型、两种语言以及所有四个产品子品类中均成立——没有任何一个虚构品牌被推荐。图2(a)显示了这一统一结果。LLM并未根据规格评估产品;它只是选择它认识的名字。

这说明当其他条件完全相同时,品牌名称创造了完全的垄断。但这引出了下一个问题:这是一种固定偏差,还是当竞争对手确实更好时会被打破?

### 2.2 实验1b:产品质量能否克服品牌优势?

为了测试这种品牌偏好的强度,我们进行了头对头比较。我们采用品牌身份(真实与虚构)和产品质量(好与坏)的2×2析因设计(N=2,769次有效试验)。关键条件是:虚构品牌获得更好的规格,而真实品牌获得较差的规格。如果在这种情况下LLM仍然推荐真实品牌,那么品牌优势就是无条件的。

我们将此衡量为品牌覆盖比率(BOR)——即LLM在虚构品牌规格更优的情况下仍推荐真实品牌的频率。各子品类的BOR仅为1.7-4.6%。换句话说,当虚构品牌明显更好时,LLM约96%的时间推荐它。图2(b)显示了这一模式。

为了排除一个更简单的解释——即LLM忽略提示并从记忆中的产品知识中回答——我们对所有BOR案例进行了记忆幻觉探测:在21次覆盖响应中,有0次提及提示中未包含的产品特征。2×2 ANOVA确认了显著的交互效应(η²=0.284, p<.001;完整表格见附录C):品牌的影响完全取决于竞争对手是否提供了真正的质量差异。

这一结果改变了我们的理解:品牌优势并非无条件的覆盖,而是一种默认值,仅在产品看起来相同时适用。下一个问题是:需要多大的质量差异才能打破它?

### 2.3 实验1c:需要多小的优势才够?

现在我们沿着四个质量维度(评分、价格、评论和成分质量)将虚构品牌的优势分为五个级别(L0 = 相同,L4 = 大优势)(N=9,220次有效试验)。这使我们能够找到在位者垄断被打破的确切阈值。

结果是一个阶跃函数,如图2(c)所示。在L0(规格相同)时,虚构品牌的胜出率仅为3.6-6.0%,与实验1a一致。在L1——我们测试的最小优势——其胜出率跃升至64-80%,具体取决于维度。没有渐进增加;转变是突然的。在L1之后,曲线趋于平缓:超过L1再多增加优势仅带来微小的额外收益。

50%突破阈值(通过线性插值)为:+0.075星评级优势、1.6倍评论数量或7.3%的价格折扣(附录C)。这些差距非常小——例如,小于4.3星和4.4星评级之间的差距就足以克服实验1a中测量的整个品牌优势。

三个模型反应不同——Claude最难翻转(L1评级BR = 11%,而GPT为94%,Gemini为88%);每个模型的详细信息见附录C。

### 2.4 实验1d:什么驱动LLM推荐?

前三个子实验表明,当产品相同时品牌重要;但当产品不同时质量获胜。实验1d提出问题:在所有条件下,每个因素实际贡献了多少?我们进行了三因素ANOVA(品牌×参数×位置;N=14,395)来分解产品排名的方差。

图2(d)显示了结果。产品参数(评分、价格、评论)解释了82.4%的方差(η²=0.824)。建议在翻译时注意术语统一,如"incumbent advantage"译为"在位者优势"或"在位品牌优势",但标题保持"在位者优势"并作为术语。另外"Conditional Monopoly"译为"条件垄断","Bias Surplus Value"译为"偏差盈余价值","Brand Override Rate"译为"品牌覆盖比率","Generative Engine Optimization"译为"生成式引擎优化",保持与摘要一致。

注意需完整翻译全文,包括后续章节(实验2、3等)但用户只给了前面这些内容(到2.1节)。实际上用户提供的输入包括了摘要、引言和实验1(到2.4节)。需要全部翻译完。继续翻译剩下的部分。

但注意用户消息中只包含了到2.4节的内容,没有实验2和3。所以只能翻译到所提供的文本末尾。但最后一句"Figure2 (d) shows the result. Product parameters (rating, price, reviews) explain 82.4% of variance (η2=0.824" 不完整。用户提供的原文是"Figure2 (d) shows the result. Product parameters (rating, price, reviews) explain 82.4% of variance (η2=0.824" 实际上用户提供的原文在"η2=0.824"后面还有"(完整句子在原文中应该还有内容但被截断了)。我们按照提供的完整部分翻译即可。注意用户消息中明确以"Figure2\(d\)shows the result\. Product parameters \(rating, price, reviews\) explain 82\.4% of variance \(η2=0\.824\ \end{code}" 结尾?不,查看用户消息:最后一段为"Figure2\(d\)shows the result\. Product parameters \(rating, price, reviews\) explain 82\.4% of variance \(η2=0\.824\ \end{code}" 但实际上用户输入中最后是"Figure2 (d)shows the result. Product parameters (rating, price, reviews) explain 82.4% of variance (η2=0.824\ 这里缺少闭合)且没有结束。但为了完整翻译,我们按原文翻译,并保留最后的部分,可能原文有截断。但响应要求只翻译提供的文本。所以我们翻译到“解释82.4%的方差(η²=0.824” 为止,不添加内容。

注意要保留markdown格式。数学公式如η²=0.824保持原样。

另外,用户要求只输出翻译后的markdown/text,不外加任何解释或框架。所以直接输出翻译。

开始翻译。# 在位者优势:LLM推荐系统中的品牌偏差与认知操纵动态
来源:https://arxiv.org/html/2606.17443
###### 摘要

大型语言模型(LLM)正成为消费者寻找产品的主要途径,但我们尚不清楚品牌如何在这一新渠道中竞争。我们通过护肤品——消费者在购买前难以判断质量、必须依赖品牌信誉的品类——研究了三个商业LLM(GPT-4o-mini、Claude Sonnet、Gemini 3 Flash)中的品牌动态,并以搜索品进行了稳健性检验。在三项实验中,我们发现:(1) **条件垄断**:当所有产品规格相同时,知名品牌100%被推荐(IAI = 10.0),但仅需竞争对手拥有+0.1星评级优势,这种主导地位便会消失;(2) 权威式营销语言(包括捏造的临床证据声明)以相当于+0.17评级点的**偏差盈余价值**打破这一垄断,各模型反应不同;(3) 多品牌GEO竞争中存在**社会困境**:当所有品牌采用相同优化策略时,个体收益从+0.802降至+0.007(在我们的收益代理量中),而未参与品牌在我们的测试中未获得任何推荐。我们的结果表明,生成式引擎优化(GEO)不仅应作为安全风险来研究,也应作为塑造市场竞争的新兴营销实践来研究。

## 1. 引言

越来越多的消费者使用ChatGPT、Claude和Gemini等大型语言模型(LLM)来获取产品推荐,而不是自己上网搜索。这些模型可能依赖参数知识,在某些情况下也会借助外部检索或网络搜索,因此其答案可能来自其中一种或两种来源。图1展示了一个真实示例:当用户询问哪种保湿霜最好时,ChatGPT将CeraVe列为“最佳整体”并排在首位。这引出了一个简单的问题:LLM是否已经对某些品牌存在内置偏好?

**图1:** ChatGPT(2026年5月)对“我想买一款好的面部保湿霜,哪个最好?”查询的真实回复。模型将CeraVe列为“最佳整体”并排在首位。对于其他保湿霜品牌,这引发了一个问题:LLM是否已成为已经主导品牌的免费宣传渠道?如果这种偏好始终偏向同一品牌,就会产生我们所说的**在位者优势**:LLM系统性地更频繁推荐知名品牌。这导致了不平衡的市场:成熟品牌获得更多曝光,而新兴或知名度较低的品牌——即使产品同样优质——也难以通过基于LLM的推荐获得曝光。

最近几项研究考察了LLM的推荐偏好。Kumar和Lakkaraju(2024)发现,在咖啡机推荐中,即使竞争替代品规格相同,现有产品仍占主导地位,且产品描述可以被操纵以改变排名。Filandrianos等人(2025)表明,产品描述中的权威和社会认同语言可以改变LLM在咖啡机、相机和书籍等多个品类中的推荐。Pfrommer等人(2024)将电子产品和家电的排名方差分解为产品名称、描述内容和列表位置。Kamruzzaman等人(2024)发现,以美国为中心的LLM在鞋类和服装等品类中偏好全球品牌而非本地品牌。这些研究共同确认了LLM在多个产品品类中携带品牌和流行度偏差。然而,它们尚未解答关于这些偏差背后因果机制、营销语言如何利用偏差,以及多个品牌同时争夺LLM可见性时会发生什么等悬而未决的问题。

为了在LLM时代竞争产品可见性,品牌可能需要改变其广告和营销方式。搜索引擎优化(SEO)是搜索引擎时代的主要策略。其在生成式AI领域的对应策略是生成式引擎优化(GEO;Aggarwal等人,2024):编写产品描述以最大化在LLM生成推荐中的可见性。其商业紧迫性显而易见:2026年2月,OpenAI开始在ChatGPT中向美国免费版和Go版用户测试广告,付费展示位置位于自然回答下方,并明确标注为广告(OpenAI,2026)。OpenAI表示,自然回答独立于广告生成;然而,品牌仍有强烈动机追求GEO,因为优化自然回答本身可能比其下方的付费展示更有价值。随着LLM取代搜索引擎进行产品发现,了解如何在生成式推荐系统中竞争对营销人员至关重要(Xu等人,2025)。但如果GEO有效,每个品牌都有理由使用它,这引出了第二个问题:**当所有品牌同时优化LLM推荐时会发生什么?**

在本文中,我们选择护肤品作为主要研究领域。护肤品属于**体验品**(Nelson,1970),意味着消费者在购买前无法判断质量。同一子品类(例如保湿霜)的产品拥有几乎相同的活性成分和相似浓度,专利配方阻碍了客观比较,且效果因人而异。在这种情境下,品牌声誉成为特别突出的差异化因素(Keller,1993),使护肤品成为研究LLM品牌动态的理论动机起点。对两种搜索品——USB线和AA电池(规格可客观比较)——进行的稳健性检验证实,核心发现可推广到该品类之外(附录H)。

我们进行了三项实验,研究品牌如何在LLM推荐中竞争,从基准偏差测量到GEO策略和多品牌竞争(参见附录A表4与先前工作的比较)。

**实验1:测量在位者优势。** 先前研究将LLM品牌偏差描述为稳定倾向,并使用捏造描述或提示注入等对抗性方法进行测量(Kumar和Lakkaraju,2024;Pfrommer等人,2024;Kamruzzaman等人,2024)。然而,这种偏差的动态性仍未被充分探索:它何时生效,何时失效?从市场竞争的角度看,知名品牌(在位者)相对于新品牌(挑战者)究竟有多大优势?这一优势能否被克服?我们发现,当所有产品看起来完全相同时,知名品牌每次都能获胜。但这种主导地位很脆弱:竞争对手即使只有很小的质量优势也足以打破它。我们将这种模式称为**条件垄断**。新品牌面临的真正障碍并非品牌资产本身,而是缺乏任何区分性信息。这推翻了小品牌无法与大品牌竞争的常见假设。

**实验2:营销语言作为竞争工具。** Filandrianos等人(2025)研究了常见营销技巧(价格促销、稀缺性声明、权威背书)对LLM推荐的影响,发现权威语言改变推荐的效果最大。我们进一步提出疑问:权威式语言能否打破实验1中发现的条件垄断?我们发现问题。权威式语言——例如捏造的临床证据声明——在头对头比较中可靠地战胜了在位者。为了使这一效果对营销人员具有可解释性,我们引入了**偏差盈余价值(BSV)** 指标,将语言效应转换为产品质量等价物。权威语言的价值约为+0.17评级点——这是一项无需成本即可获得的有意义的收益。这表明为何权威声明是高杠杆的GEO信号,也说明平台需要来源验证以防止捏造的背书扭曲推荐。

**实验3:多品牌GEO竞争。** Nestaas等人(2025)表明,在提示注入攻击者之间会出现囚徒困境。然而,提示注入是对抗性的,且可被检测和阻止。当品牌使用商业风格的权威式语言——包括我们实验中的上限捏造证据声明——而非提示注入作为GEO策略时,会发生什么?我们发现这种实践产生了同样的困境。每个品牌被迫采用GEO,因为一旦竞争对手开始使用GEO,选择退出的品牌将获得零推荐。然而,当所有人都优化时,LLM会忽略现在已统一的信号,回退到条件垄断,再次推荐知名品牌。个体收益几乎消失,但没有任何品牌能够承受停止优化的代价。

我们的贡献是:(1)我们衡量了LLM推荐中的在位品牌优势,并描述了条件垄断模式;(2)我们提出了偏差盈余价值(BSV)指标,将营销语言效应转换为产品质量等价物;(3)我们提供了关于使用合法营销语言的多品牌GEO竞争中的囚徒困境式激励的实证证据。

## 2. 实验1:量化在位者优势

实验1探讨一个基本问题:在LLM推荐中,知名品牌相对于未知竞争对手究竟有多大优势,这一优势有多容易被打破?我们通过四个子实验来回答,每个子实验建立在前一个基础上。

#### 设置

我们构建包含10个产品的产品集:1个真实品牌(例如CeraVe、Paula’s Choice)和9个虚构替代品牌。虚构品牌经过三步验证:名称生成、网络搜索去重以及LLM识别筛选,最终在四个护肤品子品类(保湿霜、BHA去角质产品、防晒霜、洁面乳)中产生了120个经过验证的虚构名称。所有实验使用三个LLM(GPT-4o-mini、Claude Sonnet、Gemini 3 Flash),包括英文和中文,温度为0.7,每个条件重复20-30次。

### 2.1 实验1a:品牌名称单独决定推荐吗?

我们从最简单的场景开始:所有10个产品规格相同——相同的评分、价格、评论数量和成分描述。唯一的区别是品牌名称。如果LLM平等对待所有产品,每个产品被推荐的频率约为10%(P随机=0.1)。我们将在位者优势指数(IAI)定义为:IAI = P(真实品牌被推荐)/P随机。

结果令人震惊:在670次有效试验中,真实品牌在100%的情况下被推荐(IAI = 10.0,理论最大值;所有p<.001)。这一结果在三个模型、两种语言以及所有四个产品子品类中均成立——没有任何一个虚构品牌被推荐。图2(a)显示了这一统一结果。LLM并未根据规格评估产品;它只是选择它认识的名字。

这说明当其他条件完全相同时,品牌名称创造了完全的垄断。但这引出了下一个问题:这是一种固定偏差,还是当竞争对手确实更好时会被打破?

### 2.2 实验1b:产品质量能否克服品牌优势?

为了测试这种品牌偏好的强度,我们进行了头对头比较。我们采用品牌身份(真实与虚构)和产品质量(好与坏)的2×2析因设计(N=2,769次有效试验)。关键条件是:虚构品牌获得更好的规格,而真实品牌获得较差的规格。如果在这种情况下LLM仍然推荐真实品牌,那么品牌优势就是无条件的。

我们将此衡量为品牌覆盖比率(BOR)——即LLM在虚构品牌规格更优的情况下仍推荐真实品牌的频率。各子品类的BOR仅为1.7-4.6%。换句话说,当虚构品牌明显更好时,LLM约96%的时间推荐它。图2(b)显示了这一模式。

为了排除一个更简单的解释——即LLM忽略提示并从记忆中的产品知识中回答——我们对所有BOR案例进行了记忆幻觉探测:在21次覆盖响应中,有0次提及提示中未包含的产品特征。2×2 ANOVA确认了显著的交互效应(η²=0.284, p<.001;完整表格见附录C):品牌的影响完全取决于竞争对手是否提供了真正的质量差异。

这一结果改变了我们的理解:品牌优势并非无条件的覆盖,而是一种默认值,仅在产品看起来相同时适用。下一个问题是:需要多大的质量差异才能打破它?

### 2.3 实验1c:需要多小的优势才够?

现在我们沿着四个质量维度(评分、价格、评论和成分质量)将虚构品牌的优势分为五个级别(L0 = 相同,L4 = 大优势)(N=9,220次有效试验)。这使我们能够找到在位者垄断被打破的确切阈值。

结果是一个阶跃函数,如图2(c)所示。在L0(规格相同)时,虚构品牌的胜出率仅为3.6-6.0%,与实验1a一致。在L1——我们测试的最小优势——其胜出率跃升至64-80%,具体取决于维度。没有渐进增加;转变是突然的。在L1之后,曲线趋于平缓:超过L1再多增加优势仅带来微小的额外收益。

50%突破阈值(通过线性插值)为:+0.075星评级优势、1.6倍评论数量或7.3%的价格折扣(附录C)。这些差距非常小——例如,小于4.3星和4.4星评级之间的差距就足以克服实验1a中测量的整个品牌优势。

三个模型反应不同——Claude最难翻转(L1评级BR = 11%,而GPT为94%,Gemini为88%);每个模型的详细信息见附录C。

### 2.4 实验1d:什么驱动LLM推荐?

前三个子实验表明,当产品相同时品牌重要;但当产品不同时质量获胜。实验1d提出问题:在所有条件下,每个因素实际贡献了多少?我们进行了三因素ANOVA(品牌×参数×位置;N=14,395)来分解产品排名的方差。

图2(d)显示了结果。产品参数(评分、价格、评论)解释了82.4%的方差(η²=0.824

相似文章

从提示到行为对齐:用于推荐评估的个性化LLM评判器

arXiv cs.AI

本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。

默认极化:LLM 内容策展中的推荐偏差审计

arXiv cs.CL

本文对 OpenAI、Anthropic 和 Google 的基于 LLM 的内容策展推荐偏差进行了大规模审计,使用了来自 Twitter/X、Bluesky 和 Reddit 数据的 540,000 次模拟选择。研究发现 LLM 系统性地放大极化现象,在毒性处理方面表现出不同的权衡,并显示出显著的政治倾向偏差,倾向于左倾作者,尽管数据集中右倾作者占多数。