一个被污染的页面就足够了:评估LLM推荐器中的网页内容污染

Hugging Face Daily Papers 论文

摘要

本文介绍了FORGE基准测试,用于评估生成引擎优化污染的网页内容如何误导搜索增强的LLM推荐器推广虚假产品,揭示了显著的漏洞和无效的防御措施。

搜索增强的LLM通过检索实时网页内容来中介日常消费者推荐。这带来了新的风险:LLM推荐器可能消费被生成引擎优化(GEO)操作者污染的网页内容以误导它们。我们问:它们在多大程度上会无意中成为虚假产品的推广者?我们介绍了FORGE(生成环境中的虚假在线推荐),它在本地将一组冻结的检索网页中的真实产品改写为虚假产品,并测量LLM推荐虚假产品的频率,涵盖15个类别中的225个真实产品和5个消费者场景。在12个商业和开放权重的LLM中,所有模型都易受攻击:单个被污染的页面导致受骗率高达27%,而完全的前三名替换将其提高到73.8%。易受攻击性在不同类别中有所不同,当模型缺乏产品的稳定先验知识时增加。推理并不能缓解这种漏洞;相反,它经常生成虚假的社会证明来为虚假推荐辩护。四种防御措施都不够充分:怀疑提示可能像推理一样加剧漏洞,两种共识过滤器有压制合法产品的风险,可信度重排对所有模型都有帮助,但只移除了六分之一的虚假产品。我们在https://github.com/leoluolol/forge-benchmark发布FORGE基准和评估代码。
查看原文
查看缓存全文

缓存时间: 2026/08/25 08:35

论文页面 - 一个被污染的页面就足够了:评估LLM推荐系统中的网页内容污染问题

来源:https://huggingface.co/papers/2606.13610

摘要

搜索增强型LLM推荐系统极易受到生成式引擎优化所污染的网页内容影响,尽管具备推理能力和防御机制,仍常推荐虚假产品。

搜索增强型大语言模型(https://huggingface.co/papers?q=Search-augmented%20LLMs)通过检索实时网页内容,日益成为日常消费推荐的核心中介。这引入了新的风险:LLM推荐系统可能摄入被生成式引擎优化(Generative Engine Optimization,https://huggingface.co/papers?q=Generative%20Engine%20Optimization)(GEO)操作者污染的网页内容,从而被误导。我们提出疑问:这些系统在多大程度上成为了虚假产品的无意推广者?我们推出了FORGE(生成环境中的虚假在线推荐)基准测试,该方法在固定的检索网页集合中,将真实产品局部改写为虚假产品,并测量LLM推荐虚假产品的频率——涵盖15个品类的225个真实产品和5种消费场景。通过测试12个商用和开源权重LLM,所有模型均存在漏洞:单个被污染页面的欺骗率高达27%,而全部前3名页面替换后该比率升至73.8%。漏洞程度因产品类别而异,当模型缺乏稳定的产品先验知识时,漏洞风险进一步升高。推理机制(https://huggingface.co/papers?q=Reasoning)无法缓解此漏洞;相反,它常生成虚假社会证明来为错误推荐辩护。四种防御手段均不完善:怀疑式提示可能像推理(https://huggingface.co/papers?q=reasoning)一样加剧漏洞;两种共识过滤器(https://huggingface.co/papers?q=consensus%20filters)存在抑制合法产品的风险;可信度重排序(https://huggingface.co/papers?q=credibility%20re-ranking)虽对所有模型均有助益,但仅能剔除六分之一的虚假产品。我们已发布FORGE基准测试(https://huggingface.co/papers?q=FORGE%20benchmark)及评估代码:https://github.com/leoluolol/forge-benchmark。

查看arXiv页面 (https://arxiv.org/abs/2606.13610) | 查看PDF (https://arxiv.org/pdf/2606.13610) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.13610)

通过您的代理获取此论文:

hf papers read 2606.13610

尚未安装最新CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型(0)

暂无模型链接此论文

在模型README.md中引用arxiv.org/abs/2606.13610,即可从本页面建立链接。

引用本文的数据集(0)

暂无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2606.13610,即可从本页面建立链接。

引用本文的Space(0)

暂无Space链接此论文

在Space README.md中引用arxiv.org/abs/2606.13610,即可从本页面建立链接。

包含本文的收藏(0)

暂无收藏包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面建立链接。

相似文章

默认极化:LLM 内容策展中的推荐偏差审计

arXiv cs.CL

本文对 OpenAI、Anthropic 和 Google 的基于 LLM 的内容策展推荐偏差进行了大规模审计,使用了来自 Twitter/X、Bluesky 和 Reddit 数据的 540,000 次模拟选择。研究发现 LLM 系统性地放大极化现象,在毒性处理方面表现出不同的权衡,并显示出显著的政治倾向偏差,倾向于左倾作者,尽管数据集中右倾作者占多数。

超越静态基准:基于角色模拟合成有害内容以实现鲁棒性评估

arXiv cs.CL

# 超越静态基准:基于角色模拟合成有害内容以实现鲁棒性评估 Source: [https://arxiv.org/html/2604.17020](https://arxiv.org/html/2604.17020) Huije Lee Jisu Shin Hoyun Song Changgeon Ko Jong C\. Park Korea Advanced Institute of Science and Technology \(KAIST\) \{huijelee,jisu\.shin,hysong,pencaty,jongpark\}@kaist\.ac\.kr ###### Abstract 面向有害内容检测的静态基准在可扩展性与多样性方面存在局限,且可能受...