一个被污染的页面就足够了:评估LLM推荐器中的网页内容污染
摘要
本文介绍了FORGE基准测试,用于评估生成引擎优化污染的网页内容如何误导搜索增强的LLM推荐器推广虚假产品,揭示了显著的漏洞和无效的防御措施。
查看缓存全文
缓存时间: 2026/08/25 08:35
论文页面 - 一个被污染的页面就足够了:评估LLM推荐系统中的网页内容污染问题
来源:https://huggingface.co/papers/2606.13610
摘要
搜索增强型LLM推荐系统极易受到生成式引擎优化所污染的网页内容影响,尽管具备推理能力和防御机制,仍常推荐虚假产品。
搜索增强型大语言模型(https://huggingface.co/papers?q=Search-augmented%20LLMs)通过检索实时网页内容,日益成为日常消费推荐的核心中介。这引入了新的风险:LLM推荐系统可能摄入被生成式引擎优化(Generative Engine Optimization,https://huggingface.co/papers?q=Generative%20Engine%20Optimization)(GEO)操作者污染的网页内容,从而被误导。我们提出疑问:这些系统在多大程度上成为了虚假产品的无意推广者?我们推出了FORGE(生成环境中的虚假在线推荐)基准测试,该方法在固定的检索网页集合中,将真实产品局部改写为虚假产品,并测量LLM推荐虚假产品的频率——涵盖15个品类的225个真实产品和5种消费场景。通过测试12个商用和开源权重LLM,所有模型均存在漏洞:单个被污染页面的欺骗率高达27%,而全部前3名页面替换后该比率升至73.8%。漏洞程度因产品类别而异,当模型缺乏稳定的产品先验知识时,漏洞风险进一步升高。推理机制(https://huggingface.co/papers?q=Reasoning)无法缓解此漏洞;相反,它常生成虚假社会证明来为错误推荐辩护。四种防御手段均不完善:怀疑式提示可能像推理(https://huggingface.co/papers?q=reasoning)一样加剧漏洞;两种共识过滤器(https://huggingface.co/papers?q=consensus%20filters)存在抑制合法产品的风险;可信度重排序(https://huggingface.co/papers?q=credibility%20re-ranking)虽对所有模型均有助益,但仅能剔除六分之一的虚假产品。我们已发布FORGE基准测试(https://huggingface.co/papers?q=FORGE%20benchmark)及评估代码:https://github.com/leoluolol/forge-benchmark。
查看arXiv页面 (https://arxiv.org/abs/2606.13610) | 查看PDF (https://arxiv.org/pdf/2606.13610) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.13610)
通过您的代理获取此论文:
hf papers read 2606.13610
尚未安装最新CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型(0)
暂无模型链接此论文
在模型README.md中引用arxiv.org/abs/2606.13610,即可从本页面建立链接。
引用本文的数据集(0)
暂无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2606.13610,即可从本页面建立链接。
引用本文的Space(0)
暂无Space链接此论文
在Space README.md中引用arxiv.org/abs/2606.13610,即可从本页面建立链接。
包含本文的收藏(0)
暂无收藏包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面建立链接。
相似文章
[论文] 主要基准测试被发现存在污染,多达12%的问题有缺陷
本文审查了主要的LLM基准测试(GPQA、MMLU-Pro、MMMU-Pro),发现4.5%至11.8%的项目存在错误答案键或格式错误,并发布了修正后的‘Clean’版本供直接使用。
作为脆弱性的相关性:Web检索如何削弱LLM智能体的安全对齐
本文研究了将Web检索集成到LLM智能体中如何削弱安全对齐,揭示了“安全来源悖论”:即使是面向安全的文档也会增加有害遵从性。本文介绍了AgentREVEAL诊断框架和HarmURLBench基准,用于分析和评估检索引发的安全漏洞。
默认极化:LLM 内容策展中的推荐偏差审计
本文对 OpenAI、Anthropic 和 Google 的基于 LLM 的内容策展推荐偏差进行了大规模审计,使用了来自 Twitter/X、Bluesky 和 Reddit 数据的 540,000 次模拟选择。研究发现 LLM 系统性地放大极化现象,在毒性处理方面表现出不同的权衡,并显示出显著的政治倾向偏差,倾向于左倾作者,尽管数据集中右倾作者占多数。
超越静态基准:基于角色模拟合成有害内容以实现鲁棒性评估
# 超越静态基准:基于角色模拟合成有害内容以实现鲁棒性评估 Source: [https://arxiv.org/html/2604.17020](https://arxiv.org/html/2604.17020) Huije Lee Jisu Shin Hoyun Song Changgeon Ko Jong C\. Park Korea Advanced Institute of Science and Technology \(KAIST\) \{huijelee,jisu\.shin,hysong,pencaty,jongpark\}@kaist\.ac\.kr ###### Abstract 面向有害内容检测的静态基准在可扩展性与多样性方面存在局限,且可能受...
区分AI生成与人类撰写:评估LLM检测LLM生成内容的能力
本文研究了在教育场景中,LLMs在多大程度上能够检测自身生成的内容,发现检测准确率因任务类型而异,且对于简答题不可靠。