TH-GNN:异构时序图神经网络用于LLM代理刷单攻击检测
摘要
本文介绍了TH-GNN,一种异构时序图神经网络,融合图结构和文本语义以检测推荐系统中由LLM代理生成的刷单攻击,并优于现有方法。
arXiv:2608.20376v1 公告类型:新
摘要:LLM代理现在可以大规模生成逼真的刷单资料、流畅的评论和连贯的评分,系统性地击败推荐系统的防御机制。仅基于文本的检测器通过标记评论嵌入中的语义漂移来检测,但对图结构和时序协调视而不见,而仅基于图的检测器利用邻域异常,无法推理评论语义或LLM生成内容产生的跨模态不一致性。我们提出了TH-GNN,一种异构时序图神经网络,采用双层异构图Transformer骨干网络,在每条边上应用按类型和关系的注意力机制,并辅以可学习的正弦时序编码。跨模态注意力融合结构化用户嵌入与冻结的RoBERTa评论和物品描述表示,同时GRU处理对数间隔到达时间以捕获时序突发性。在五个攻击家族和四个基准数据集上评估,TH-GNN的总体平均F1分数为0.870,在Agent4SR攻击上优于最强的纯文本基线10.9个百分点和11.5个百分点(在最低注入率下)。这些结果表明,联合建模时序、结构和语义信号对于检测复杂的LLM驱动刷单攻击是有效的。
查看缓存全文
缓存时间: 2026/08/24 04:16
# 用于大语言模型代理灌水攻击检测的异构时序图神经网络 来源:https://arxiv.org/html/2608.20376 作者:Divya Prakash Shrivastava(扎耶德大学,迪拜,阿联酋)与 Rakesh Thakur(JAIN(被认定为)大学,班加罗尔,印度) (2026) ###### 摘要 大语言模型代理现在能够大规模地生成看似真实的灌水画像——流畅的评论和连贯的评分——系统性地击败推荐系统的防御。仅依赖文本的检测器通过标记评论嵌入中的语义漂移来工作,但对图结构和时序协调视而不见;仅利用图的检测器虽然能利用邻域异常,但无法推理评论语义或由大语言模型生成内容产生的跨模态不一致性。我们提出了 TH-GNN,一种异构时序图神经网络。它采用两层异构图Transformer主干,应用基于类型、基于关系的注意力机制,并在每条边上通过可学习的正弦时序编码进行增强。跨模态注意力机制将结构性的用户嵌入与冻结的 RoBERTa 表示(用于评论和物品描述)进行融合;一个 GRU 网络对数间隔到达时间序列进行建模,以捕捉突发性。在五个攻击家族和四个数据集上,TH-GNN 取得了 0.870 的总体平均 F1 分数,在 Agent4SR 攻击上,即使在最低注入率下,也比最强的纯文本基线高出 10.9 个百分点和 11.5 个百分点。代码和数据划分可在以下地址获取:https://github.com/shiv3589/thgnn-shilling。 灌水攻击检测,异构图神经网络,时序编码,大语言模型生成画像,推荐系统 ††会议:ACM 会议;年份;地点††期刊年份:2026††CCS:计算方法学 神经网络††CCS:信息系统 推荐系统††CCS:安全与隐私 入侵检测系统 ## 1. 引言 当一个大语言模型代理构建一个虚假的推荐系统画像时,它并非简单地分配随机评分。给定一个目标物品和一个按程序生成的角色,Agent4SR(Zhang 等人,2024 (https://arxiv.org/html/2608.20376#bib.bib29))会为看似合理的填充物品撰写 10-20 条自然语言评论,分配与该角色声明偏好一致的评分,并给目标物品最高评分。由此产生的画像语法流畅、主题连贯,并且在统计上与真实用户无法区分:它匹配全局评分分布,自然地穿插流行的填充物品,其评论文本的语义嵌入也舒适地落在真实用户流形内。当一个活动协调一致地批量注入许多此类画像时,没有任何单一的异常信号——评分统计、文本异常分数或邻域结构——能单独标记出其中任何一个。 现有检测器分为两类,每一类都对代理生成画像同时利用的两个维度之一视而不见。仅文本的检测器(如 SemanticShield(Li 等人,2025 (https://arxiv.org/html/2608.20376#bib.bib12)))将每个用户的聚合评论嵌入与真实用户质心进行比较;它们是应对大语言模型生成文本的最强单模态基线,但在仅包含评分的数据集上失效,完全忽略交互图,并且当画像在数天内而非数秒内注入时,什么也检测不到。仅利用图的检测器(如 Anti-FakeU(Zhang 等人,2022 (https://arxiv.org/html/2608.20376#bib.bib28)))通过用户-物品二部图中节点的度不对称性和共同购买重叠度对用户评分;它们能很好地处理结构性攻击,但对流畅的大语言模型文本伴随合理评分模式时引入的跨模态不一致性视而不见,并且完全丢弃了边时间戳,错过了协调波次注入画像的活动留下的同步突发特征。这两类检测器都无法检测同时具备图合理性、文本连贯性和时序协调性的威胁。 TH-GNN 通过一个基于三个非冗余信号流的统一架构解决了所有三种失败模式。结构主干是一个两层异构图Transformer,它将用户、评论和物品表示为由类型化的 writes、about 和 rates 边连接的不同节点类型,并学习基于类型和基于关系的注意力模式,以捕捉每种节点类型携带的质性不同的特征。时间戳信息通过可学习的正弦编码直接编织到每条边的注意力logit中,使模型能够识别暴露协调注入的压缩间隔到达时间,而无需显式的活动级监督。图编码器之后,一个跨模态注意力块将结构嵌入与用户评论的平均池化 RoBERTa 表示以及用户评分的物品表示进行融合,在单一的学习注意力分布下整合文本和关系视图。一个轻量级 GRU 作用于每个用户的对数间隔到达时间序列,提供与图拓扑和文本内容都正交的显式突发性信号。一个两层 MLP 对拼接后的信号流进行处理,产生最终的虚假用户分数。 TH-GNN 在所有 20 个数据集-攻击配置中,取得了 0.870 的总体平均 F1 分数,在每一行上均统一超过所有基线。与 Agent4SR 的差距最大,其中 TH-GNN 的平均 F1 为 0.825,而 SemanticShield 为 0.716——差距达到 +10.9 个百分点——同时假警报率低于 4.5%,而基线为 6.8%-12.5%。在最低注入率(0.5%,即每 1000 个真实用户只有 5 个虚假画像)下,在 Agent4SR 上的优势扩大到 +11.5 个百分点,因为当注入量缩小到基于计数和分布的检测器的阈值以下时,图时序协调信号变得更加显著。 主要贡献: - • 我们提出了 TH-GNN,一种异构时序图神经网络,它联合编码用户-评论-物品交互图、评论和物品文本流以及每个用户的时序突发性以用于灌水检测——这是第一个同时弥合先前技术所有三种失败模式的检测器。 - • 我们展示了在五个攻击家族(随机、跟风、AUSH、GraphAttack、Agent4SR)和四个多样化数据集上的最先进检测能力,并且在单模态基线退化最快的低注入率下,保持一致的优势差距。 - • 我们提供了首个针对大语言模型代理攻击的灌水检测器在多数据集和多注入率下的系统评估,建立了一个清晰区分多模态检测器和单模态基线的基准。 - • 我们发布了所有 720 次实验运行的代码、配置文件和可复现脚本,以支持该领域的未来研究。 ## 2. 相关工作 ### 2.1. 灌水攻击检测 灌水攻击检测有着二十年的历史,涵盖统计、监督和基于图的范式。基础统计方法将每个用户的评分画像视为特征向量并标记异常值。Chirita 等人(Chirita 等人,2005 (https://arxiv.org/html/2608.20376#bib.bib3))定义了每用户特征——评分偏离物品均值、加权平均偏差(WDMA)、画像长度和填充物品比例——这些共同捕捉了注入的粗略特征:目标物品上虚高的评分、均匀的填充评分以及不自然的短画像。补充性工作将主成分分析(PCA)应用于用户-评分矩阵,将注入的画像视为低秩扰动,其主方向与真实用户方差分离(Williams 等人,2007 (https://arxiv.org/html/2608.20376#bib.bib24))。聚类方法通过将评分向量可疑相似的用户分组扩展了这一思想——当攻击者在多个虚假账户间重复使用固定的填充模板时,就会出现这种模式(Mehta 和 Nejdl,2009 (https://arxiv.org/html/2608.20376#bib.bib18))。统计检测器速度快且不需要标记数据,但它们无法应对经过调整以匹配真实评分分布的自适应攻击,例如跟风策略(Mobasher 等人,2007 (https://arxiv.org/html/2608.20376#bib.bib19))及其后续版本。 监督分类器引入了标记的灌水数据集和逐用户特征工程。在基于评分的特征上训练的随机森林和 SVM 检测器对已知攻击家族实现了高召回率,但过拟合于训练时看到的特定注入特征,并在未见过的攻击画像上性能下降(Burke 等人,2005 (https://arxiv.org/html/2608.20376#bib.bib2))。深度学习变体用循环或卷积编码器替换了手工统计特征,以处理评分序列,恢复了标量特征所丢弃的时序模式(Wu 等人,2021 (https://arxiv.org/html/2608.20376#bib.bib26))。然而,所有这些方法都独立处理用户;它们错过了当一组虚假画像共同针对一组物品时产生的关系异常。 基于图的检测器利用了这种关系信号。构建用户-物品二部图并通过结构异常度量(如度不对称性、邻域重叠度、共同购买集中度)对节点评分的方法,在面对像 AUSH(Lin 等人,2020 (https://arxiv.org/html/2608.20376#bib.bib13))这样结构连贯的攻击家族时,显著优于单用户统计。Anti-FakeU(Zhang 等人,2022 (https://arxiv.org/html/2608.20376#bib.bib28))是可比性最强的先前工作:它构建了一个二部用户-物品图,并通过基于一阶邻域统计(包括共同购买重叠和度不对称性)的图异常评分来检测虚假用户。然而,Anti-FakeU 既不编码评论文本,也不编码边时间戳,留下了两个系统性盲点:它无法检测当流畅的大语言模型文本伴随结构合理的评分模式时引入的跨模态不一致性,并且没有机制来识别区分现代注入活动与有机活动的协调时序突发。基于大语言模型的生成加剧了这一挑战,它消除了历史上区分合成与真实画像的文本特征。 ### 2.2. 大语言模型生成虚假内容的检测 检测计算生成的欺骗性内容是一个长期存在的问题,随着大语言模型的出现,这个问题变得困难得多。Ott 等人(Ott 等人,2011 (https://arxiv.org/html/2608.20376#bib.bib21))建立了众包的欺骗性酒店评论基准,并表明人类判断者和单分类器的表现仅略高于随机水平,这推动了自动化语言学方法的发展。后续工作编目了平台级评论垃圾邮件的文本特征——夸大的情感、模糊的具体细节、过多的第一人称视角以及可疑的短暂活动窗口(Jindal 和 Liu,2008 (https://arxiv.org/html/2608.20376#bib.bib9))——并训练监督分类器来利用这些特征。这些分类器对基于模板的生成器有效,但依赖于神经生成器容易违反的分布假设。 GPT 时代重塑了检测格局。Zellers 等人(Zellers 等人,2019 (https://arxiv.org/html/2608.20376#bib.bib27))表明,神经虚假新闻生成器产生的文本既能欺骗人类读者也能欺骗传统检测器,并且最有效的判别器是同族对抗训练的模型。当代大语言模型生成文本检测器利用自回归采样中微妙的统计偏差——词元概率曲率、基于排序的特征——但这些信号在改写或攻击者控制解码参数时会消失(Guo 等人,2023 (https://arxiv.org/html/2608.20376#bib.bib5))。大语言模型水印(Kirchenbauer 等人,2023 (https://arxiv.org/html/2608.20376#bib.bib10))通过在生成时将词元选择偏向一个秘密的哈希分区来嵌入可检测的统计模式;虽然理论上合理,但当攻击者控制生成器时水印不适用,并且在商业部署的模型中不存在。 SemanticShield(Li 等人,2025 (https://arxiv.org/html/2608.20376#bib.bib12))专门针对推荐系统场景:它使用预训练语言模型编码每个用户的聚合评论语料库,并标记那些在嵌入空间中偏离真实用户质心的画像。当存在评论文本时,SemanticShield 是应对大语言模型代理攻击的最强单模态文本基线。然而,在没有评论文本的数据集上它退化到随机水平,没有提供检测注入画像间时序协调的机制,并且忽略了用户-物品交互图中可用的结构信号——即使当虚假画像的文本内容与真实用户无法区分时,这些信号也是有信息量的。能够提供这些互补信号的结构化和时序图架构将在下一节综述。 ### 2.3. 异构和时序图神经网络 标准图神经网络将所有节点和边同质化到一个特征空间中,丢弃了语义上有意义的类型区分。异构图Transformer(HGT;Hu 等人(Hu 等人,2020 (https://arxiv.org/html/2608.20376#bib.bib8)))通过为每个节点类型和关系类型分别参数化查询、键、值和消息矩阵来解决这个问题,为每种组合学习质性不同的交互模式。HGT 在异构学术网络基准上实现了最先进的性能,并随后被应用于知识图谱推理和跨域推荐(Lv 等人,2021 (https://arxiv.org/html/2608.20376#bib.bib17))。这种特定类型的参数化对于灌水检测设置至关重要,因为用户、物品和评论节点携带结构和语义上不同的攻击特征。 时序动态引入了一个互补的轴。时序图网络(TGN;Rossi 等人(Rossi 等人,2020 (https://arxiv.org/html/2608.20376#bib.bib22)))维护一个由基于连续时间边事件的条件消息函数更新的逐节点记忆,使得表示能够跟踪每个节点在新交互到来时的演变状态。TGN 表明,即使是简单的时间编码——例如,事件间隔的可学习正弦嵌入——也能在具有突发到达过程的链路预测基准上带来巨大收益。欺诈检测也独立发现了时序信号:FRAUDRE 及相关方法表明,欺诈账户的间隔到达时间分布与真实用户显著不同,产生了静态图特征完全遗漏的异常信号(Liu 等人,2025 (https://arxiv.org/html/2608.20376#bib.bib16))。尽管存在这些平行进展,但尚无先前工作将异构图编码与可学习的时序注意力相结合用于灌水攻击检测,其中三类型的用户-评论-物品拓扑和带时间戳的注入信号共同提供了正交且非冗余的检测轴。 ### 2.4. 用于推荐攻击的大语言模型代理 Agent4SR(Zhang 等人,2024 (https://arxiv.org/html/2608.20376#bib.bib29))是首个将灌水攻击构建框架化为多步代理任务的工作:通过提示大型语言模型来构建一个完整的虚假用户角色,生成连贯的评论历史,并分配与该角色声明偏好一致的评分,同时优化目标物品的曝光。由此产生的画像语法流畅、主题连贯,在统计上与真实用户相似,系统性地逃避了依赖于分布性评分异常的检测器。
相似文章
超越金牌教师:通过LLM-GNN协同教学增强图学习
本文提出LLM-GNN协同教学(LLM-GNN Co-Teaching),一种面向文本属性图的小样本图学习的双向框架。LLM和GNN交换高置信度的伪标签,并利用基于轮次的偏好优化(RPL-PO)相互改进,在基准测试上优于先前方法。
TMR-GGNN:基于时间感知多关系引导图神经网络的信用卡欺诈检测
提出TMR-GGNN,一种用于信用卡欺诈检测的时间感知多关系图神经网络,通过对比学习和焦点损失处理不平衡数据和不断演变的欺诈模式。
使用GFlowNets为LLM生成攻击
本文提出使用GFlowNets训练一个攻击者LLM,自动生成针对受害者LLM的对抗性攻击,从而在英语和土耳其语中实现自动化红队测试和鲁棒性评分。
基于时间增强符号图神经网络的动态链接预测
本文提出了一种面向符号图神经网络的模块化时间增强框架,通过历史上下文集成模块(HCIM)结合LSTM和多头时间注意力机制整合历史上下文,在真实世界的时间符号网络上进行动态链接预测时取得了持续改进。
TAROT:面向少样本表格学习的LLM先验图任务自适应精化
TAROT提出了一个基于GNN的框架,利用LLM构建和精化任务自适应的语义图,用于少样本表格学习,达到了最先进的性能。