GoCoMA:基于双曲 Poincaré 球嵌入的大语言模型生成代码溯源多模态表征融合

arXiv cs.CL 论文

摘要

GoCoMA 是一个多模态框架,采用双曲 Poincaré 球嵌入来融合代码文体学和二进制可执行产物图像,用于对大语言模型生成的代码进行溯源,在两个基准数据集上优于单模态和欧几里得基线方法。

arXiv:2604.16377v1 Announce Type: new \n\n摘要:在大规模代码语料库上训练的大语言模型(LLMs)如今已越来越能够生成难以与人类编写代码区分的代码。这引发了实际安全问题,包括安全漏洞和许可模糊性,同时也引出了一个取证问题:"这段代码是谁(或哪个 LLM)写的?" 我们提出了 GoCoMA,一个多模态框架,用于建模(i)代码文体学与(ii)二进制可执行产物(BPEA)图像表示之间的外在层级关系:前者捕获高层级结构和风格特征,后者捕获由编译和工具链塑造的低层级、面向执行的字节语义。GoCoMA 将模态嵌入投影到双曲 Poincaré 球中,通过基于测地线余弦相似度的跨模态注意力(GCSA)融合机制进行融合,并将融合后的表征投影回欧几里得空间以完成最终的 LLM 来源溯源。在两个开源基准数据集(CoDET-M4 和 LLMAuthorBench)上的实验表明,GoCoMA 在相同的评估协议下始终优于单模态和欧几里得多模态基线方法。
查看原文

相似文章

OmniScope:全模态大语言模型的模态解耦令牌压缩

Hugging Face Daily Papers

OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。