model-auditing

标签

Cards List
#model-auditing

基于参考的LLM蒸馏检测

arXiv cs.LG · 2026-07-14 缓存

本文介绍了一种基于参考的方法,通过成员推断来检测LLM是否是从特定教师模型蒸馏而来。该方法在受控设置下实现了近乎完美的准确性,并提供了关于QwQ、DeepSeek-R1和GPT-OSS之间潜在蒸馏关系的新证据。

0 人收藏 0 人点赞
#model-auditing

新方法旨在保护儿童免受非法AI生成内容的侵害

MIT News — Artificial Intelligence · 2026-07-13 缓存

MIT研究人员开发了一种技术,用于审计AI模型生成儿童性虐待材料的能力,而无需产生非法输出,在测试中达到了100%的准确率。该方法通过检查模型的隐藏表征来推断模型是否已被微调用于有害内容,为平台和执法部门提供了一种可扩展的检测不安全模型的方法。

0 人收藏 0 人点赞
#model-auditing

通过任务特定自我报告揭示隐藏的模型行为

arXiv cs.CL · 2026-07-07 缓存

本文介绍了SAR,一种轻量级LoRA适配器,使微调的语言模型能够自我报告隐藏行为(如后门),通过检测所有植入的行为并将幻觉率减半,优于现有方法。

0 人收藏 0 人点赞
#model-auditing

循环去噪揭示扩散模型中的超稳定记忆

arXiv cs.LG · 2026-06-24 缓存

循环去噪作为一种新颖的提取攻击方法,通过反复对样本进行加噪和去噪,揭示了扩散模型中超稳定的记忆训练图像。该技术无需梯度或权重检查,对隐私审计具有重要意义。

0 人收藏 0 人点赞
#model-auditing

idSCD:通过语义相关描述符识别训练数据集

arXiv cs.LG · 2026-06-01 缓存

本文介绍了 idSCD,一种使用语义相关描述符来识别数据集是否用于模型训练的白盒方法,在多种设置下均优于现有基线。

0 人收藏 0 人点赞
#model-auditing

I-SAFE:用于科学AI模型结构审计的Wasserstein一致性度量

arXiv cs.LG · 2026-05-22 缓存

本文介绍了I-SAFE,一个基于Wasserstein一致性度量的科学AI模型事后分布审计框架,它揭示了基于准确率的评估无法捕获的模型输出中的结构差异。在药物-靶点相互作用预测任务上进行了演示,该框架是模型无关的,适用于任何具有结构化输入和外部先验知识的领域。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈