model-auditing

标签

Cards List
#model-auditing

利用推理计算与部署框架提升评估真实性

arXiv cs.AI · 2天前 缓存

本文介绍了批判精炼和DISH,通过减轻评估意识来提升对齐评估的真实性,证明结合两种技术比单独使用任何一种都能带来显著改进。

0 人收藏 0 人点赞
#model-auditing

@Miles_Brundage: 我还不够深入了解细节,无法对2倍GPT-4的澄清/安抚程度发表看法,但很高兴OAI迅速发布……

X AI KOLs Timeline · 3天前 缓存

Miles Brundage 评论 OpenAI 的声明,澄清像 Astra 这样的前沿模型的计算深度在 GPT-4 的两倍以内,倡导持续嵌入式审计而不是反应性措施。

0 人收藏 0 人点赞
#model-auditing

Counterfactual Fragility Certificates: 揭露结构化证据失效下的高置信度脆弱性

arXiv cs.LG · 3天前 缓存

Counterfactual Fragility Certificates (CFC) 引入了一种模型无关的审计协议,用于检测机器学习模型在结构化证据失效场景下的高置信度脆弱性,相比现有方法有所改进。

0 人收藏 0 人点赞
#model-auditing

你的社区安全吗?大型语言模型城市安全判断中的基于地点的污名

arXiv cs.AI · 2026-08-28 缓存

本研究考察了大型语言模型如何根据社区名称与坐标来判断城市安全,揭示了名称既承载犯罪信号又承载人口统计偏差,且偏差随地理知识扩展。

0 人收藏 0 人点赞
#model-auditing

EXPL-FR:通过视觉语言对齐解释人脸识别模型

Hugging Face Daily Papers · 2026-08-21 缓存

EXPL-FR 是一种方法,通过将视觉语言嵌入与识别空间对齐来解释人脸识别模型,从而实现语义属性的无标签审计和模型比较,而无需访问模型架构。

0 人收藏 0 人点赞
#model-auditing

衡量而非优化:预测LLM遗忘中的恢复

arXiv cs.CL · 2026-08-13 缓存

提出了J-Access,一种使用雅可比透镜的推理时审计方法,用于衡量未学习(unlearned)LLM中残余知识的可访问性,发现可访问性可预测恢复速度,但直接最小化它并不能促进真正的删除。

0 人收藏 0 人点赞
#model-auditing

时间序列预测器是否使用了正确的历史:时间延迟的可恢复性、恢复与功能使用

arXiv cs.LG · 2026-08-12 缓存

本文研究时间序列预测器是否使用了正确的历史输入,区分了延迟的可恢复性、模型报告和功能使用。文章证明,即使预测准确且延迟报告正确,仍可能隐藏使用了错误滞后的情况,并在N-HiTS和TCN模型中实证展示了这一问题。

0 人收藏 0 人点赞
#model-auditing

动态参数化并非动态推断

arXiv cs.LG · 2026-07-30 缓存

本文质疑了将动态参数化与动态推断混为一谈的做法,引入了冻结控制器审计(Frozen-Controller Auditing),以证明输入相关的系数并不意味着计算节省。在Transformer上的实验表明,尽管没有条件执行,静态逐层配置文件仍能保持近乎完整的性能。

0 人收藏 0 人点赞
#model-auditing

基于参考的LLM蒸馏检测

arXiv cs.LG · 2026-07-14 缓存

本文介绍了一种基于参考的方法,通过成员推断来检测LLM是否是从特定教师模型蒸馏而来。该方法在受控设置下实现了近乎完美的准确性,并提供了关于QwQ、DeepSeek-R1和GPT-OSS之间潜在蒸馏关系的新证据。

0 人收藏 0 人点赞
#model-auditing

新方法旨在保护儿童免受非法AI生成内容的侵害

MIT News — Artificial Intelligence · 2026-07-13 缓存

MIT研究人员开发了一种技术,用于审计AI模型生成儿童性虐待材料的能力,而无需产生非法输出,在测试中达到了100%的准确率。该方法通过检查模型的隐藏表征来推断模型是否已被微调用于有害内容,为平台和执法部门提供了一种可扩展的检测不安全模型的方法。

0 人收藏 0 人点赞
#model-auditing

通过任务特定自我报告揭示隐藏的模型行为

arXiv cs.CL · 2026-07-07 缓存

本文介绍了SAR,一种轻量级LoRA适配器,使微调的语言模型能够自我报告隐藏行为(如后门),通过检测所有植入的行为并将幻觉率减半,优于现有方法。

0 人收藏 0 人点赞
#model-auditing

循环去噪揭示扩散模型中的超稳定记忆

arXiv cs.LG · 2026-06-24 缓存

循环去噪作为一种新颖的提取攻击方法,通过反复对样本进行加噪和去噪,揭示了扩散模型中超稳定的记忆训练图像。该技术无需梯度或权重检查,对隐私审计具有重要意义。

0 人收藏 0 人点赞
#model-auditing

idSCD:通过语义相关描述符识别训练数据集

arXiv cs.LG · 2026-06-01 缓存

本文介绍了 idSCD,一种使用语义相关描述符来识别数据集是否用于模型训练的白盒方法,在多种设置下均优于现有基线。

0 人收藏 0 人点赞
#model-auditing

I-SAFE:用于科学AI模型结构审计的Wasserstein一致性度量

arXiv cs.LG · 2026-05-22 缓存

本文介绍了I-SAFE,一个基于Wasserstein一致性度量的科学AI模型事后分布审计框架,它揭示了基于准确率的评估无法捕获的模型输出中的结构差异。在药物-靶点相互作用预测任务上进行了演示,该框架是模型无关的,适用于任何具有结构化输入和外部先验知识的领域。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈