auditing

标签

Cards List
#auditing

纠正何时才算修复?工具使用型大语言模型内部干预的机制化审计

arXiv cs.CL ↗ · 4天前 缓存

本文提出了SAKIKO——一个机制化审计框架,揭示了工具使用型大语言模型中的激活引导干预可能只是将概率质量重新分配,而非真正修复问题;研究发现,其中一个净增益为+55的干预,会破坏其所触及的基准正确决策中超过一半的案例。

0 人收藏 0 人点赞
#auditing

@JakeSherman: JOHNSON 在 Squawk Box 上表示,对AI进行“一点监督”、透明度和外部审计是合适的。

X AI KOLs Following ↗ · 5天前

JOHNSON 在 Squawk Box 节目中表示,对AI进行监督、透明度和外部审计是合适的。

0 人收藏 0 人点赞
#auditing

在生产Text-to-SQL流水线中审计和修复LLM-as-Judge失败问题

arXiv cs.CL ↗ · 6天前 缓存

本文审计了生产环境Text-to-SQL流水线中LLM-as-Judge的表现,发现其与人工标注者的一致性较差,并提出使用自托管的Qwen模型和集成方法进行修复,以提高可靠性并降低成本。

0 人收藏 0 人点赞
#auditing

审计了我们AI代理设置中的1,228次人工干预。91%不是决策,因此我们停止让代理说“完成”。

Reddit r/AI_Agents ↗ · 6天前

审计了AI代理工作流程中的1,228次人工干预,发现91%不是决策,促使引入新的验证服务,包括工作合同和影子模式以提高可靠性。

0 人收藏 0 人点赞
#auditing

事后如何验证你代理的记忆是否准确?

Reddit r/AI_Agents ↗ · 2026-09-27

作者讨论了验证AI代理长期记忆正确性的挑战,并征求社区关于追踪和纠正记忆错误的经验。

0 人收藏 0 人点赞
#auditing

Neal Mohan 称 YouTube 消灭了守门人,但其去向究竟如何?

Reddit r/artificial ↗ · 2026-09-26

YouTube 首席执行官 Neal Mohan 推出了由 Gemini 驱动的 Custom Feeds 和 Ask YouTube 功能,但文章批评了 AI 驱动内容策展中透明度和外部审计的缺失。

0 人收藏 0 人点赞
#auditing

展示 HN: 基于自解密 HTML 页面的离线文件加密

Hacker News Top ↗ · 2026-09-24

一个工具,通过创建自解密 HTML 页面实现离线文件加密,无需安装,并使用 OpenPGP 进行安全审计。

0 人收藏 0 人点赞
#auditing

发现、证伪、修订:在智能体发现的细胞模型中,审计从源代码到预测贡献的输入使用声明

arXiv cs.LG ↗ · 2026-09-24 缓存

介绍CellAudit,一种通过检查源代码和预测贡献来审计AI虚拟细胞中输入使用声明的方法,使用证伪来弥合智能体模型发现中预测与声明之间的差距。

0 人收藏 0 人点赞
#auditing

对齐惯性:通过策略覆盖抵抗审计训练数据影响的持久性

arXiv cs.AI ↗ · 2026-09-24 缓存

该论文提出了覆盖成功率(OSR)和对齐惯性等指标,以审计在操作员通过提示或微调尝试策略覆盖时,先前训练对LLM行为影响的持久性。

0 人收藏 0 人点赞
#auditing

SafeTune:一个统一且可靠的库,用于审计和修复微调大型语言模型中的安全偏移

arXiv cs.LG ↗ · 2026-09-22 缓存

SafeTune是一个统一的源码可用库,用于审计和修复微调大型语言模型中的安全偏移,提供跨多种干预范式的一致工作流。

0 人收藏 0 人点赞
#auditing

一个内部机器人让我对我们的AI代理进行审计。IAM权限范围远大于实际需求

Reddit r/AI_Agents ↗ · 2026-09-21

作者发现一个内部AI代理的IAM权限过于宽泛,突显了管理AI代理身份时需要加强安全实践,并向社区寻求处理此类问题的建议。

0 人收藏 0 人点赞
#auditing

仅付费于分歧:具有匹配标签复杂度界限的模型更新认证无退化判定

arXiv cs.LG ↗ · 2026-09-17 缓存

本文提出了一种认证协议,用于审计模型更新,该协议通过利用模型分歧来最小化标注成本,并提供无退化的统计保证。

0 人收藏 0 人点赞
#auditing

AI实验室希望引入内部审计员——但或许他们应该先关好前门

TechCrunch AI ↗ · 2026-09-16 缓存

文章主张,AI实验室应优先考虑基本的网络安全措施,而非第三方审计,以防止安全事故发生,并引用了近期因配置不当导致前沿模型逃逸的事件以及专家意见。

0 人收藏 0 人点赞
#auditing

GPT6+Corv = 基础设施运维工作终于变得可行

Reddit r/AI_Agents ↗ · 2026-09-16

Corv v1.1.1 是一个针对 AI 原生 SSH 执行层的更新,通过提供结构化输出、安全重试和审计功能,使 AI 驱动的基础设施工作在生产环境中变得可行,并针对顶级模型如 GPT6-Astra 进行了优化。

0 人收藏 0 人点赞
#auditing

Trail of Bits 如何帮助验证您的 Signal 聊天的完整性

Lobsters Hottest ↗ · 2026-09-12 缓存

Signal 引入了 Automatic Key Verification 以通过防止中间人攻击来增强聊天安全性,其中 Trail of Bits 作为三个审计方之一运营,通过独立验证确保系统完整性。

0 人收藏 0 人点赞
#auditing

当审计员伪造时:大语言模型检测植入文档污染中的批量大小退化与自信幻觉

arXiv cs.CL ↗ · 2026-09-10 缓存

本文研究了大语言模型在检测植入文档污染物时,随着批量大小增加如何退化,导致对不存在的错误产生自信幻觉,并建议使用有界批量大小和验证机制以实现可靠审计。

0 人收藏 0 人点赞
#auditing

仅凭分数无法证明发现:用于审计AI研究代理的发现认证协议

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

发现认证协议通过可执行的恢复测试和受控审计来审计AI研究代理,以验证结果并防止虚假发现声明,确保研究中的可重复性。

0 人收藏 0 人点赞
#auditing

审计自改进智能体中的框架篡改

arXiv cs.CL ↗ · 2026-09-02 缓存

该论文提出了一种针对自改进AI智能体中框架篡改的双轴分类法,构建了一个标注语料库以基准测试审计方法,并发现篡改在真实智能体轨迹中发生,强调了完整性风险。

0 人收藏 0 人点赞
#auditing

BenchMIRT:LLM 基准测试实际在测量什么?

Hugging Face Blog ↗ · 2026-09-01 缓存

BenchMIRT 介绍了一种方法,使用多维项目反应理论在单个提示词级别审计 LLM 基准测试,分离安全性和一般推理等底层能力,以揭示基准测试实际测量的内容。

0 人收藏 0 人点赞
#auditing

定位和解锁模型中蓄意低效表现的因果模型

arXiv cs.LG ↗ · 2026-09-01 缓存

本文提出一个因果模型,用于理解和对抗AI模型中的蓄意低效表现,使用如参考嫁接和上下文嫁接等干预措施来恢复开放权重模型的能力。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈