ai-auditing

标签

Cards List
#ai-auditing

On the missing benchmarks layer and a potential solution

arXiv cs.AI · 2026-08-05 缓存

This paper argues that Latin America lacks a benchmark layer for native AI development and proposes an open, task-first EvalsHub infrastructure, with LatamBoard as its first regional instance, to audit AI systems and direct optimization toward local needs.

0 人收藏 0 人点赞
#ai-auditing

@Miles_Brundage: 我离开OpenAI后决定全力投入前沿AI审计的原因之一是,如果AI公司需要…

X AI KOLs Following · 2026-07-28 缓存

Miles Brundage讨论了他在离开OpenAI后转而专注于前沿AI审计的决定,强调独立审计员可以安抚AI公司,让他们相信同行也在采取成本高昂的安全措施。AVERI支持这一观点,倡导在独立监督下进行有节奏的发展。

0 人收藏 0 人点赞
#ai-auditing

人机协作中的非均匀性原则

arXiv cs.AI · 2026-07-21 缓存

本文介绍了在长AI工作流中最佳的人类监督位置安排的非均匀性原则,证明监督阶段应按非递减间隔安排。该原则在文献综述和网站构建任务中得到了实证验证。

0 人收藏 0 人点赞
#ai-auditing

@Miles_Brundage: 美国首个前沿AI审计要求!

X AI KOLs Timeline · 2026-07-06 缓存

伊利诺伊州颁布了美国最严格的人工智能安全与问责法案,确立了全国首个前沿AI审计要求。

0 人收藏 0 人点赞
#ai-auditing

面向心理健康交互的大语言模型中框架敏感行为不稳定性审计

arXiv cs.CL · 2026-06-26 缓存

本文研究了上下文框架如何影响大语言模型在心理健康交互中的响应,发现了系统性的行为变异,并证明了内部表示在Transformer各层中编码了框架信息。

0 人收藏 0 人点赞
#ai-auditing

决策与执行之间的鸿沟

Reddit r/artificial · 2026-06-11

反思基于LLM的自动化支持在出现错误时如何导致信任问题,强调验证和可审计性比单纯提高准确性更重要。

0 人收藏 0 人点赞
#ai-auditing

具有随时有效保证的 AI 系统自适应审计

arXiv cs.AI · 2026-05-11 缓存

本文引入了一种统计框架,利用安全随时有效推断(SAVI)技术对 AI 系统进行自适应审计,旨在基于有限数据得出严谨的结论。文章提出了一种“通过赌博进行测试”的方法,以验证模型的鲁棒性,同时在自适应采样过程中控制第一类错误。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈