ai-auditing

标签

Cards List
#ai-auditing

iFixAi

Product Hunt ↗ · 2026-09-16 缓存

iFixAi 是一个独立审计机构,通过全面审计覆盖AI失准问题,帮助企业评估其AI代理的可信度。

0 人收藏 0 人点赞
#ai-auditing

@Miles_Brundage: 在众多事项中,我们需要: - 在领先公司中真正实施审计,设定最低资格、独立性、访问权限等标准……

X AI KOLs Timeline ↗ · 2026-09-16 缓存

Miles_Brundage 主张为领先的AI公司实施强制性审计和可执行的安全标准,以提高监督和安全性。

0 人收藏 0 人点赞
#ai-auditing

@Miles_Brundage:AVERI就今日发展的声明:

X AI KOLs Timeline ↗ · 2026-09-12 缓存

AVERI赞扬Anthropic、OpenAI和SpaceX关于在AI公司中引入独立专家的声明,并承诺推进前沿AI审计的标准。

0 人收藏 0 人点赞
#ai-auditing

@paul_cal: "该结果对超参数、提示和试图改进它的Fable目标循环具有鲁棒性" 一项新的学术标准…

X AI KOLs Timeline ↗ · 2026-08-22 缓存

新研究表明,用于AI审计的基于激活的工具,例如 activation oracles 和 SAEs,并不比简单阅读转录本更优越,从而导致了一个稳健的学术标准。

0 人收藏 0 人点赞
#ai-auditing

使用多模态语言模型审计TikTok上的有害内容暴露:一项跨国、年龄分层研究

arXiv cs.CL ↗ · 2026-08-19 缓存

本研究使用多模态语言模型在多个国家和年龄组中审计TikTok的有害内容暴露,发现关键词搜索增加了有害内容,并且多模态语言模型为青少年安全审计提供了一个可扩展的工具。

0 人收藏 0 人点赞
#ai-auditing

DA-RAC:面向可信AI审计的LLM评判器距离感知校准方法

arXiv cs.CL ↗ · 2026-08-18 缓存

本文介绍了DA-RAC,一种用于LLM评判器的距离感知校准方法,通过使用相似的有标签锚点来减少误校准和误通过风险,以增强AI审计的可信度。

0 人收藏 0 人点赞
#ai-auditing

On the missing benchmarks layer and a potential solution

arXiv cs.AI ↗ · 2026-08-05 缓存

This paper argues that Latin America lacks a benchmark layer for native AI development and proposes an open, task-first EvalsHub infrastructure, with LatamBoard as its first regional instance, to audit AI systems and direct optimization toward local needs.

0 人收藏 0 人点赞
#ai-auditing

@Miles_Brundage: 我离开OpenAI后决定全力投入前沿AI审计的原因之一是,如果AI公司需要…

X AI KOLs Following ↗ · 2026-07-28 缓存

Miles Brundage讨论了他在离开OpenAI后转而专注于前沿AI审计的决定,强调独立审计员可以安抚AI公司,让他们相信同行也在采取成本高昂的安全措施。AVERI支持这一观点,倡导在独立监督下进行有节奏的发展。

0 人收藏 0 人点赞
#ai-auditing

人机协作中的非均匀性原则

arXiv cs.AI ↗ · 2026-07-21 缓存

本文介绍了在长AI工作流中最佳的人类监督位置安排的非均匀性原则,证明监督阶段应按非递减间隔安排。该原则在文献综述和网站构建任务中得到了实证验证。

0 人收藏 0 人点赞
#ai-auditing

@Miles_Brundage: 美国首个前沿AI审计要求!

X AI KOLs Timeline ↗ · 2026-07-06 缓存

伊利诺伊州颁布了美国最严格的人工智能安全与问责法案,确立了全国首个前沿AI审计要求。

0 人收藏 0 人点赞
#ai-auditing

面向心理健康交互的大语言模型中框架敏感行为不稳定性审计

arXiv cs.CL ↗ · 2026-06-26 缓存

本文研究了上下文框架如何影响大语言模型在心理健康交互中的响应,发现了系统性的行为变异,并证明了内部表示在Transformer各层中编码了框架信息。

0 人收藏 0 人点赞
#ai-auditing

决策与执行之间的鸿沟

Reddit r/artificial ↗ · 2026-06-11

反思基于LLM的自动化支持在出现错误时如何导致信任问题,强调验证和可审计性比单纯提高准确性更重要。

0 人收藏 0 人点赞
#ai-auditing

具有随时有效保证的 AI 系统自适应审计

arXiv cs.AI ↗ · 2026-05-11 缓存

本文引入了一种统计框架,利用安全随时有效推断(SAVI)技术对 AI 系统进行自适应审计,旨在基于有限数据得出严谨的结论。文章提出了一种“通过赌博进行测试”的方法,以验证模型的鲁棒性,同时在自适应采样过程中控制第一类错误。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈