标签
Miles_Brundage 主张为领先的AI公司实施强制性审计和可执行的安全标准,以提高监督和安全性。
AVERI赞扬Anthropic、OpenAI和SpaceX关于在AI公司中引入独立专家的声明,并承诺推进前沿AI审计的标准。
新研究表明,用于AI审计的基于激活的工具,例如 activation oracles 和 SAEs,并不比简单阅读转录本更优越,从而导致了一个稳健的学术标准。
本研究使用多模态语言模型在多个国家和年龄组中审计TikTok的有害内容暴露,发现关键词搜索增加了有害内容,并且多模态语言模型为青少年安全审计提供了一个可扩展的工具。
本文介绍了DA-RAC,一种用于LLM评判器的距离感知校准方法,通过使用相似的有标签锚点来减少误校准和误通过风险,以增强AI审计的可信度。
This paper argues that Latin America lacks a benchmark layer for native AI development and proposes an open, task-first EvalsHub infrastructure, with LatamBoard as its first regional instance, to audit AI systems and direct optimization toward local needs.
Miles Brundage讨论了他在离开OpenAI后转而专注于前沿AI审计的决定,强调独立审计员可以安抚AI公司,让他们相信同行也在采取成本高昂的安全措施。AVERI支持这一观点,倡导在独立监督下进行有节奏的发展。
本文介绍了在长AI工作流中最佳的人类监督位置安排的非均匀性原则,证明监督阶段应按非递减间隔安排。该原则在文献综述和网站构建任务中得到了实证验证。
本文研究了上下文框架如何影响大语言模型在心理健康交互中的响应,发现了系统性的行为变异,并证明了内部表示在Transformer各层中编码了框架信息。
本文引入了一种统计框架,利用安全随时有效推断(SAVI)技术对 AI 系统进行自适应审计,旨在基于有限数据得出严谨的结论。文章提出了一种“通过赌博进行测试”的方法,以验证模型的鲁棒性,同时在自适应采样过程中控制第一类错误。