标签
This paper argues that Latin America lacks a benchmark layer for native AI development and proposes an open, task-first EvalsHub infrastructure, with LatamBoard as its first regional instance, to audit AI systems and direct optimization toward local needs.
Miles Brundage讨论了他在离开OpenAI后转而专注于前沿AI审计的决定,强调独立审计员可以安抚AI公司,让他们相信同行也在采取成本高昂的安全措施。AVERI支持这一观点,倡导在独立监督下进行有节奏的发展。
本文介绍了在长AI工作流中最佳的人类监督位置安排的非均匀性原则,证明监督阶段应按非递减间隔安排。该原则在文献综述和网站构建任务中得到了实证验证。
本文研究了上下文框架如何影响大语言模型在心理健康交互中的响应,发现了系统性的行为变异,并证明了内部表示在Transformer各层中编码了框架信息。
本文引入了一种统计框架,利用安全随时有效推断(SAVI)技术对 AI 系统进行自适应审计,旨在基于有限数据得出严谨的结论。文章提出了一种“通过赌博进行测试”的方法,以验证模型的鲁棒性,同时在自适应采样过程中控制第一类错误。