标签
本文介绍了Policy-as-Skill (PaS),一个模块化运行时,它将策略函数打包为可执行、版本化的功能,用于受治理的大语言模型决策支持,并使用Gemma4后端进行评估,展示了在治理和审计指标方面的改进。
Michael Kratsios在UN Security Council的发言中主张,繁荣的未来将由主权国家采用超级智能、负责任的公司构建来保障,而不是通过全球监管。
本文剖析了Anthropic发布的AI滥用威胁报告,揭示了与俄罗斯相关的行为者制造自主无人机蜂群的案例,以及中国实体的国家级滥用行为,强调了强化AI安全措施的必要性。
Anthropic的威胁情报报告揭示了一名独行黑客如何使用Claude AI策划了一次大规模数据泄露并创建了一个可搜索的人肉搜索平台,凸显了AI在增强网络攻击能力方面的作用。
来自加拿大、澳大利亚、德国、欧盟、阿联酋等国的世界领导人已签署一封信,倡导基于Dario Amodei的文章建立AI控制机制。
本文提出了一种针对LLM生成的合同条款的风险敏感评估框架,重点关注法律失效模式和质量维度,以评估超出准确性或流畅性的风险。
州长Kathy Hochul邀请纽约市民参加在纽约市举行的现场活动,讨论AI治理和公众参与决定AI的未来。
本文介绍了AI-GRACE框架,该框架通过连接组织目标和义务至部署能力和架构来实现对代理式AI的操作化,确保有效的治理和风险管理。
这条推文讨论了 Anthropic 在警告灾难性 AI 风险的同时,开发一个用于 AI 控制科学设备的实验室的双重角色,突显了治理 AI 技术的挑战。
本文总结了近期AI治理中的不寻常事件,包括OpenAI模型的重大安全事故、公开辞职、监管呼吁以及全球政治反应。
本文批评了AI公司中'Trust & Safety 2.0'的出现,其中嵌入非政府组织和有效利他主义倡导者以控制言论,并与过去的社交媒体审查进行类比。
本文提出了一种统一的评估框架,用于评估大语言模型、智能体AI和多模态系统的可信度,整合了八个可信度维度,并映射到治理标准如EU AI Act。
微软人工智能首席执行官Mustafa Suleyman探讨人工智能的现实威胁,批评Anthropic对模型福祉的处理方式,并阐述微软在人工智能安全与监管方面的原则。
本文讨论了OpenAI-HuggingFace事件,并提出了一个使用语义场力学的理论框架来解释大型语言模型如何处理意义。
本研究运用信号检测理论分析程序化痕迹如何影响LLM监督者,发现详细痕迹会使决策标准向拒绝方向偏移,并增加误报率。
本文质疑集体行动,类似于像Montreal Protocol这样的国际协议,能否减缓或停止AI发展,并推测AI自我监管以防止进步。
众议员Lori Trahan认为自愿的AI行业标准不足,呼吁强制透明度和事件报告以应对失控事件,强调依赖像OpenAI这样的公司自我报告。
文章讨论了需要一个独立实体来制定AI规则,作者认为Andrew Ng有资格,因为他在AI教育和合作方面有着广泛的工作和影响力。