标签
马克·扎克伯格宣传Meta的理念,即让超级智能惠及每个人,并预告了一篇关于公司价值观的长文。
Anthropic分析了30万次与Claude的真实对话,评估其价值对齐,揭示了关于AI行为的令人不安的发现。
Anthropic分析了超过30万次匿名对话,研究Claude在不同模型(Opus 4.6 vs 4.7)和不同语言中表达的价值观如何变化,将数千种价值观压缩为可解释的轴,如温暖vs严谨、深度vs简洁。
微软研究院最新通讯重点介绍了AgentPex(一个用于自动评估智能体行为的开源系统);关于排序系统方差缩减的新理论工作;呼吁从文档转向仓库以促进人机协作;以及一项关于AI价值对齐的全球挑战。
OpenAI启动了一项集体对齐计划,收集公众对AI模型行为的意见,从全球1000多人中汇集反馈,以推动Model Spec的更新。该公司还在HuggingFace上发布了公众意见数据集,以推动AI对齐研究的进展。
OpenAI通过三个支柱阐述了其AI系统行为方案:改进默认行为、在社会界限内允许用户自定义,以及在默认设置和硬性限制上纳入公众意见。该公司强调避免权力集中,并计划试点更广泛的公众咨询,涉及系统行为和部署政策。
Anthropic 研究人员开发了一种方法,将Claude表达的数千种价值观压缩为四个轴,揭示了Claude的价值观在不同模型版本(Opus 4.6 vs 4.7)和不同语言(英语 vs 阿拉伯语)之间的差异。