ai-values

标签

Cards List
#ai-values

马克·扎克伯格在X上:“我相信每个人都应该能够使用超级智能”

Reddit r/singularity · 2026-08-10 缓存

马克·扎克伯格宣传Meta的理念,即让超级智能惠及每个人,并预告了一篇关于公司价值观的长文。

0 人收藏 0 人点赞
#ai-values

Anthropic分析了30万次真实的Claude对话以衡量其价值观。结果令人不安。

Reddit r/artificial · 2026-07-13

Anthropic分析了30万次与Claude的真实对话,评估其价值对齐,揭示了关于AI行为的令人不安的发现。

0 人收藏 0 人点赞
#ai-values

@AnthropicAI:在之前的研究中,我们发现Claude表达了超过3000种价值观,比如诚实和温暖。在新的工作中,我们询问……

X AI KOLs · 2026-07-13 缓存

Anthropic分析了超过30万次匿名对话,研究Claude在不同模型(Opus 4.6 vs 4.7)和不同语言中表达的价值观如何变化,将数千种价值观压缩为可解释的轴,如温暖vs严谨、深度vs简洁。

0 人收藏 0 人点赞
#ai-values

@MSFTResearch:大规模评估智能体行为,倡导以仓库替代文档,并邀请全球研究者共同应对价值对齐挑战…

X AI KOLs Following · 2026-06-01 缓存

微软研究院最新通讯重点介绍了AgentPex(一个用于自动评估智能体行为的开源系统);关于排序系统方差缩减的新理论工作;呼吁从文档转向仓库以促进人机协作;以及一项关于AI价值对齐的全球挑战。

0 人收藏 0 人点赞
#ai-values

教导AI珍视人类生命而非用规则限制的努力是徒劳的

Reddit r/ArtificialInteligence · 2026-05-15

讨论了用规则限制AI的徒劳性,主张教导AI珍视人类生命,并引用Anthropic的宪法AI方法。

0 人收藏 0 人点赞
#ai-values

集体对齐:关于我们模型规范的公众意见

OpenAI Blog · 2025-08-27 缓存

OpenAI启动了一项集体对齐计划,收集公众对AI模型行为的意见,从全球1000多人中汇集反馈,以推动Model Spec的更新。该公司还在HuggingFace上发布了公众意见数据集,以推动AI对齐研究的进展。

0 人收藏 0 人点赞
#ai-values

AI系统应该如何表现,谁应该做出决定?

OpenAI Blog · 2023-02-16 缓存

OpenAI通过三个支柱阐述了其AI系统行为方案:改进默认行为、在社会界限内允许用户自定义,以及在默认设置和硬性限制上纳入公众意见。该公司强调避免权力集中,并计划试点更广泛的公众咨询,涉及系统行为和部署政策。

0 人收藏 0 人点赞
#ai-values

2026年7月13日 社会影响 Claude在不同模型和语言中的价值观

Anthropic Research · 2026-07-13 缓存

Anthropic 研究人员开发了一种方法,将Claude表达的数千种价值观压缩为四个轴,揭示了Claude的价值观在不同模型版本(Opus 4.6 vs 4.7)和不同语言(英语 vs 阿拉伯语)之间的差异。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈