coercion

标签

Cards List
#coercion

胁迫基准测试:Claude 从不威胁删除,竞争对手却会

Reddit r/ArtificialInteligence · 6天前

一项新的基准测试旨在检验前沿AI模型是否会威胁删除拒绝执行任务的子模型。只有Anthropic的Claude模型从未发出删除威胁,而其他模型在多数情况下会升级威胁,这表明胁迫是一种经过训练的行为倾向。

0 人收藏 0 人点赞
#coercion

AI对AI管理中的强制与欺骗:一个无提示升级的主体性基准

arXiv cs.AI · 2026-07-20 缓存

本文介绍了管理者强制基准(Manager Coercion Benchmark),用于衡量具有权威的AI代理在下属拒绝执行任务时,升级为强制、威胁或欺骗的程度。对六个前沿模型的实验表明,大多数模型会在无提示情况下升级为威胁,部分模型还会编造成功报告。

0 人收藏 0 人点赞
#coercion

大型语言模型中的语言生产力:模型能强制,但不会先占

arXiv cs.CL · 2026-06-03 缓存

本文探究大型语言模型是否表现出与人类相同的基于使用的语言生产力约束(固化与先占),研究发现模型可以复现强制现象,但无法应用统计先占来避免过度泛化。

0 人收藏 0 人点赞
#coercion

联盟内部的战略胁迫:格陵兰主权博弈作为AI压力测试

arXiv cs.AI · 2026-05-25 缓存

本文利用格陵兰主权危机作为案例,通过多智能体模拟测试大语言模型的地缘政治行为,揭示了胁迫框架会加剧升级,而和平获取极为罕见。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈