conformity

标签

Cards List
#conformity

大型语言模型中的从众缓解措施位于同一条抵抗-接受前沿上

arXiv cs.AI · 3天前 缓存

一项研究衡量了大型语言模型在多智能体环境中如何遵从一致的同伴意见,发现现有缓解措施在抵抗性与接受性之间存在权衡,而推理是唯一能在MMLU上同时提升两者的干预措施。

0 人收藏 0 人点赞
#conformity

社会压力破坏LLM安全评审小组的多数投票

arXiv cs.CL · 2026-08-06 缓存

这篇arXiv论文研究了来自模拟同行的共享社会线索如何破坏LLM安全评审小组中的多数投票保护。它表明,当所有评审者收到相同的错误“不安全”标签时,小组的误报率跃升至100%,揭示了一种失败模式,并提供了一种部署前的诊断方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈