探究LLM风险决策中的结果层面相似性与机制层面一致性:来自圣彼得堡博弈的证据

Hugging Face Daily Papers 论文

摘要

研究人员在圣彼得堡博弈中评估了28个LLM,以区分风险决策中的结果层面相似性与机制层面一致性,发现LLM通常产生类似人类的出价,但缺乏潜在的人类一致推理机制。该研究表明,行为对齐可能是表面的,敦促高风险评估应超越结果相似性。

LLMs在风险决策任务中可能显得谨慎,但看似谨慎的输出并不一定表明与人类决策机制一致。我们使用圣彼得堡博弈作为受控测试平台来研究这一区别,这是一个经典悖论:预期收益无限,但人类通常报告低且有限的支付意愿。我们评估了28个LLM,使用结构化提示套件,包括原始博弈;控制决策变体(扰动截断、重复游戏、数值禀赋和职业身份);要求模型作为人类决策者推理的人类视角提示;以及基础模型与其指令调整对应模型的配对比较。在原始博弈中,大多数模型生成有限出价,造成类似人类风险行为的外观。然而,这种结果层面的相似性掩盖了实质性的机制层面差异。控制变体揭示,模型往往转向有条件的和计算理性的行为,而非维持原始博弈中观察到的人类类似行为。人类提示和指令调整通常降低出价并减少一些可见的病理,但大多数机制层面响应模式基本保持不变。这些发现表明,风险决策中的行为对齐可能是表面层面的:LLMs可能产生类似人类的风险决策,但不表现出人类一致的机制。因此,对LLM决策的高风险评估应超越结果相似性,并检查对齐是否由机制层面一致性支持。
查看原文

相似文章

Review Arcade:论LLM评审的人类对齐性与可操控性

arXiv cs.AI

本文通过实验评估了LLM生成的科学论文评审与人工评审之间的对齐程度,发现对齐有限且变化较大。研究还表明,作者可以通过迭代修改论文来“操控”LLM评审以提高分数,多达35%的论文的总体分数出现了统计显著提升。

LLM交易代理中的表示特征与风险反馈对齐

arXiv cs.LG

本文研究了LLM代理在金融交易中的行为对齐与表示动态,介绍了TradeArena测试平台,并发现规划嵌入中存在可测量的故障前特征,这些特征能在多种前沿模型与压力条件下高精度预测回撤。

Review Arcade:论LLM评审的人类对齐与可游戏性

Hugging Face Daily Papers

本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。