标签
本研究探讨了被告陈述如何影响LLM模拟陪审员,重点关注说服、意识形态偏见和背景亲和性,并介绍了用于争议性刑事案件的JuryBench基准。
GPS-Bench 是一个基于证据的治理政策模拟基准,它利用立法记录和公共证据来建模参与者和结果,从而实现对基于LLM的政策分析方法的受控比较。
This paper presents INSIDE, a framework that fine-tunes LLMs to generate internal dialogue grounded in Bloom's Taxonomy, enabling student simulators to model both latent reasoning and observable actions. Evaluations show improved action fidelity and reasoning alignment compared to prompting baselines.
本文介绍了 CoevolveSim,这是一个用于研究网络化通用型与专家型 LLM 智能体间信念传播的框架,表明专家模型和网络结构会影响共识与影响力动态。
本文研究了诸如调解等正式机制,以在模拟市场中维持自利的大型语言模型代理(DeepSeek-V3)之间的市场稳定性,发现即使在持续对抗攻击下,调解也能使市场恢复。
一项新研究在28项真实世界研究中测试了LLM,发现它们仅在53%的情况下与人类多数一致,与随机猜测无异,挑战了用LLM取代人类反馈的趋势。
本文研究了Bluesky上的仇恨言论级联,并使用多LLM代理进行模拟,发现此类模拟再现了立场单一文化和毒性增量方向等关键模式,且在密集网络上进行放大器定位可使仇恨内容减少7.5%–12.9%,且良性副作用较低。
本文系统评估了关于LLM角色提示的假设,并识别出'角色流形坍缩'现象,即更丰富的角色描述会降低行为多样性和模拟逼真度。研究结果发现,简单的年龄-性别角色通常比更详细的档案表现更好。
来自Google DeepMind和卡内基梅隆大学的这篇论文指出,由于用户漂移(模拟人群随干预措施而变化),LLM模拟实验实际上属于观察性研究。作者提出使用阴性对照结果来诊断混杂,并表明引出与情境相关的混杂因素可以减少偏差。