llm-simulation

标签

Cards List
#llm-simulation

被告陈述何时重要?LLM模拟陪审员中的偏见与说服研究

arXiv cs.CL · 23小时前 缓存

本研究探讨了被告陈述如何影响LLM模拟陪审员,重点关注说服、意识形态偏见和背景亲和性,并介绍了用于争议性刑事案件的JuryBench基准。

0 人收藏 0 人点赞
#llm-simulation

GPS-Bench:用于自动化政策分析的治理政策基准

arXiv cs.AI · 6天前 缓存

GPS-Bench 是一个基于证据的治理政策模拟基准,它利用立法记录和公共证据来建模参与者和结果,从而实现对基于LLM的政策分析方法的受控比较。

0 人收藏 0 人点赞
#llm-simulation

INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators

arXiv cs.AI · 2026-08-12 缓存

This paper presents INSIDE, a framework that fine-tunes LLMs to generate internal dialogue grounded in Bloom's Taxonomy, enabling student simulators to model both latent reasoning and observable actions. Evaluations show improved action fidelity and reasoning alignment compared to prompting baselines.

0 人收藏 0 人点赞
#llm-simulation

通用型与专家型大型语言模型社交网络中的信念协同演化

arXiv cs.CL · 2026-07-31 缓存

本文介绍了 CoevolveSim,这是一个用于研究网络化通用型与专家型 LLM 智能体间信念传播的框架,表明专家模型和网络结构会影响共识与影响力动态。

0 人收藏 0 人点赞
#llm-simulation

自利代理社会中市场稳定性的正式机制:一项市场模拟研究

arXiv cs.AI · 2026-07-10 缓存

本文研究了诸如调解等正式机制,以在模拟市场中维持自利的大型语言模型代理(DeepSeek-V3)之间的市场稳定性,发现即使在持续对抗攻击下,调解也能使市场恢复。

0 人收藏 0 人点赞
#llm-simulation

新研究测试多款LLM与数千真实用户,发现AI无法模拟人类偏好

Reddit r/ArtificialInteligence · 2026-07-07

一项新研究在28项真实世界研究中测试了LLM,发现它们仅在53%的情况下与人类多数一致,与随机猜测无异,挑战了用LLM取代人类反馈的趋势。

0 人收藏 0 人点赞
#llm-simulation

使用多LLM代理模拟仇恨言论级联:经验基础、建模保真度与干预策略

arXiv cs.AI · 2026-06-18 缓存

本文研究了Bluesky上的仇恨言论级联,并使用多LLM代理进行模拟,发现此类模拟再现了立场单一文化和毒性增量方向等关键模式,且在密集网络上进行放大器定位可使仇恨内容减少7.5%–12.9%,且良性副作用较低。

0 人收藏 0 人点赞
#llm-simulation

大型语言模型捕捉人类性格的效果如何?

arXiv cs.AI · 2026-06-18 缓存

本文系统评估了关于LLM角色提示的假设,并识别出'角色流形坍缩'现象,即更丰富的角色描述会降低行为多样性和模拟逼真度。研究结果发现,简单的年龄-性别角色通常比更详细的档案表现更好。

0 人收藏 0 人点赞
#llm-simulation

干预的幻象:你的LLM模拟实验其实是一项观察性研究

arXiv cs.CL · 2026-05-21 缓存

来自Google DeepMind和卡内基梅隆大学的这篇论文指出,由于用户漂移(模拟人群随干预措施而变化),LLM模拟实验实际上属于观察性研究。作者提出使用阴性对照结果来诊断混杂,并表明引出与情境相关的混杂因素可以减少偏差。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈