标签
本文介绍Fuse,一个多智能体模拟框架,用于评估LLM助手的社会推理能力。它通过用户介导的交互提供可验证的真实依据,并通过人类研究进行了验证,应用于12个LLM。
本文介绍了人类效用因子(HUF),一种可计算的福利指标,它将人工智能治理重构为一个约束优化问题,并为自动化深度、再分配和就业覆盖率提供了可衡量的杠杆,并通过多智能体模拟进行了验证。
本文介绍了 ComRate,一个来自 X 平台的大规模社区注释和评分数据集,并提出了 MultiCom,一种基于角色引导的多智能体框架,用于模拟社区注释评估。该方法在预测注释有用性方面达到了 84.7% 的准确率。
本文介绍了使用多智能体模拟语言中形态交替模式(如'go/went')的出现,并利用AI历史语言学家(基于大语言模型)评估演化形态相对于真实语言的合理性。
介绍SovSim,一个多智能体模拟框架,用于研究具有不对称权力结构的LLM社会中的合作与资源可持续性。实验表明,引入主导智能体(老板或国王)会严重削弱合作和生存率,这一结果在11个最先进模型中普遍存在。
本文利用格陵兰主权危机作为案例,通过多智能体模拟测试大语言模型的地缘政治行为,揭示了胁迫框架会加剧升级,而和平获取极为罕见。