标签
本文介绍了SDR-Bench,一个用于在双方贝叶斯说服框架下评估大型语言模型个性化能力的基准,发现在前沿大语言模型中存在一致的瓶颈,并通过现场部署验证了该框架。
本文介绍了Incognita,一个用于在知识按角色划分的社交分布式任务环境中评估生成式代理的框架。实验显示代理的成功率有所提高,但整体可靠性仍然较低。
Edu-Theater是一种数据高效的智能体框架,利用基于LLM的生成式智能体模拟教育场景中的学习者行为。它采用了一种群体感知的点名范式,以更少的数据和计算资源推断学习者状态,实现了更高的模拟精度。
本文介绍了一个验证框架,用于评估基于LLM的城市模拟器是否再现了经验性的人类移动模式。利用巴黎和上海的数据,作者发现看似合理的叙事与实际移动约束之间存在显著差距,并提供了可复现评估的开放基础设施。