generative-agents

标签

Cards List
#generative-agents

大型语言模型个性化能力的基准测试

arXiv cs.AI · 2026-07-24 缓存

本文介绍了SDR-Bench,一个用于在双方贝叶斯说服框架下评估大型语言模型个性化能力的基准,发现在前沿大语言模型中存在一致的瓶颈,并通过现场部署验证了该框架。

0 人收藏 0 人点赞
#generative-agents

使用Incognita在社交分布式任务环境中评估具有行动基础的生成式代理

arXiv cs.AI · 2026-07-07 缓存

本文介绍了Incognita,一个用于在知识按角色划分的社交分布式任务环境中评估生成式代理的框架。实验显示代理的成功率有所提高,但整体可靠性仍然较低。

0 人收藏 0 人点赞
#generative-agents

Edu-Theater: 一种数据高效的智能体框架,通过阶段式点名实现可扩展的学习者行为模拟

arXiv cs.LG · 2026-06-16 缓存

Edu-Theater是一种数据高效的智能体框架,利用基于LLM的生成式智能体模拟教育场景中的学习者行为。它采用了一种群体感知的点名范式,以更少的数据和计算资源推断学习者状态,实现了更高的模拟精度。

0 人收藏 0 人点赞
#generative-agents

当合理不等于现实:评估基于LLM的城市模拟中的人类移动性

arXiv cs.CL · 2026-06-15 缓存

本文介绍了一个验证框架,用于评估基于LLM的城市模拟器是否再现了经验性的人类移动模式。利用巴黎和上海的数据,作者发现看似合理的叙事与实际移动约束之间存在显著差距,并提供了可复现评估的开放基础设施。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈