UrbanDS:面向数据密集型城市任务的图引导LLM多智能体系统
摘要
本文介绍了UrbanDS——一个面向数据密集型城市任务的图引导LLM多智能体系统,以及用于评估此类系统的基准UrbanDS-Bench。实验表明,它优于现有的数据科学智能体,并已部署在真实的城市运营平台中。
查看缓存全文
缓存时间: 2026/07/31 04:01
# UrbanDS:面向数据密集型城市任务的图引导LLM多智能体系统 Zhilun Zhou(清华大学电子工程系,BNRist,北京,中国,[email protected]),Jianghao Yu(清华大学电子工程系,BNRist,北京,中国,[email protected]),Yuming Lin(清华大学城市规划系,北京,中国,[email protected]),Yongjun Yang(江门市智慧社会治理技术创新中心,江门,中国,[email protected]),Yongquan Sun(清华大学,北京,中国,[email protected]),Dep
相似文章
UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks
UrbanAgent is a tool-augmented agent framework that uses LLMs with code execution, API calls, and MCP to handle cross-system urban requests. The authors also introduce UrbanEval, a benchmark for evaluating task results and execution quality, achieving 71% success rate over baselines.
MultiUAV-Plat:面向大语言模型的多无人机协同任务规划平台、基准测试与框架
MultiUAV-Plat 是一个轻量级仿真平台和基准测试,用于评估大语言模型智能体在多无人机协同任务规划任务上的表现。本文还提出了 Agent4Drone,一个针对特定任务的大语言模型智能体框架,其性能显著优于基线方法。
CityBehavEx: 一个可扩展且经实证验证的LLM辅助城市仿真平台
CityBehavEx是一个可扩展的LLM辅助城市仿真平台,它结合了成熟的人类移动模型与微调后的交叉编码器,为城市规模的人口生成真实且经实证验证的移动模式。在单个消费级GPU上,不到一小时即可模拟100,000个智能体在75天内的行为。
UrbanGround:从局部感知到空间能动性在真实城市中的研究
UrbanGround评估了多模态语言模型代理是否能在逼真的3D城市复制品中保持可靠的导航和空间推理能力,发现局部感知技能无法组合成扩展的目标导向行为。
AgenticDataBench:面向数据代理的综合性基准测试
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。