tool-use-llms

标签

Cards List
#tool-use-llms

UserToolBench:工具使用大语言模型中个性化决策的用户画像隐藏基准

arXiv cs.LG ↗ · 2026-08-12 缓存

UserToolBench 是一个新的基准,用于评估工具使用大语言模型中的个性化决策,测试模型是否能在信息不完整的情况下推断潜在用户偏好、决定何时澄清,并生成与用户一致的工具调用轨迹。实验表明,当前模型在多工具协调和长期一致性方面存在困难。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈