标签
UserToolBench 是一个新的基准,用于评估工具使用大语言模型中的个性化决策,测试模型是否能在信息不完整的情况下推断潜在用户偏好、决定何时澄清,并生成与用户一致的工具调用轨迹。实验表明,当前模型在多工具协调和长期一致性方面存在困难。