标签
本文介绍了ToolSciVer,这是首个面向多模态科学声明验证(MSCV)的工具增强框架。该框架为视觉语言模型(VLM)配备了类型感知的视觉工具,并使用GRPO训练策略,在SciVer和MuSciClaims数据集上,跨多个模型家族实现了卓越性能。
本文提出 UrbanAgent,一个将城市区域画像重新定义为基于推理的推断问题的智能体框架,利用多智能体协作推理和工具增强的证据检索。在全球城市数据集上的碳排放、GDP和人口估算任务中,该框架优于基线方法,R²平均提升8.1%。
本文提出了一种LLM推理策略的分类法,沿着两个正交轴:快速与慢速思考、内部与外部知识,并综述了近期自适应推理方法。
本文介绍了一项实证研究和基准测试,用于评估工具增强型LLM代理在实际能源分析任务上的表现,包含243个由专家策划的问题,涵盖市场数据检索、知识解读和定量建模。
本调查将基于LLM的优化分为三个范式——直接优化、工具增强优化和工具创建优化——并回顾了它们的性能前沿和局限性。
本文提出风险感知因果门控(RACG),这是一种无需训练的机制,将最小权限原则应用于LLM代理的工具暴露,仅在授权和因果必要时暴露高风险工具,从而减少提示注入的攻击面。
本文介绍了Contract2Tool,一个从工具元数据、文档和执行轨迹中自动推断轻量级工具契约(前提条件、效果、风险)的框架,为LLM代理实现可靠的因果工具过滤。实验表明,学习到的契约在下游多步骤代理任务中达到了接近黄金契约的性能,同时显著减少了token使用量。
ToolGate 是一个轻量级的外部控制器,能够预测在视觉语言代理中是否执行或跳过感知工具调用,从而将令牌成本降至基线的64%-69%,同时保持跨域设置下的准确性。
介绍了TADDLE,一种用于检测有缺陷的LLM生成同行评审的工具增强代理,以及一个包含50篇ICLR 2025论文的1800条评审的专家标注基准。该系统将检测分解为四个专门的分析工具,并使用两阶段半监督学习进行二元和多标签分类。
本文介绍了COSMO-Agent,一个工具增强的强化学习框架,用于训练LLM执行闭环CAD-CAE优化,迭代生成参数化几何体并运行仿真直到满足约束条件,并包含一个多约束奖励和新的行业对齐数据集。
介绍 AutoTool,一种自适应决定是否调用工具进行多模态大语言模型推理的模型,通过强化学习和双模式推理实现了显著的准确率和效率提升。
本文提出了一种轻量级的、基于信号的框架,通过计算低成本指标来高效分流智能体交互轨迹,这些指标能识别出信息丰富的样本,且不影响在线智能体行为,在基准测试上实现了82%的信息率。