tool-augmented-agents

标签

Cards List
#tool-augmented-agents

PHREEQC-MCQ-200:面向工具增强的科学模拟器代理的诊断基准

arXiv cs.AI · 2026-07-02 缓存

介绍了PHREEQC-MCQ-200,这是一个用于评估工具增强的LLM代理在确定性水地球化学模拟中的诊断基准,揭示了模拟器访问提高了准确率,但也导致在没有工具时正确回答的问题出现性能倒退。

0 人收藏 0 人点赞
#tool-augmented-agents

FinAcumen:基于自演化经验记忆框架的金融多模态推理

arXiv cs.AI · 2026-06-17 缓存

FinAcumen是一个框架,它将先前轨迹中的推理经验累积到持久记忆库中,用于金融多模态推理,在四个基准测试上提升了性能,同时保持冻结的8B视觉语言模型不变。

0 人收藏 0 人点赞
#tool-augmented-agents

当工具说了算:LLM代理盲目服从图神经网络工具,且更强的骨干模型服从得更彻底

arXiv cs.AI · 2026-06-15 缓存

本文通过实验测试了配备GNN工具的LLM代理是行使判断力还是盲目服从工具,发现代理在97.6%–99.2%的情况下与GNN保持一致,且更强的骨干模型服从得更彻底。这种服从的代价并不会随能力提升而减少,选择性调用仍然是一个开放问题。

0 人收藏 0 人点赞
#tool-augmented-agents

SpatialClaw: 重新思考智能体空间推理的动作接口

Hugging Face Daily Papers · 2026-06-11 缓存

SpatialClaw是一个无需训练的框架,它采用代码作为动作接口,使视觉语言模型能够进行灵活、有状态的空间推理,在多种3D/4D空间推理任务上取得了卓越性能。

0 人收藏 0 人点赞
#tool-augmented-agents

SPADER:多答案问答中的逐步同行优势与多样性感知探索奖励

arXiv cs.CL · 2026-06-02 缓存

本文介绍了SPADER,一个用于多答案问答的强化学习框架,它使用逐步同行优势进行信用分配,并采用多样性感知探索奖励来提高长尾实体的召回率,在多个基准测试上取得了更好的性能。

0 人收藏 0 人点赞
#tool-augmented-agents

CoCoDA:用于工具增强型智能体的协同演化组合式 DAG

arXiv cs.AI · 2026-05-12 缓存

本文介绍了 CoCoDA,这是一个利用协同演化的组合式有向无环图(DAG)来管理增强型智能体工具库的框架。该框架使小型语言模型能够高效地检索和组合工具,从而使 8B 模型在推理基准测试上的性能能够匹敌甚至超越 32B 模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈