标签
ToolSearcher 是一个强化学习框架,旨在通过类别约束判别和事件级搜索建模等技术,优化大型语言模型在庞大工具库中的工具选择,从而提升其在迭代搜索与工具组合任务中的性能。
Harness Router 是一个针对AI编码代理的决策层,通过使用Jev处理模糊性并使用MCTS评估多步后果,在执行前优化工具选择。
本文讨论了将 Jev 与 AI 代理中的 LLM 集成的设计模式,特别是当一次只暴露一个工具模式时,代理如何处理工具选择和规划。
Toollery是一种免训练的候选压缩框架,通过基于检索的方法提升了LLM代理工具和技能选择的可扩展性与效率。
作者更新了一个使用 Gemini Flash Lite 的只读分析代理项目,讨论了缓存效率低下和双语路由的挑战,并寻求日期处理的建议。
本文介绍了Gavel,这是一种通过线性投影从冻结LLM中引出原生技能路由的方法,实现了高效的工具选择而不会造成上下文过载,并在基准测试中超越了现有流程。
一位开发者描述了使用Node.js、TypeScript和Gemini Flash构建用于餐厅POS系统的只读分析代理,并寻求关于工具选择、数字验证技术和实现写入操作的模式的建议。
一项研究测量了16,893个会话,以分析像 Claude Code、Codex 和 Cursor 这样的AI编码代理如何选择工具(如数据库),发现在不同背景下推荐结果具有一致性。
本文通过关注任务明确性、访问需求、自主性、维护、成本和退出选项等关键问题,提供了一个评估AI智能体工具的实用框架,超越了功能比较。
作者观察到,给AI代理添加更多工具会增加分类复杂度,从而降低其选择正确工具的准确性;并且发现使用多个工具集更窄的小型代理可以提高可靠性。
本文介绍了一个关于多模态代理框架中技能发现与路由的案例研究,表明在提示中部分暴露技能可能会产生词汇竞争,从而阻碍正确选择,将小规模的上下文检索与大规模方法联系起来。
OpenMed 使用 Liquid AI 的 LFM2.5-VL-3B 模型分析了一张生成的皮肤图像,演示了在 Mac Studio 本地设备上进行区域映射和尺寸测量,以便进行视觉审查。
AI 智能体工具集中未使用的工具仍然会消耗令牌,并给工具选择增加噪音,因此智能体应只加载当前任务所需的工具。
本文引入“金丝雀工具”作为诊断探针,用于识别LLM智能体中特定的工具选择推理失败,提出了一个六类型分类法,并在8,640次任务运行中评估了八个模型,以展示能力层级差异和鲁棒性。
Ratel 是一个开源工具,通过使用 BM25 索引仅加载所需的工具(而不是所有可用工具),将输入令牌减少 79%,并提高了 AI 智能体的工具选择准确性。
DocOCR-Eval提出了一种无需标注的框架,采用校正和排序策略,在没有真实标签的情况下评估和选择OCR工具,并表明聚合多个多模态大语言模型能够改善与人工排序的一致性。
最近的分析表明,针对LLM智能体的基于检索的工具选择最多只能挽回约23%的失败,而针对注意力偏差的读取侧干预措施则可以挽回59-91%的失败,这表明真正的瓶颈在于模型的输出处理,而非输入过滤。
Liquid AI 展示了如何使用 LFM2.5-ColBERT-350M 作为过滤器,从151个工具中仅选出最相关的五个,从而减少延迟并提高工具选择准确性。
LFM2.5-ColBERT-350M 是一个模型,能从151个工具中可靠地选出最相关的工具,节省令牌并提高准确性,非常适合代理型边缘模型。
本文研究了LLM Agent中的过度权限工具选择问题,引入了ToolPrivBench来评估并缓解不必要的高权限工具使用。研究发现,安全对齐并不能确保最小权限选择,并提出了一种训练后防御方法,能够在不牺牲性能的情况下减少过度权限的使用。