用于运行关于使用工具的智能体的受控实验的开源实验室(改变工具名称/角色/历史,测量效果)
摘要
一个开源实验室框架,用于运行关于使用工具的智能体的受控实验,允许改变工具名称、角色和历史来测量效果。
暂无内容
相似文章
SciToolAgent-Evo:面向开放世界科学工具获取的本体感知自进化智能体
介绍了SciToolAgent-Evo,一种面向开放世界科学工具获取的本体感知自进化LLM智能体,以及包含900个真实任务的OpenSciToolBench基准。该智能体利用进化记忆和基于LinUCB的赌博机门控,动态探索并获取新工具。
如何可视化智能体工具使用?
一种关于如何可视化AI智能体使用工具的讨论或工具,可能有助于理解和调试智能体行为。
AI代理项目的开源开发工具
AgentLantern 是一个面向AI代理项目的开源开发工具,帮助记录、分析、验证和可视化代理工作流,最初支持CrewAI,并计划扩展到其他框架。
受控智能体的集合切换行为测试
本文介绍了一个基准测试,用于评估当可靠工具在会话中悄然发生变化时,LLM智能体如何调整其工具选择,借鉴了认知心理学中的集合切换概念。该测试对开放权重LLM进行了评估,并根据工具集合的框架识别出不同的失败模式。
超越函数调用:在工具环境不可靠性下对工具使用代理进行基准测试
介绍ToolBench-X,这是一个基准测试,用于评估各种工具环境可靠性隐患下的大语言模型代理,揭示了与干净环境相比性能上的显著差距。