用于运行关于使用工具的智能体的受控实验的开源实验室(改变工具名称/角色/历史,测量效果)

Reddit r/AI_Agents 工具

摘要

一个开源实验室框架,用于运行关于使用工具的智能体的受控实验,允许改变工具名称、角色和历史来测量效果。

暂无内容
查看原文

相似文章

AI代理项目的开源开发工具

Reddit r/AI_Agents

AgentLantern 是一个面向AI代理项目的开源开发工具,帮助记录、分析、验证和可视化代理工作流,最初支持CrewAI,并计划扩展到其他框架。

受控智能体的集合切换行为测试

arXiv cs.AI

本文介绍了一个基准测试,用于评估当可靠工具在会话中悄然发生变化时,LLM智能体如何调整其工具选择,借鉴了认知心理学中的集合切换概念。该测试对开放权重LLM进行了评估,并根据工具集合的框架识别出不同的失败模式。