用于运行关于使用工具的智能体的受控实验的开源实验室(改变工具名称/角色/历史,测量效果)

Reddit r/AI_Agents 工具

摘要

一个开源实验室框架,用于运行关于使用工具的智能体的受控实验,允许改变工具名称、角色和历史来测量效果。

暂无内容
查看原文

相似文章

AI代理项目的开源开发工具

Reddit r/AI_Agents

AgentLantern 是一个面向AI代理项目的开源开发工具,帮助记录、分析、验证和可视化代理工作流,最初支持CrewAI,并计划扩展到其他框架。

受控智能体的集合切换行为测试

arXiv cs.AI

本文介绍了一个基准测试,用于评估当可靠工具在会话中悄然发生变化时,LLM智能体如何调整其工具选择,借鉴了认知心理学中的集合切换概念。该测试对开放权重LLM进行了评估,并根据工具集合的框架识别出不同的失败模式。

@omarsar0: 关于工具使用智能体的有趣可解释性论文。作者探测隐藏状态,发现模型经常识别到应调用工具,但…

X AI KOLs Following

本文提出了一个模型自适应的工具必要性定义,并发现 LLM 内部识别需要工具与实际调用工具之间存在 26% 到 54% 的不匹配,集中体现在认知到行动的转换阶段。它揭示了一个“知行差距”(knowing-doing gap),即模型通常知道应该调用工具,但由于后期层几何结构将信号旋转至几乎与行动正交,导致调用失败。