tool-using

标签

Cards List
#tool-using

Telco-GAIA:电信领域智能体的双语基准测试

arXiv cs.AI · 3天前 缓存

Telco-GAIA是一个用于评估电信领域工具使用智能体的双语多模态基准测试,包含100个经过人工验证的任务,要求对异构来源进行多跳推理,并通过精确字符串匹配进行客观评分。

0 人收藏 0 人点赞
#tool-using

DFAH-Bench:金融决策中可观测智能体不稳定性的基准评测

arXiv cs.AI · 3天前 缓存

介绍DFAH-Bench,一个用于衡量金融智能体决策中行为不稳定性的重放基准,发现仅凭结果一致性会遗漏显著的轨迹分歧。

0 人收藏 0 人点赞
#tool-using

AI代理能完成任务但仍然算失败吗?

Reddit r/artificial · 2026-06-14

本文引入“验证税”(Verifier Tax)概念,将AI代理的结果分类为安全成功、不安全成功或失败,并为使用工具的LLM代理提出了一种双层验证架构。

0 人收藏 0 人点赞
#tool-using

决策感知记忆卡:面向工具使用LLM代理的反事实启发式上下文选择与压缩

arXiv cs.AI · 2026-06-09 缓存

介绍了CICL,一种决策感知上下文层,通过将上下文视为决策时刻的干预,使用反事实启发式评分和类型化记忆卡(受令牌预算限制),为工具使用的LLM代理选择和压缩证据。在SWE-bench和RepoBench上的实验显示,在检索准确性和行动关键性方面取得了实际提升。

0 人收藏 0 人点赞
#tool-using

Aurora:使用工具代理的统一视频编辑

Hugging Face Daily Papers · 2026-05-18 缓存

Aurora 是一个基于代理的视频编辑框架,它将一个工具增强的视觉语言模型代理与扩散变换器配对,自动解决用户请求中的文本和视觉未指定性,从而实现统一视频编辑任务,如替换、移除、风格迁移和参考驱动插入。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈