conversational-agents

标签

Cards List
#conversational-agents

全量召回,代价几何?智能体记忆系统的服务成本基准测试

arXiv cs.CL · 5天前 缓存

本文对三种智能体记忆系统(Mem0、Hindsight、Mastra Observational Memory)与参考策略在多种对话主干模型上的服务成本进行了基准测试,发现成本主要由内部记忆行为驱动,盈亏平衡点差异很大,且没有系统能在成本和准确性上同时胜出。

0 人收藏 0 人点赞
#conversational-agents

实现对话代理的多维度评估:一个可扩展、受管控的管道,具备选择性重新评估与模型基准测试

arXiv cs.AI · 2026-07-15 缓存

本文介绍了GenAI Evaluation,一个受管控且配置驱动的管道,用于零售对话代理的可扩展多维度评估。它通过使用LLM作为评判员的评分与选择性重新评估实现了高精度,并经过人工标注数据验证。

0 人收藏 0 人点赞
#conversational-agents

ProACT:面向多用户协作中故障感知的主动型智能体

arXiv cs.CL · 2026-07-07 缓存

ProACT 提出了一个面向多用户协作的故障感知智能体框架,该智能体能够主动检测协作故障并决定是否介入。本文还首次提出了用于评估此类主动型智能体的多用户协作基准。

0 人收藏 0 人点赞
#conversational-agents

记忆造就差异:评估不同记忆角色如何塑造对话代理

arXiv cs.CL · 2026-06-25 缓存

本文介绍了一种对话记忆类型的分类法和一个以用户为中心的评估框架,用于研究不同记忆角色如何影响基于RAG的对话代理的响应质量。

0 人收藏 0 人点赞
#conversational-agents

最近受雇于一家获奖的SaaS公司。记录企业真正需要的智能体运行时

Reddit r/AI_Agents · 2026-06-22

一位开发者记录了为一家SaaS公司构建的AI智能体运行时架构,重点聚焦于安全性、工具执行、状态管理以及推理与执行的分离。

0 人收藏 0 人点赞
#conversational-agents

@ElevenLabsDevs: 呼叫您的 Hermes Agent

X AI KOLs Following · 2026-06-04

ElevenLabs 引入了呼叫您的 Hermes Agent 的功能,通过他们的平台实现与AI代理的语音交互。

0 人收藏 0 人点赞
#conversational-agents

SaliMory:面向对话智能体的认知记忆编排框架

arXiv cs.CL · 2026-06-04 缓存

SaliMory 是一个框架,通过训练单一语言模型来管理对话智能体的认知结构化记忆(包括用户事实、偏好和工作记忆),采用分层阶段式过程奖励与奖励分解对比精化机制。该框架将记忆归因失败率降低了三分之一,端到端准确率超越现有最优方法逾10%,并将良好个性化率提升至原来的两倍以上。

0 人收藏 0 人点赞
#conversational-agents

Structure-Aware RAG: 用于对话代理的噪声数据结构化检索增强生成

arXiv cs.CL · 2026-05-26 缓存

提出Structure-Aware RAG (SA-RAG),它使用表格作为中间结构化表示来减少对话代理检索增强生成中的噪声,结合了质量感知的元数据生成和两种表格生成方法,在噪声真实世界数据集上优于现有基线。

0 人收藏 0 人点赞
#conversational-agents

评估主动式对话智能体中的多模态情绪识别:一项用户研究

arXiv cs.AI · 2026-05-22 缓存

本文介绍了一个用于主动对话智能体的多模态情绪识别模块,该模块结合了面部识别与语言分析。一项涉及20名参与者的用户研究发现了一种“扑克脸”效应,即视觉线索不可靠,而语言分析则更为准确;研究还表明,智能体可以通过对话适应性来引发情绪。

0 人收藏 0 人点赞
#conversational-agents

When2Speak: 面向大语言模型的多方对话时序参与与话轮转换数据集

arXiv cs.CL · 2026-05-08 缓存

When2Speak是一个合成数据集及流程,用于训练LLM在多方对话中决定何时发言。在该数据集上微调显著改善了话轮转换,强化学习将漏干预率从50%降至约20%。

0 人收藏 0 人点赞
#conversational-agents

Ecom-RLVE:面向电商对话代理的自适应可验证环境

Hugging Face Blog · 2026-04-16 缓存

Huggingface 推出 EcomRLVE-GYM,这是一个提供八个可验证环境的框架,用于在复杂电商任务上训练强化学习智能体。该工具具备自适应难度课程和算法化奖励机制,以提升购物助手的任务完成率,并已通过训练 Qwen 3 8B 模型进行了验证。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈