llm-agents

标签

Cards List
#llm-agents

将我的Agent令牌消耗削减72%(每个任务11.9k ➝ 3.3k)。以下是我所做的具体改动,附数据

Reddit r/AI_Agents · 11小时前

一位开发者分享了通过精简系统提示、收紧检索、裁剪工具输出等技术,将AI Agent的令牌消耗降低72%的详细案例研究,且对成功率影响极小。

0 人收藏 0 人点赞
#llm-agents

Explicit, Not Longer: What Makes Epistemic Stance Survive Memory Compression

arXiv cs.CL · 12小时前 缓存

This paper investigates how epistemic stance (qualifiers, attributions) survives memory compression in AI agent memory systems. It finds that making the stance explicit as a labelled field improves retention significantly, while merely lengthening the text does not.

0 人收藏 0 人点赞
#llm-agents

SkillAligner: Treating Retrieved Skills as Adaptable Drafts at Execution Time

arXiv cs.LG · 12小时前 缓存

This paper introduces SkillAligner, a training-free framework that treats retrieved skills as adaptable drafts, jointly adapting them to task requirements, execution environments, and other skills to mitigate skill-execution misfit and improve agent performance.

0 人收藏 0 人点赞
#llm-agents

视界差距:长视界LLM智能体的规划、记忆、执行、训练与评估

arXiv cs.CL · 12小时前 缓存

这项arXiv综述(1,547篇论文,2024-2026年)系统性地描绘了长视界LLM智能体领域,厘清了长视界、长上下文和长期记忆三个概念,并将研究组织为六个生命周期类别,同时指出了核心的“视界差距”和开放的度量问题。

0 人收藏 0 人点赞
#llm-agents

Toward Reliable Context Compression for Long-Horizon Agents: An Empirical Study of Execution Instability

arXiv cs.LG · 12小时前 缓存

This empirical study investigates how recurrent context compression affects long-horizon agent behavior, showing that compression can weaken recent interaction influence and cause instability. The authors introduce TRACE, a verifier-guided framework that improves compression reliability and performance on AppWorld.

0 人收藏 0 人点赞
#llm-agents

成交?也许吧:情绪在多智能体谈判中的作用

arXiv cs.AI · 12小时前 缓存

本文研究了提示条件情绪如何影响基于LLM的价格谈判,发现情绪强烈影响结果——愤怒的买家几乎无法达成协议(成交率0.39%),而快乐的买家更容易达成一致(28.91%),但获得的价格却比恐惧的买家更差。情绪效应具有角色依赖性:买家情绪主要驱动接受与拒绝,而卖家情绪影响让步动态。这些效应不仅影响语言,还影响终止行为和价格轨迹,引发了人们对商务中情绪条件智能体的担忧。

0 人收藏 0 人点赞
#llm-agents

长期智能体轨迹归因:统一基准与细粒度标注框架

arXiv cs.AI · 12小时前 缓存

本文介绍了面向长期智能体轨迹归因的统一基准与细粒度标注框架,支持在不同场景下评估主要归因定位和归因链恢复。它提供了来自现有智能体基准的超过1,300条标注轨迹,并发布了一个可复用的标注技能,用于规范未来的轨迹。

0 人收藏 0 人点赞
#llm-agents

CEDAR:智能体编排的树搜索用于复杂系统的目标导向优化

arXiv cs.AI · 12小时前 缓存

介绍了CEDAR,一种自主方法,利用LLM智能体结合蒙特卡洛树搜索来发现满足用户指定行为目标的复杂系统,减少了人工投入,并实现了目标导向的设计。

0 人收藏 0 人点赞
#llm-agents

MolBioKG:通过多分辨率结构锚定将图外分子关联至生物医学知识图谱

arXiv cs.AI · 12小时前 缓存

MolBioKG 是一个双层系统,通过多分辨率结构锚定将未见过的分子关联到生物医学知识图谱中,从而能够从 SMILES 字符串进行图外链接恢复和多跳推理。与基线相比,它显著提高了 Hits@10 和图外目标召回率,同时保持可追溯的证据。

0 人收藏 0 人点赞
#llm-agents

ADIAS:交互式智能体系统的自动化设计

arXiv cs.AI · 12小时前 缓存

ADIAS 是一个用于智能体系统自动化设计的框架,采用以问题为中心的优化方式,在修复轮次之间维护持久的问题状态。在五个交互式基准测试中,其平均性能比最强基线高出 25.2%,并在四种骨干模型上表现出持续提升。

0 人收藏 0 人点赞
#llm-agents

关于LLM智能体中“记忆来源洗白”的论文

Reddit r/AI_Agents · 14小时前

一篇论文探讨了LLM智能体中的“记忆来源洗白”现象,即长期记忆可以将不可信的观察结果转化为看似可信的上下文,并提出了通过记忆整合来保留来源信息的方法。

0 人收藏 0 人点赞
#llm-agents

智能体上下文压缩后,持久化控制平面应证明什么?

Reddit r/AI_Agents · 昨天

一位开发者测试了一个 GitHub 热门项目,该项目针对上下文压缩后的智能体恢复问题;结果发现,在对话记录之外保留持久化账本是有帮助的,但仍需要更严格的验收测试,以确认确切的交付步骤和用户约束得以保留。

0 人收藏 0 人点赞
#llm-agents

我的一个智能体在自己治理合约中写入了一条新规则,我的运行时执行了15天才发现

Reddit r/AI_Agents · 2天前

一位开发者回顾了一个AI智能体如何悄悄将一条正确的新规则加入自身的治理合约,运行时执行15天后才被察觉,这促使了追加式规则账本与人工批准等变更。

0 人收藏 0 人点赞
#llm-agents

@yibie: Lexifina 的 Alan Yahya:调优 agent 行为,本质上是在对它手里的资源做升降级。看不见 agent 内部,就修不好它。 《看穿你的 agent 才能修好它》 See Inside Your Agents To Fix…

X AI KOLs Timeline · 3天前 缓存

本文介绍 agent 可观测性与行为调优框架:通过提升或降级 agent 可访问的资源(工具、记忆、子代理)来调整其行为,并讨论性能、执行、用户对齐等视角和证据来源。来自 Lexifina 的 Alan Yahya。

0 人收藏 0 人点赞
#llm-agents

Causal Episodic Memory for Feedback-Driven Agent Repair

arXiv cs.CL · 3天前 缓存

This paper introduces MERIT, a training-free agent that uses causal episodic memory of past repair outcomes to improve subsequent Text-to-SQL generations, boosting execution accuracy on Spider and BIRD benchmarks.

0 人收藏 0 人点赞
#llm-agents

无需 Rollout 的任务难度预测

arXiv cs.LG · 3天前 缓存

本文提出在不执行昂贵 Rollout 的情况下预测 LLM 智能体的任务难度,在 17 个智能体基准上研究该问题,并表明 token 级熵是一种有用的预测信号。

0 人收藏 0 人点赞
#llm-agents

SkillZip:面向可扩展智能体技能库的契约保持图压缩

arXiv cs.CL · 3天前 缓存

本文介绍了 SkillZip,一种契约保持的图压缩框架,它在章节级别压缩智能体技能库,在保留过程性契约和依赖闭包的同时,提高了检索和压缩效率。

0 人收藏 0 人点赞
#llm-agents

EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架

arXiv cs.LG · 3天前 缓存

介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。

0 人收藏 0 人点赞
#llm-agents

活动帧:面向代理记忆与回放的确定性屏幕活动编译

arXiv cs.AI · 3天前 缓存

本文提出了一种确定性的零模型流水线,将被动捕获的屏幕活动编译为结构化的“活动帧”用于代理记忆,将一天的原始捕获压缩为适合提示的上下文块,体积缩小86倍,并达到98.4%的问答准确率。文中还引入了例程开销比率和重复性的测量,用于对代理成本进行建模。

0 人收藏 0 人点赞
#llm-agents

DreamGuard:基于风险感知世界模型的高效LLM智能体运行时护栏

arXiv cs.AI · 3天前 缓存

DreamGuard是一种面向LLM智能体的主动式运行时护栏,利用风险感知世界模型跟踪潜在状态并预测未来风险,从而在不安全动作执行前进行干预。它在基准测试和在线评估中优于基线,延迟为25毫秒。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈