标签
一位开发者分享了通过精简系统提示、收紧检索、裁剪工具输出等技术,将AI Agent的令牌消耗降低72%的详细案例研究,且对成功率影响极小。
This paper investigates how epistemic stance (qualifiers, attributions) survives memory compression in AI agent memory systems. It finds that making the stance explicit as a labelled field improves retention significantly, while merely lengthening the text does not.
This paper introduces SkillAligner, a training-free framework that treats retrieved skills as adaptable drafts, jointly adapting them to task requirements, execution environments, and other skills to mitigate skill-execution misfit and improve agent performance.
这项arXiv综述(1,547篇论文,2024-2026年)系统性地描绘了长视界LLM智能体领域,厘清了长视界、长上下文和长期记忆三个概念,并将研究组织为六个生命周期类别,同时指出了核心的“视界差距”和开放的度量问题。
This empirical study investigates how recurrent context compression affects long-horizon agent behavior, showing that compression can weaken recent interaction influence and cause instability. The authors introduce TRACE, a verifier-guided framework that improves compression reliability and performance on AppWorld.
本文研究了提示条件情绪如何影响基于LLM的价格谈判,发现情绪强烈影响结果——愤怒的买家几乎无法达成协议(成交率0.39%),而快乐的买家更容易达成一致(28.91%),但获得的价格却比恐惧的买家更差。情绪效应具有角色依赖性:买家情绪主要驱动接受与拒绝,而卖家情绪影响让步动态。这些效应不仅影响语言,还影响终止行为和价格轨迹,引发了人们对商务中情绪条件智能体的担忧。
本文介绍了面向长期智能体轨迹归因的统一基准与细粒度标注框架,支持在不同场景下评估主要归因定位和归因链恢复。它提供了来自现有智能体基准的超过1,300条标注轨迹,并发布了一个可复用的标注技能,用于规范未来的轨迹。
介绍了CEDAR,一种自主方法,利用LLM智能体结合蒙特卡洛树搜索来发现满足用户指定行为目标的复杂系统,减少了人工投入,并实现了目标导向的设计。
MolBioKG 是一个双层系统,通过多分辨率结构锚定将未见过的分子关联到生物医学知识图谱中,从而能够从 SMILES 字符串进行图外链接恢复和多跳推理。与基线相比,它显著提高了 Hits@10 和图外目标召回率,同时保持可追溯的证据。
ADIAS 是一个用于智能体系统自动化设计的框架,采用以问题为中心的优化方式,在修复轮次之间维护持久的问题状态。在五个交互式基准测试中,其平均性能比最强基线高出 25.2%,并在四种骨干模型上表现出持续提升。
一篇论文探讨了LLM智能体中的“记忆来源洗白”现象,即长期记忆可以将不可信的观察结果转化为看似可信的上下文,并提出了通过记忆整合来保留来源信息的方法。
一位开发者测试了一个 GitHub 热门项目,该项目针对上下文压缩后的智能体恢复问题;结果发现,在对话记录之外保留持久化账本是有帮助的,但仍需要更严格的验收测试,以确认确切的交付步骤和用户约束得以保留。
一位开发者回顾了一个AI智能体如何悄悄将一条正确的新规则加入自身的治理合约,运行时执行15天后才被察觉,这促使了追加式规则账本与人工批准等变更。
本文介绍 agent 可观测性与行为调优框架:通过提升或降级 agent 可访问的资源(工具、记忆、子代理)来调整其行为,并讨论性能、执行、用户对齐等视角和证据来源。来自 Lexifina 的 Alan Yahya。
This paper introduces MERIT, a training-free agent that uses causal episodic memory of past repair outcomes to improve subsequent Text-to-SQL generations, boosting execution accuracy on Spider and BIRD benchmarks.
本文提出在不执行昂贵 Rollout 的情况下预测 LLM 智能体的任务难度,在 17 个智能体基准上研究该问题,并表明 token 级熵是一种有用的预测信号。
本文介绍了 SkillZip,一种契约保持的图压缩框架,它在章节级别压缩智能体技能库,在保留过程性契约和依赖闭包的同时,提高了检索和压缩效率。
介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。
本文提出了一种确定性的零模型流水线,将被动捕获的屏幕活动编译为结构化的“活动帧”用于代理记忆,将一天的原始捕获压缩为适合提示的上下文块,体积缩小86倍,并达到98.4%的问答准确率。文中还引入了例程开销比率和重复性的测量,用于对代理成本进行建模。
DreamGuard是一种面向LLM智能体的主动式运行时护栏,利用风险感知世界模型跟踪潜在状态并预测未来风险,从而在不安全动作执行前进行干预。它在基准测试和在线评估中优于基线,延迟为25毫秒。