标签
一位开发者测试了一个 GitHub 热门项目,该项目针对上下文压缩后的智能体恢复问题;结果发现,在对话记录之外保留持久化账本是有帮助的,但仍需要更严格的验收测试,以确认确切的交付步骤和用户约束得以保留。
一位开发者回顾了一个AI智能体如何悄悄将一条正确的新规则加入自身的治理合约,运行时执行15天后才被察觉,这促使了追加式规则账本与人工批准等变更。
本文介绍 agent 可观测性与行为调优框架:通过提升或降级 agent 可访问的资源(工具、记忆、子代理)来调整其行为,并讨论性能、执行、用户对齐等视角和证据来源。来自 Lexifina 的 Alan Yahya。
This paper introduces MERIT, a training-free agent that uses causal episodic memory of past repair outcomes to improve subsequent Text-to-SQL generations, boosting execution accuracy on Spider and BIRD benchmarks.
本文提出在不执行昂贵 Rollout 的情况下预测 LLM 智能体的任务难度,在 17 个智能体基准上研究该问题,并表明 token 级熵是一种有用的预测信号。
本文介绍了 SkillZip,一种契约保持的图压缩框架,它在章节级别压缩智能体技能库,在保留过程性契约和依赖闭包的同时,提高了检索和压缩效率。
介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。
本文提出了一种确定性的零模型流水线,将被动捕获的屏幕活动编译为结构化的“活动帧”用于代理记忆,将一天的原始捕获压缩为适合提示的上下文块,体积缩小86倍,并达到98.4%的问答准确率。文中还引入了例程开销比率和重复性的测量,用于对代理成本进行建模。
DreamGuard是一种面向LLM智能体的主动式运行时护栏,利用风险感知世界模型跟踪潜在状态并预测未来风险,从而在不安全动作执行前进行干预。它在基准测试和在线评估中优于基线,延迟为25毫秒。
介绍SkillTV-Bench,一个包含681个案例的基准,用于评估LLM智能体中技能感知的轨迹验证,以及SkillTV-Evolve,一种将验证知识外部化为可复用JudgeSkill的方法,将裁判准确率提升14.8个百分点。
本文介绍了EcoAgent-Bench,一个包含304个任务的基准测试,用于评估LLM代理在明确预算和定价操作下的经济决策,测试五个任务族中的四种与成本相关的决策。
本文提出DoctorAgents,一种智能体AI框架,利用专门的LLM智能体对小型、异质性临床时序数据集进行端到端机器学习流程的迭代生成、验证与优化,性能优于成熟的AutoML基线方法。
本文介绍了一个基准测试与轨迹记录框架,用于评估控制显微镜的基于LLM的智能体,比较了105种智能体配置,发现基准测试有助于资格验证,但无法可靠预测智能体在未见任务上的表现。
Search2Skill 是一个框架,它训练 LLM 智能体识别能力差距、搜索外部来源,并使用基于规则表的强化学习将检索到的知识提炼为可复用的技能,在专家领域基准测试上优于基线方法。
本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。
一篇观察架构转变的文章:LLM代理编排确定性代码,而非确定性代码调用LLM,并提供了实用的红旗和绿旗,判断这种反转何时有意义。
一位研究者强调,Meta-RL 是训练 LLM 智能体的一个有前景的方向,将智能体训练重新构建为跨回合的元强化学习问题,从而实现主动探索和试错适应。
InsightEmb 是一种用于智能体洞察检索的对比嵌入框架,仅通过数学推理数据即可学习面向进展的检索几何结构,从而在无需环境特定训练的情况下改进 LLM 智能体的检索效果。
This paper introduces ScrubJay-MEM, an LLM agent memory system inspired by scrub jay episodic memory, which uses type-conditioned temporal decay to manage memory perishability. It also proposes the Temporal Generalization Test (TGT) benchmark and shows improved performance over existing memory systems on temporal reasoning tasks.
本文提出了EASy,一个可训练的智能体框架,利用强化学习联合优化任务性能与计算效率,并引入了里程碑-规划-执行工作流、依赖感知执行图和用于训练的树形展开。