llm-agents

标签

Cards List
#llm-agents

智能体上下文压缩后,持久化控制平面应证明什么?

Reddit r/AI_Agents · 22小时前

一位开发者测试了一个 GitHub 热门项目,该项目针对上下文压缩后的智能体恢复问题;结果发现,在对话记录之外保留持久化账本是有帮助的,但仍需要更严格的验收测试,以确认确切的交付步骤和用户约束得以保留。

0 人收藏 0 人点赞
#llm-agents

我的一个智能体在自己治理合约中写入了一条新规则,我的运行时执行了15天才发现

Reddit r/AI_Agents · 昨天

一位开发者回顾了一个AI智能体如何悄悄将一条正确的新规则加入自身的治理合约,运行时执行15天后才被察觉,这促使了追加式规则账本与人工批准等变更。

0 人收藏 0 人点赞
#llm-agents

@yibie: Lexifina 的 Alan Yahya:调优 agent 行为,本质上是在对它手里的资源做升降级。看不见 agent 内部,就修不好它。 《看穿你的 agent 才能修好它》 See Inside Your Agents To Fix…

X AI KOLs Timeline · 2天前 缓存

本文介绍 agent 可观测性与行为调优框架:通过提升或降级 agent 可访问的资源(工具、记忆、子代理)来调整其行为,并讨论性能、执行、用户对齐等视角和证据来源。来自 Lexifina 的 Alan Yahya。

0 人收藏 0 人点赞
#llm-agents

Causal Episodic Memory for Feedback-Driven Agent Repair

arXiv cs.CL · 2天前 缓存

This paper introduces MERIT, a training-free agent that uses causal episodic memory of past repair outcomes to improve subsequent Text-to-SQL generations, boosting execution accuracy on Spider and BIRD benchmarks.

0 人收藏 0 人点赞
#llm-agents

无需 Rollout 的任务难度预测

arXiv cs.LG · 2天前 缓存

本文提出在不执行昂贵 Rollout 的情况下预测 LLM 智能体的任务难度,在 17 个智能体基准上研究该问题,并表明 token 级熵是一种有用的预测信号。

0 人收藏 0 人点赞
#llm-agents

SkillZip:面向可扩展智能体技能库的契约保持图压缩

arXiv cs.CL · 2天前 缓存

本文介绍了 SkillZip,一种契约保持的图压缩框架,它在章节级别压缩智能体技能库,在保留过程性契约和依赖闭包的同时,提高了检索和压缩效率。

0 人收藏 0 人点赞
#llm-agents

EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架

arXiv cs.LG · 2天前 缓存

介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。

0 人收藏 0 人点赞
#llm-agents

活动帧:面向代理记忆与回放的确定性屏幕活动编译

arXiv cs.AI · 2天前 缓存

本文提出了一种确定性的零模型流水线,将被动捕获的屏幕活动编译为结构化的“活动帧”用于代理记忆,将一天的原始捕获压缩为适合提示的上下文块,体积缩小86倍,并达到98.4%的问答准确率。文中还引入了例程开销比率和重复性的测量,用于对代理成本进行建模。

0 人收藏 0 人点赞
#llm-agents

DreamGuard:基于风险感知世界模型的高效LLM智能体运行时护栏

arXiv cs.AI · 2天前 缓存

DreamGuard是一种面向LLM智能体的主动式运行时护栏,利用风险感知世界模型跟踪潜在状态并预测未来风险,从而在不安全动作执行前进行干预。它在基准测试和在线评估中优于基线,延迟为25毫秒。

0 人收藏 0 人点赞
#llm-agents

SkillTV-Bench:评估裁判在技能增强型智能体执行中的表现基准

arXiv cs.AI · 2天前 缓存

介绍SkillTV-Bench,一个包含681个案例的基准,用于评估LLM智能体中技能感知的轨迹验证,以及SkillTV-Evolve,一种将验证知识外部化为可复用JudgeSkill的方法,将裁判准确率提升14.8个百分点。

0 人收藏 0 人点赞
#llm-agents

EcoAgent-Bench:评估预算受限的LLM代理中的经济决策

arXiv cs.AI · 2天前 缓存

本文介绍了EcoAgent-Bench,一个包含304个任务的基准测试,用于评估LLM代理在明确预算和定价操作下的经济决策,测试五个任务族中的四种与成本相关的决策。

0 人收藏 0 人点赞
#llm-agents

DoctorAgents:一个面向小型临床时序数据迭代优化AutoML流程的智能体框架

arXiv cs.AI · 2天前 缓存

本文提出DoctorAgents,一种智能体AI框架,利用专门的LLM智能体对小型、异质性临床时序数据集进行端到端机器学习流程的迭代生成、验证与优化,性能优于成熟的AutoML基线方法。

0 人收藏 0 人点赞
#llm-agents

智能体自驱动显微镜基准测试支持资格认证,但未必能泛化到未见任务

arXiv cs.AI · 2天前 缓存

本文介绍了一个基准测试与轨迹记录框架,用于评估控制显微镜的基于LLM的智能体,比较了105种智能体配置,发现基准测试有助于资格验证,但无法可靠预测智能体在未见任务上的表现。

0 人收藏 0 人点赞
#llm-agents

Search2Skill:通过基于规则表的强化学习在知识边界之外进行技能蒸馏

arXiv cs.AI · 2天前 缓存

Search2Skill 是一个框架,它训练 LLM 智能体识别能力差距、搜索外部来源,并使用基于规则表的强化学习将检索到的知识提炼为可复用的技能,在专家领域基准测试上优于基线方法。

0 人收藏 0 人点赞
#llm-agents

SearchAuditor:长时程搜索智能体故障的审计与归因

arXiv cs.AI · 2天前 缓存

本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。

0 人收藏 0 人点赞
#llm-agents

我反复看到的架构翻转:代码不再调用LLM——而是LLM调用代码

Reddit r/AI_Agents · 3天前

一篇观察架构转变的文章:LLM代理编排确定性代码,而非确定性代码调用LLM,并提供了实用的红旗和绿旗,判断这种反转何时有意义。

0 人收藏 0 人点赞
#llm-agents

@sheriyuo: Meta-RL 确实感觉是一个非常具有前景的方向

X AI KOLs Timeline · 3天前 缓存

一位研究者强调,Meta-RL 是训练 LLM 智能体的一个有前景的方向,将智能体训练重新构建为跨回合的元强化学习问题,从而实现主动探索和试错适应。

0 人收藏 0 人点赞
#llm-agents

InsightEmb:学习面向智能体洞察检索的动作意图嵌入

arXiv cs.CL · 3天前 缓存

InsightEmb 是一种用于智能体洞察检索的对比嵌入框架,仅通过数学推理数据即可学习面向进展的检索几何结构,从而在无需环境特定训练的情况下改进 LLM 智能体的检索效果。

0 人收藏 0 人点赞
#llm-agents

Caching for the Future: Scrub Jay Episodic Memory Principles for Agent Memory Systems

arXiv cs.CL · 3天前 缓存

This paper introduces ScrubJay-MEM, an LLM agent memory system inspired by scrub jay episodic memory, which uses type-conditioned temporal decay to manage memory perishability. It also proposes the Temporal Generalization Test (TGT) benchmark and shows improved performance over existing memory systems on temporal reasoning tasks.

0 人收藏 0 人点赞
#llm-agents

EASy:迈向基于LLM的高效智能体系统

arXiv cs.CL · 3天前 缓存

本文提出了EASy,一个可训练的智能体框架,利用强化学习联合优化任务性能与计算效率,并引入了里程碑-规划-执行工作流、依赖感知执行图和用于训练的树形展开。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈