标签
本文提出'Space',一种技能引导的自适应动作分块方法,用于长期任务LLM代理,将成功率提高7.0%–31.3%,并将LLM决策轮次减少高达78.9%。
DisCo是一个研究代理,能从GitHub仓库中蒸馏操作知识到可复用技能,显著提升自主机器学习研究在诸如MLE-bench等基准测试上的性能。
Search2Skill 是一个框架,它训练 LLM 智能体识别能力差距、搜索外部来源,并使用基于规则表的强化学习将检索到的知识提炼为可复用的技能,在专家领域基准测试上优于基线方法。
SKILL-KD是一种对比技能蒸馏框架,通过将教师轨迹与学生轨迹之间的可操作差异蒸馏为文本技能补丁,并利用漂移感知合并机制迭代优化技能,从而提升LLM智能体的性能。
本文首次系统性地探索了基于文件系统的LLM Agent记忆,将管理、搜索和执行Agent的角色规范化,使其围绕一个共享的记忆存储。研究发现,组织主要降低了检索成本,但尚未提升答案质量,并且工具选择对存储形态的影响与模型选择一样大。
BrowserBC 是一个开源系统,能够将记录的人类浏览器交互转化为可复用的智能体技能,只需一次录制,即可在 Claude Desktop 和 Claude Code 中使用这些技能。
OPID 是一个框架,它从完成的在线策略轨迹中提取密集的词元级监督信号,用于语言智能体的强化学习,通过分层技能(情节级和步骤级)来提高样本效率和鲁棒性。
OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。
EmoDistill是一个离线框架,通过隐式Q学习进行情感选择,并基于LoRA的监督微调和评判策略优化进行情感表达,从而将情感谈判技能蒸馏到语言模型智能体中,在对抗性谈判中实现更高的效用。
PANDO 是一个网络代理框架,通过在线技能蒸馏提高效率,在 VisualWebArena 任务上减少 58-61% 的令牌使用量,同时优于基线。
仅凭一份 CLAUDE.md 文件,本周斩获 44k star 登顶 GitHub Trending,将 Andrej Karpathy 的 LLM 编程避坑指南浓缩为四大原则。