标签
本文介绍了一种面向视觉语言模型的自我演进框架,使其在没有外部监督的情况下提升提问能力,不仅提高了问题质量,还增强了回答者的表现。
每周精选AI论文综述,涵盖MIT的自我修正发现系统、智能体自我进化解析,以及谷歌使用智能体框架进行形式数学的LEAP系统。
EvoMap 推出了 GEP(基因组进化协议),这是一种网络协议,使代理能够将成功策略转化为基因和胶囊以实现自我进化,减少重复探索。
本文分析了自进化LLM智能体中的两种能力:工具更新能力和工具收益能力。研究发现工具更新能力在不同基础能力层级间持平,而工具收益能力则呈现非单调性,其中中等层级模型收益最大。
文章认为,AI智能体的自我演进应谨慎应用,并提出了一种演进监管器(Evolution Governor),该监管器审计工作流以决定是否演进,依据条件如可重复任务和外部反馈。
BenchTrace是一个用于评估LLM智能体自我进化能力的基准,重点通过包含1,821个标注回合的数据集以及两个评估任务——反思评估与进化评估——来测试反思与受控演进。使用Qwen3-32B和GPT-4.1进行的实验表明,两个模型均表现不佳,主要瓶颈在于诊断,并存在泛化与遗忘问题。
提出 Agentic-VLA 框架,将智能体引入 VLA 循环中,使视觉-语言-动作模型能够自我进化,并在各项指标上超越现有头部具身模型。
SEAL提出了一个闭环框架,用于联合演化LLM智能体及其训练环境,利用诊断引导的标签对齐双方。仅用400个训练样本,它就在多轮工具使用任务上取得了显著提升,表现出更好的鲁棒性和分布外迁移能力。
MiniMax-M2系列引入了混合专家语言模型,在极少的激活参数下(总参数量2299亿,每token仅激活98亿)在代理任务上实现了高性能。该系列利用代理驱动的数据管道、名为Forge的可扩展强化学习系统,以及一个向自我进化迈出初步步骤的检查点。
PACE 提出了一种双时间尺度框架,用于小语言模型智能体的自进化,协调低风险的提示精炼与高风险的控制器逻辑更新,在多个基准上实现了高达 +9.2% 的相对提升。
SEAL 是一个用于交互式工具使用智能体的闭环共进化框架,通过利用在线策略轨迹和回合级诊断同步策略与环境更新,解决了智能体-环境不匹配问题。
SOLAR提出了一种自我优化的自主代理,利用参数级元学习和多层次强化学习,使LLMs能够对非平稳数据流进行终身适应,在推理任务上超越基线。
FORGE是一种协议,使LLM智能体能够通过群体广播无需权重更新地演化其记忆,将失败轨迹转化为可复用的知识构件。在CybORG CAGE-2网络防御任务中,相较于零样本和Reflexion基线,该协议在多个LLM家族上显著提升了性能。
本综述论文对基于LLM的多智能体系统进行了统一回顾,聚焦于协作、故障归因和自我进化,通过LIFE框架识别开放挑战,并提出跨阶段的研究议程。
智谱AI创始人唐杰预测今年大模型最大突破是长周期任务,AI可在真实环境持续解决复杂问题,并提及三大技术支柱及Anthropic的自主训练进展。
该文章讨论了AI Agent记忆的实现,介绍了EverOS系统的LoCoMo准确率93.05%可复现,及Skill自进化机制,并预告月底有新酷炫产品上线。
RewardHarness 是一个用于后训练的自演进代理框架,通过迭代优化工具和技能库来替代大规模偏好标注,在图像编辑评估基准上的表现优于 GPT-5。
本文提出了 FATE,这是一种基于策略(on-policy)的框架,它利用失败轨迹通过自我进化和感知帕累托前沿的优化来增强使用工具的 LLM 智能体的安全性和性能。
Google Cloud AI Research 推出 SkillOS,这是一种强化学习框架,使基于 LLM 的智能体能够通过从过往经验中提炼可复用技能来实现自我进化。
本文介绍了 SEIF,这是一个自我演化的强化学习框架,通过迭代难度自适应以及教官和跟随者组件的协同训练,增强大语言模型(LLM)的指令遵循能力。