标签
微软研究院推出EvoLib,这是一个框架,使LLMs能够在推理过程中从自身经验中持续学习,通过提取可复用的技能和洞察,无需模型更新或外部标签。
ThetaEvolve是一个开源框架,扩展了AlphaEvolve,使得像DeepSeek-R1-0528-Qwen3-8B这样的小型LLM能够通过测试时强化学习在开放问题上取得新的最佳已知边界,加速了AI的自我进化。
Continual Harness 是一种无需重置、自我改进的智能体框架,通过存储记忆、复用技能和优化提示,在 ARC-AGI-3 上以 774 美元的成本达到了 20.54% 的准确率,以更高的效率超越了 Hermes 和 OpenClaw 等先前基准。
作者分享了对三种持续学习方法的兴奋:SEAL模型(自适应)、测试时学习和终身模型编辑,预测到2027–2028年将实现真正的持续学习,从而形成一个通往人工超级智能的反馈循环。
本文研究了推理任务的多样本思维链上下文学习,揭示了标准扩展规则并不适用,并提出了Curvilinear Demonstration Selection (CDS)方法以改进示例排序,最高可获得5.42个百分点的性能提升。
本文介绍了 PACEvolve++,这是一种强化学习框架,通过将假设生成与执行解耦,提高了进化搜索代理在测试时的策略适应能力。
EvoTest 引入了 J-TTL,一个衡量智能体测试时学习能力的基准,并提出了一个进化框架,其中 Actor 智能体玩游戏,而 Evolver 智能体在不进行微调的情况下迭代改进系统的提示、记忆和超参数。该方法在基于复杂文本的游戏中表现出优于基于反思和记忆的基线方法的性能。