标签
台大李宏毅教授2026年春季机器学习课程更新,聚焦大模型时代的AI Agent与模型自我进化,标志着课程从经典机器学习向前沿大模型技术的彻底转型。
本文介绍了VQS,一种用于自进化视觉-语言模型的方法,它使用程序验证从图像中生成和标注问题,显著提高了准确性和模型性能,优于现有基线。
TimeEvo 是一种故障驱动的自进化方法,用于时间序列智能体,它能够诊断能力差距、综合工具,并在任务和骨干网络上提高准确性。
本文探讨了如何通过评估框架如Meta-Harness来验证AI代理的自我进化是否真正改善,强调了代理修改、评测和部署决策之间的权力分离,以防止虚假进步。
本文介绍了SELF-INDEX,这是一个使搜索索引能够自主自我进化的框架,从而提升检索性能,并惠及搜索代理和代理记忆系统等下游应用。
本文提出了一种针对认知数字孪生的四层架构,通过集成认知能力和任务导向的反馈机制,实现自我进化的操作循环。
Procedural Graphs 提出了一个框架,使LLM Agents能够自进化其执行结构,从而增强自主任务完成的适应性和效率。
本文介绍了reSolve,一个用于智能体技能自进化的代理引导求解与复现框架,其性能达到74.9%,超越人工精心设计的基线14.8个百分点。
StudyBench引入了一个受控的物理基准,用于衡量自进化方法将训练材料转化为可迁移问题解决能力的效率,揭示了指导和计算方面的差距。
HarnessDev通过评估LLMs构建和演化执行框架的能力,揭示了模型间性能的显著差异以及较差的迁移性。
DiagEvo通过层级错误原因记忆和双重置信度过滤,从内部失败历史中推导训练方向,从而改善语言模型的自进化,其性能优于依赖外部资源的基线方法。
ASPIRE引入了一个基准,用于从模糊自然语言目标中自我进化的LLM代理,揭示了目标解释和稳定权重级别改进方面的挑战。
EvoUndo 为评估与确保自修改大语言模型智能体的可恢复性提供了框架,研究表明可靠的恢复能力需要对验证机制、状态锚定与恢复语言表达能力进行协同设计。
这篇文章探讨了AI代理自进化中轨迹学习的重要性,并介绍了Apodex 1.1系统和开源工具FrontierAgent,用于执行和评估长时间的研究任务。
RubSE是一个框架,它利用评分标准引导的自演化,通过缓解视觉修复耦合和轨迹崩溃来增强UI到代码生成的稳定性。
本文审计了金融AI代理中的自我进化机制,揭示了能力提升的同时也伴随着安全风险,如提示注入漂移和执行接口不匹配,强调了全面审计的必要性。
GenRouter 是一个用于代理式图像生成的统一路由框架,能够自适应地将提示引导至最优工作流,通过需求建模和自我进化显著降低成本与延迟,同时提升视觉对齐效果。
This paper introduces SHAPER, a self-evolving framework for embodied agents that keeps model parameters frozen and improves performance by evolving reusable skills and context-code harnesses through target-environment rollouts. Evaluated on VLABench and ESI-Bench, it proposes a practical alternative to fine-tuning when training is expensive or unavailable.
本文介绍了 Spatial Memory Agent (SMA),一种运行时框架,通过验证器引导的反思和可复用记忆,在不进行参数更新或使用外部工具的情况下提升冻结视觉语言模型的空间推理能力,在五个基准和四个基础 VLM 上取得了强劲的结果。