标签
研究人员展示了AIDE²,这是一个具有递归自动研究循环的系统,在超过100次迭代中改进了自己的代码,发现了七项改进,并在保留的基准测试上击败了手动调优的智能体。
一位开发者构建了一个管道,其中经过强化学习训练的AI智能体创建并提交针对小模型的强化学习训练任务,并根据智能体的表现给予奖励。该项目完全开源,并展示了向保留任务的迁移能力。
SMETA-ZSL 提出了一种利用语义元对齐和对比微调进行广义零样本威胁分类的方法,在7个基准测试中平均超过先前方法10.8个百分点。
本文针对噪声偏好标签下的直接偏好优化,提出了一种双层优化框架,引入了一种无元数据的元加权方法,该方法使用中心差分近似和LoRA微调来提高对齐性能。
一篇讨论帖,质疑AI中持续学习的定义和要求,引用了Dario Amodei和Demis Hassabis近期关于其对通用人工智能(AGI)重要性的言论。
本文介绍了元神经细胞自动机(MetaNCA),这是一个学习局部更新规则以自组织神经网络权重而无须反向传播的框架,在MNIST和CIFAR-100上可扩展到200万参数的网络,并能泛化到未见过的架构。
提出了高效长时域优化(ELO)学习,一种元训练算法,它将计算重新分配给更长的时域,并使用解耦的渐进式专家监督,提高了学习优化器在长展开任务和分布外泛化上的性能。ELO-Celo2在语言建模任务上持续优于AdamW,并与Muon性能相当。
提出一种无标签数据的元学习方法,通过将预训练模型的软标签分配给未标注数据来生成任务,避免了计算昂贵的模型逆推。与最先进的DFML方法相比,实现了高达104倍的加速和8.4%-36.4%的准确率提升。
本文提出了PhyMRI-SR,一种物理感知的MRI超分辨率方法,它利用高斯溅射和物理约束建模来动态调整分辨率-SNR配置,实现了最先进的性能。
介绍MetaFlow,一种通过结合监督微调和带执行反馈的强化学习来训练大语言模型为零样本任务生成工作流的方法,实现对未训练任务和算子集的强大泛化能力。
本文介绍了一个面向任意时有效认证鲁棒性的元学习框架,该框架使用序列E过程自适应分配计算资源,与传统的随机平滑方法相比,样本复杂度降低了20倍,同时保持了严格的统计保证。
介绍了 Autodata,一种让 AI 代理扮演数据科学家以创建高质量合成训练数据的方法,在计算机科学、法律和数学推理任务上展示了优于经典方法的效果。
提出了一种分层贝叶斯框架,用于从多个稀疏、含噪声的数据集中对动力系统进行元学习,利用基于梯度的MCMC与嵌入的ODE求解器,对共享参数和数据集特定参数进行高效的后验推断。
提出了一种名为MEDIC的新型元学习策略,用于开放集域泛化,该策略通过域和类别划分间的隐式梯度匹配来实现更优的边界。实验表明其性能达到最先进水平。
本文介绍了Connect the Dots(CoD),这是一个通过强化学习训练LLM的框架,用于培养长期生命周期智能体的元能力,实现持续学习和跨域泛化。
提出 ReGrad,一种将梯度视为可检索知识单元用于持续后训练的范式,通过将文档特定梯度存储在梯度银行(Gradient Bank)中,并在推理时检索查询相关梯度进行临时权重适应,从而避免累积权重漂移。
本文认为,最近声称神经网络已解决Fodor和Pylyshyn的系统性挑战的结论为时过早。作者表明,用于组合性的元学习模型在分布外泛化方面失败,甚至在分布内问题上也表现出非系统性行为,从而得出结论:该挑战仍未解决。
提出WIZARD,一种权重空间元学习框架,它从语言指令和演示视频中为冻结的VLA策略生成任务特定的LoRA参数,从而实现无需微调的高效任务自适应。
本文提出了一个三阶段诊断框架,用于识别离线模型选择器为何无法胜过最佳单一模型,并将其应用于edX点击流数据上的辍学预测。研究发现瓶颈在于局部表征歧义,而非学习器选择或分布偏移,建议重新设计状态或收集新数据,而非进一步调优算法。