FAAST:通过闭式快速权重实现的前馈联想学习,用于测试时监督适应
摘要
FAAST提出了一种前馈方法,通过解析方式将标注样本编译为快速权重,无需反向传播即可实现高效的测试时监督适应,在保持性能的同时提升90%以上的速度和节省95%的内存。
查看缓存全文
缓存时间: 2026/05/14 16:19
论文页面 - FAAST:通过闭式快速权重的前向联想学习实现测试时监督适应
来源:https://huggingface.co/papers/2605.04651
摘要
FAAST通过前向计算将带标签样本编译为快速权重,从而实现高效的任务适应,相较于传统反向传播方法,在速度和内存节省方面均取得显著提升。
适应预训练模型通常需要在反向传播的高训练成本与基于记忆或上下文学习的高推理开销之间进行权衡。我们提出FAAST,一种纯前向联想适应方法,能够通过单次前向传播以解析方式将带标签样本编译为快速权重。通过消除记忆或上下文依赖,FAAST实现了常数时间推理,并将任务适应与预训练表示解耦。在图像分类和语言建模基准测试中,FAAST在适应时间上减少超过90%,性能达到或超越基于反向传播的适应方法;与基于记忆/上下文的适应方法相比,内存使用节省高达95%,且性能相当。这些结果表明,FAAST是一种高效、可扩展的监督任务适应方案,尤其适用于资源受限的模型。我们已在 https://github.com/baoguangsheng/faast 开源代码和模型。
查看 arXiv 页面 (https://arxiv.org/abs/2605.04651)查看 PDF (https://arxiv.org/pdf/2605.04651)GitHub3 (https://github.com/baoguangsheng/faast)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.04651)
在你的智能体中获取此论文:
hf papers read 2605\.04651
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型3
gshbao/faast-gpt2-xl 2B• 大约6小时前更新 • 11 (https://huggingface.co/gshbao/faast-gpt2-xl)
gshbao/faast-Qwen2.5-3B-Instruct 3B• 大约6小时前更新 • 14 (https://huggingface.co/gshbao/faast-Qwen2.5-3B-Instruct)
gshbao/faast-Qwen2.5-7B-Instruct 8B• 大约6小时前更新 • 1 (https://huggingface.co/gshbao/faast-Qwen2.5-7B-Instruct)
引用此论文的数据集0
暂无数据集关联此论文
请在数据集的 README.md 中引用 arxiv.org/abs/2605.04651 以在此页面添加链接。
引用此论文的 Spaces0
暂无 Space 关联此论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2605.04651 以在此页面添加链接。
包含此论文的收藏集0
暂无收藏集包含此论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以在此页面添加链接。
相似文章
学习,快与慢:走向持续适应的LLMs
一种针对LLMs的快慢学习框架,将固定的慢权重与优化的快上下文权重相结合,在持续学习场景中实现了高达3倍的样本效率提升,并减少了灾难性遗忘。
快慢学习:迈向持续适应的大语言模型 [R]
本文提出了一种用于大语言模型的快慢训练框架,该框架结合参数更新与上下文优化,以提高样本效率并减少持续学习过程中的灾难性遗忘。
@daniel_mac8: 宝贝,醒醒。最新的持续学习突破出现了。fast-slow training (FST) 将模型参数视为“慢权重”…
这条推文介绍了Fast-Slow Training (FST),一种新的持续学习方法,将模型参数视为慢权重,优化上下文视为快权重,据称在数学、代码和通用推理基准测试上全面优于仅权重训练。
@LakshyAAAgrawal: 从丰富的文本反馈(错误、轨迹、部分推理)中学习,对于LLM优化来说,优于仅使用标量奖励。…
快速-慢速训练(FST)将上下文优化(通过GEPA)与通过强化学习进行的模型权重更新交替进行,在数学、代码和物理推理上实现了比单独使用RL高3倍的样本效率,同时保持了可塑性并实现了持续学习。
联邦嵌套学习:用于测试时自适应的自指记忆协同训练
提出联邦嵌套学习(FedNL)框架,将联邦学习重构成三级嵌套优化系统,实现自指记忆的协同训练以支持测试时自适应,从而处理非独立同分布数据和长尾分布。