标签
本文介绍了 Spatial Memory Agent (SMA),一种运行时框架,通过验证器引导的反思和可复用记忆,在不进行参数更新或使用外部工具的情况下提升冻结视觉语言模型的空间推理能力,在五个基准和四个基础 VLM 上取得了强劲的结果。
本文介绍了一个冻结的12B模型,该模型利用已验证解决方案的持久内存,在已解决问题族上以零生成token实现100%准确率,并在单个46GB GPU上展示了600万token的可移动窗口。
一个冻结的120亿参数模型,结合了已验证解决方案的持久记忆,在九个问题家族超过180个实例上实现了100%准确率,使用零生成token,精确比特的确定性输出,在已解决任务上超越前沿模型,且计算消耗可忽略不计。
文章讨论了 Hugging Face 的一个实验:一个自动循环仅重写冻结模型周围的代码(工具层),在不改变模型权重的情况下,将其基准分数从 0% 提升到接近 Sonnet 4.6 的水平,且成本更低。这证明许多基准测试失败源于工具层,而非模型本身。
本文介绍了δ-mem,一种轻量级在线记忆机制,它通过delta规则学习更新的紧凑型关联记忆状态来增强冻结的LLM,在记忆密集型基准测试中取得了显著改进,无需微调或上下文扩展。