标签
本文研究了在由语言模型组成的多模块神经系统中,限制证据可见性如何提高组合泛化能力,表明在接力通信设置中,受限可见性社会比全局可见社会性能高出超过20个百分点。
本文提出了一种针对语言模型内部动作映射的校准测试,展示了在无全局仿射闭包的情况下,状态信号可被解码并因果使用,通过证据格框架在有限世界和Qwen3-4B模型上进行了验证。
这篇博客文章认为,语言模型中更好的泛化应来自'框架'(即接口程序),而非仅仅扩展训练数据。实验表明,递归语言模型框架能够实现远超基础Transformer的长度和领域泛化。
InternVLA-A1.5 将预训练的视觉语言模型与潜在空间中的未来预测相结合,以实现具有组合泛化和长视界执行能力的高效机器人操作,在模拟基准测试中取得了最先进的结果。
本文研究了阻碍零样本组合动作识别中组合泛化能力的物体驱动捷径,提出了RCORE来缓解动词塌缩并提升未见组合的泛化能力。
本文从理论上分析了课程学习通过将复杂问题分解为更简单的子问题并组合解决方案,如何显著降低学习模拟顺序计算(半自动机)的样本复杂度——相较于直接方法,在监督微调中实现次多项式监督需求,并在可验证奖励的强化学习中实现指数级更弱的覆盖条件。
本文形式化了‘组合行为泄漏’(CBL),这是提示组合型智能体系统中的一种故障模式:由于Transformer自注意力机制缺乏模块级隔离,编辑一个提示模块会静默改变其他模块的行为。本文提出了一个可操作的定义、一个可复用的三通道协议,以及在Claude Sonnet 4.6智能体上进行的144次试验的实证证据,发现了亚阈值干扰,这种干扰可能在数千个决策中累积。
本文提出对抗性概念搜索(Adversarial Concept Search),一种利用大型语言模型表示几何来预测组合性失败的方法,无需评估特定输入。该方法通过测量显著特征之间的干扰来识别高风险场景。