标签
本文提出了一种基于语言生产认知模型的无数据通用句法结构先验,证明其在138种语言中为已验证的树分配更高的概率,并与特定语言数据相关。
AoH is a data-free method that identifies retrieval and streaming heads from the spectral geometry of query-key projections, enabling sparse attention without runtime attention scores. At 50% sparsity it retains 96.5% of full-attention performance while reducing prefill/decode latency and KV-cache memory.
提出一种无标签数据的元学习方法,通过将预训练模型的软标签分配给未标注数据来生成任务,避免了计算昂贵的模型逆推。与最先进的DFML方法相比,实现了高达104倍的加速和8.4%-36.4%的准确率提升。
介绍贝叶斯模型合并(BMM),这是一个即插即用的双层优化框架,用于将多个任务特定的专家模型合并为一个单一模型,在视觉和语言基准测试上实现了最先进的性能。