标签
本文表明,用于个性化冻结大语言模型的提示空间元学习在不同用户间无法迁移,因为元验证目标对用户与支持的对应关系在统计上不变,导致相比种子提示或控制组无显著改进。
本文提出一个负面结果,表明当前知识编辑基准无法有效评估范围分类器。使用INLAY(一个无梯度编辑器)来演示,由于基准的结构性限制,没有逐查询路由方法能提高性能。
本文提出了一项关于训练Mixture-of-Experts路由器以实现缓存局部性对抗内存带宽墙的预注册负面结果,表明尽管采用了训练机制,未命中率降低与语言建模质量之间存在权衡。
本文介绍了VectraYX-Vision-1B,一个面向西班牙语/拉美网络安全影像的亚20亿参数视觉语言模型,但报告了一项负面的视觉定位结果,引发了关于NoPE层的架构问题,并发布了代码、基准测试和检查点。
本文研究了PEFT-BD,这是一种推测解码方法,使用类似LoRA的适配器作为块扩散起草器,并发现尽管接受的前缀数量可观,但由于起草器仍需进行完整的骨干前向计算,因此并未加速,即计算效率不高。
本文研究了逐阶段度量选择是否能改善行为克隆策略的演示筛选。作者发现,阶段门控筛选从未优于全局或统一度量应用,并且缺陷信号在各阶段间的稀释是失败的原因。
本文研究语言模型之间直接激活迁移是否能改善推理能力,使用从Pythia-160M到Pythia-410M的线性翻译层。尽管实现了高表示对齐,但迁移的激活并未改善多跳问答,产生了负面结果。