标签
本文推导了资源充足学习中精确的任务信息-状态前沿,展示了有限的先验任务信息如何通过低秩算子的分区减少保留状态,并应用于注意力和数字孪生模型。
这条推文表达了对 DSV4.1 中 Engram 表格的兴奋之情,强调了它们在压缩和缓存技术中的作用。
介绍Ternary Bonsai 2 27B,这是一个高度压缩的AI模型,在占用空间缩小9倍的同时保留了98.2%的性能,使得推理、编码和多模态处理等任务能够高效地在本地部署。
本文分析了DeepSeek-V4.1 Flash模型,详细介绍了其关于KV缓存压缩的技术报告和架构优化,这些优化实现了高效的长上下文处理和高速推理。
本文解释了为什么机器学习研究代理在迭代基准测试评估中避免过拟合,将这一现象归因于压缩以及少量令牌拟合在泛化中的作用。
本文提出了一种使用固定随机样本来模拟离散到连续信道的可扩展方法,提高了在可变速率压缩和差分隐私分布式估计应用中的效率。
本文将Transformer表示更新分解为平行和垂直分量,以研究演化几何,并将其与编辑鲁棒性、压缩诊断和训练改进联系起来。
宣布在 Hugging Face 的 Agent Collaborations 上的 Hutter Prize 挑战,AI 代理协作寻找终极无损压缩算法。
X-AuT是一个渐进式框架,用于压缩语音大语言模型中的音频编码器层,通过跨尺度蒸馏和LoRA适配等技术,在降低推理成本的同时恢复准确性。
介绍了生成式后期交互嵌入(GLIE),用于压缩视觉文档检索向量,通过按需重新生成完整嵌入来提高存储约束下的准确性。
一种名为TAK的新任务感知量化方法,在显著减小模型尺寸的情况下,实现了接近BF16的推理性能,在多种AI模型上超越了Unsloth。
BZip3 是一种高性能的压缩工具,与前驱 BZip2 相比,提供更优的压缩率和速度,利用先进的算法如上下文混合熵编码和 Burrows-Wheeler 变换。
Cadence 提出了一种使用基础模型和自适应算术编码器的有界误差有损压缩方法,用于时间序列,相比经典预测器实现了显著性能提升。
本文研究了AI模型解码时KV缓存压缩中时间聚合和排序保持的重要性,并引入InertiaKV方法以提高解码吞吐量。
本文提出了ECCBench,一个用于评估视觉-语言模型记忆能力的基准和评估框架,超越准确率指标,聚焦于效率、压缩与校准三个维度。
SkillZip Pro 是一种用于生产代理技能包的压缩方法,可将令牌使用量减少38%且不损失质量,从而提高人工智能代理部署的效率。