标签
本文研究大语言模型的不确定性与人类不确定性的相似程度,探讨LLMs在多个数据集上的对齐、校准和激活模式,以及指令微调的影响。
本文介绍了 MiA-Signature,这是一种大语言模型(LLM)中全局激活模式的压缩表示,旨在提升长上下文理解能力。该方法提出使用基于次模性的选择策略来近似完整的激活状态,从而在检索增强生成(RAG)和智能体系统中带来性能提升。
LongAct 提出了一种显著性引导的稀疏更新策略,通过选择性更新与查询和键向量中高幅值激活相关的权重来改进 LLMs 的长上下文推理能力,在 LongBench v2 上实现了约 8% 的提升。