标签
This paper establishes theoretical bounds on the number of attention heads needed to produce vector representations that support multiple tasks, such as computing min/max and XOR, showing trade-offs between head count, embedding dimension, and precision.
本文将Funder的人格三元框架适配到大语言模型(LLM),利用稀疏自编码器发现并验证类似特质的内部表征,并通过特征层面的干预展示可控的双向行为偏移。
本文表明,大型语言模型在内部编码了临床证据对主张的强度,但在被询问时未能准确表达这一强度,其陈述的证据等级表现近乎随机。
本文引入了'脆弱性'这一探测精度的补充指标,它衡量导致探测精度崩溃的激活噪声水平,从而能够在精度饱和后分析LLM预训练过程中的表示演化。
本文研究了词汇重叠(而非语义内容)如何影响跨层和跨架构的大语言模型表示,并证明即使在为语义相似性训练的模型中,这种词汇效应依然存在,导致下游任务性能下降。
本文研究了是否可以通过无监督几何方法对齐不同被试视觉皮层的fMRI表示,发现了个体间近似等距结构的证据,将柏拉图式表示假说扩展到人脑。
新论文表明,后期交互检索模型的表示可替代原始文档文本,在RAG任务中拓展其应用边界。