标签
这篇arXiv论文研究了简单的线性变换是否能在九个异构文本嵌入模型之间转换表示,发现共享结构和可迁移性共同取决于架构、训练目标、池化方法和数据分布,对普遍潜在兼容性的观念提出了挑战。
本文介绍了Rift,一种利用隐藏状态的残差秩来检测语言模型欺骗性响应的方法。该方法在多种欺骗类型、模型家族和语言中实现了完美分离,并在无需重新训练的情况下展示了跨家族的零样本迁移能力。