标签
本文提出了一个框架来测试LLM估计是否在不同子群体间遵循统计自一致性(全概率定理),发现了广泛的违反以及“宏观谬误”,即细粒度估计与人类数据的一致性更好。
一位研究人员讨论了LLMs中的持续学习挑战,将其比作健忘的实习生,并探索了扩展上下文窗口、构建有状态记忆以及将上下文压缩为潜在表示等方法,引用了他们在Still上的工作。
本文提出了一种自演化上下文学习框架,用于多用户MISO系统中直接导频到波束成形的设计。该框架集成了Transformer骨干网络、导频编码器-解码器网络和课程学习,无需重新训练即可处理多种信道模型。
本文评估了最先进的表格模型作为编码器在图像-表格多模态学习中的表现,解决了使用需要标签来嵌入训练和测试实例的上下文学习模型所面临的挑战。
REBASE 是一个无需训练框架,通过将特征投影到低秩背景子空间的正交补上,抑制情境分割中的伪上下文对应,在多个数据集上达到了无需训练方法中的最佳性能。
AbICL提出了一种面向抗原特异性抗体亲和力排序的上下文学习框架,将预训练的结构编码器与上下文排序头相结合,利用带标签的演示进行测试时自适应,无需梯度更新。
TOFFEE是一个系统,它采用带有自适应模型选择和跨任务前缀重用的蒙特卡洛树搜索(Monte Carlo Tree Search),大规模合成高质量的数据代理轨迹。这些轨迹可用于微调或上下文学习,以提升数据代理在异构企业环境中的性能。
Anjney Midha 反思了上下文学习在人工智能和生活中的价值,回忆起他在 2021 年投资 Anthropic 种子轮的经历,称这是一个直观但经常被误解的概念。
本文研究了在马尔可夫链上训练的Transformer,发现归纳头实现了软上下文匹配和狄利克雷风格平滑,表明Transformer对上下文内估计进行正则化,而不是简单地统计n-gram。
这篇论文研究了记忆架构如何影响玩刘易斯信号游戏的LLM智能体中语言的涌现,发现持久化的私有笔记本记忆优于无状态智能体,并防止高容量崩溃。
本文从理论上分析了领域泛化下线性Transformer的上下文学习,建立了与维度无关的收敛速率,并提出了用于线性化预训练softmax大语言模型的新型激活和损失设计。
本文研究了使用上下文学习的表格基础模型中的参数化记忆现象,提出了一种探测框架(IclMem)来分离基于上下文的预测与记忆。发现在特定条件下存在适度的记忆信号,但在现实训练场景下基本消失。
该论文提出贝叶斯上下文实验者(Bayesian in-context experimenters),通过训练Transformer模仿贝叶斯后验Neyman教师策略,实现自适应平均处理效应(ATE)估计,并采用混合专家Transformer处理未知平滑性,理论证明可通过监督预训练学习该策略。
本文研究了在合成因果表上预训练的表格上下文学习模型能否从有限的标注数据泛化到生物分子性质的预测。作者发现,这些模型在蛋白质适应性回归任务上具有竞争力,但在小分子分类中,表示选择至关重要。
本文挑战了重排序总是能提升少样本选择性能的假设,提出了一种无需训练的门控重排序方法,该方法利用模型不确定性来决定何时进行重排序,从而将计算成本降低15%至80%,同时略微提升性能。
Google Research 推出了 TabFM,这是一种用于表格数据的零样本基础模型,利用上下文学习来执行分类和回归任务,无需手动训练模型或调整超参数。
本文提出LC-ICL,一种新颖的少样本技术,它同时使用正确和错误的示例以及错误原因标签,以提升大型语言模型在信息抽取任务(如命名实体识别和关系抽取)上的性能。
本文测试了LLMs在上下文问答中判断能力优于生成能力的假设,发现在大多数基准上生成准确率超过自我评估,且评估过程对上下文的关注较少。这些发现挑战了自我评估流程中的核心假设。
文章认为,在多样化的强化学习环境中对数百万可验证任务进行AI训练可能实现通用人工智能,并且扩展规模可能克服当前如样本效率低下等限制。文章还探讨了由于缺乏可重复训练的环境,计算机使用方面的进展为何较为缓慢。
本文评估了表格基础模型在微生物组数据中受生物学启发的分布偏移下的鲁棒性,发现保护判别特征不足以保证稳定性,且零填充是最有害的扰动。