标签
本文提出了EchoPrompt,一种无需训练的LLM生成文本检测器,通过添加通用前缀恢复潜在提示依赖性,并衡量指令微调模型与基础模型之间的似然增益差异,实现了最先进的零样本检测性能。
本文系统研究了基于扰动的持续预训练(CPT)在提升多语言大语言模型零样本方言鲁棒性方面的作用,比较了德语、意大利语和阿拉伯语中的六种训练条件。研究发现,字符级噪声CPT是最有效的通用策略,并揭示了不同扰动方法会引发不同的鲁棒性机制。
介绍HyperODE,一种零样本替代模型,将ODE结构映射到超图,无需重新训练即可对整类动力系统进行仿真和参数推断。
介绍DE-NER,一种用于零样本命名实体识别的对话引导框架,通过提问者和角色扮演LLM之间的自我对弈来明确实体边界,相比基线平均提高了3.75%的F1值。
一项研究评估了零样本 GPT-4o-mini 在孟加拉国人口与健康调查数据中预测儿童发育迟缓的表现,并与随机森林基线进行对比,同时评估了不同人口群体间的公平性及时间稳健性。结果显示两者平衡准确率相当,但在居住地和财富类别上存在显著的公平性差异。
本文介绍了SwanTale,一个支持零样本和指令任务的统一多说话人语音与音频生成模型,以及用于数据标注的SwanData-Caption和用于高质量多音频模态生成的SwanVAE。
本文系统评估了41个开放权重语言模型(135M–9B)在8个数据集上的零样本意图分类性能,分析了准确性、校准、鲁棒性和部署效率。研究发现,经过指令调优的3B模型可以胜过7B基础模型,并且像SNIPS这样的一些基准已经饱和。
本文介绍了EC-Reason-Bench,一个无需训练的诊断基准,用于分析通用LLM为何在酶EC编号预测上失败。研究发现外部知识是关键并且必须优先于推理,而基于证据的推理充当了冲突近邻的仲裁者,而非新知识的来源。
ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。
介绍了OVEarth-Bench,一个用于开放词汇地球观测的基准,扩展了类别覆盖和查询多样性,揭示了现有方法仍有限,而基于MLLM的方法表现最佳。
MissionBench是一个新的基准测试,用于评估多模态大语言模型(MLLMs)在三维空中环境中执行长期具身任务的表现。结果显示,即使是表现最好的模型,其任务成功率也不到35%,而人类的表现达到84.4%。
介绍DWT-Fusion,一种免训练框架,通过对token级对数概率进行离散小波分析来检测LLM生成的文本,在多个数据集上取得了优异的AUROC结果。
提出一种用于零样本ICU谵妄预测的轻量化知识注入框架,该框架在推理时用外部临床知识增强结构化电子健康记录数据摘要,在无需微调的LLaMA模型上,AUROC提升高达8.57个百分点。
本文提出了一种新颖的零样本数字孪生框架,该框架将实时视觉感知与几何无关、物理驱动的图神经网络相结合。该方法采用热力学驱动的图神经网络,强制执行能量守恒和熵产生,从而无需重新训练即可在未见过的几何体上实现物理准确的模拟。
本文对五种大型语言模型在引文功能分类任务上进行了全面评估,基于微调后的 Falcon 7B 模型在 ACL-ARC 数据集上取得了新的最优结果。同时引入了 AC3 数据集,该数据集采用七类别标注方案,能够区分中性致谢与评价性立场。
Delineate Anything v2 是一个全球可扩展的农田地块边界映射基础模型,在 [email protected] 上相对提升 103.3%,超越现有最佳水平。该模型使用了涵盖 61 个国家、7300 万实例的多分辨率数据集,并建立了一个手工筛选的 100 国评估基准。
本文提出了一种上下文增强提示框架,利用图神经网络专家模型提供预测提示和解释性子图,以改进小型语言模型中的分子性质预测。在MUTAG和Tox21上的实验显示,与仅使用SMILES的基线相比,准确率提升高达74%。
SUFLECA是一个弱监督框架,用于零样本CAD到图像对齐,通过从预训练视觉表示中扩大基于几何的特征学习,在ScanNet25k上实现了最先进的准确率。
本研究提出了一种基于特征引导的零样本框架,利用大语言模型进行早期慢性肾病筛查,在异构数据集上使用最少的社区可获取特征实现了一致的改进。