标签
Delineate Anything v2 是一个全球可扩展的农田地块边界映射基础模型,在 [email protected] 上相对提升 103.3%,超越现有最佳水平。该模型使用了涵盖 61 个国家、7300 万实例的多分辨率数据集,并建立了一个手工筛选的 100 国评估基准。
本文提出了一种上下文增强提示框架,利用图神经网络专家模型提供预测提示和解释性子图,以改进小型语言模型中的分子性质预测。在MUTAG和Tox21上的实验显示,与仅使用SMILES的基线相比,准确率提升高达74%。
SUFLECA是一个弱监督框架,用于零样本CAD到图像对齐,通过从预训练视觉表示中扩大基于几何的特征学习,在ScanNet25k上实现了最先进的准确率。
本研究提出了一种基于特征引导的零样本框架,利用大语言模型进行早期慢性肾病筛查,在异构数据集上使用最少的社区可获取特征实现了一致的改进。
本文介绍了RINO(RGB In and RGB Out),一个统一框架,将各种视觉信息(如掩码、深度图等)表示为RGB图像,并将视觉任务转换为RGB到RGB的图像编辑,从而让单一模型能够在任务间进行零样本迁移。
本文介绍了SpectraReward,一种无需训练的奖励函数,利用预训练的多模态大语言模型(MLLM)作为文本到图像生成中强化学习的零样本奖励模型,在多项指标上持续优于先前方法。
Zer0Fit 提供了一个MCP服务器,该服务器封装了Google的TabFM和TimesFM基础模型,用于零样本预测、分类和回归任务,完全在本地运行。
Jet-Long提出了一种无需微调的零样本方法,通过动态调整RoPE缩放来扩展LLM上下文长度,在高达128K上下文的基准测试中取得了强劲性能,且推理开销极小。
MASTE是一个四阶段多智能体流水线,用于零样本文本情感三元组抽取,在不使用标注数据的情况下,显著优于零样本和思维链基线方法。
介绍RMISC,一个包含约200个数据集和1420亿个时间点的大规模真实世界多变量时间序列语料库,并证明在真实世界多变量数据上预训练时间序列基础模型相比合成数据能提升零样本泛化能力。
介绍了Jet-Long,一种用于长上下文扩展的零样本方法,该方法动态调整重缩放因子并使用双焦点注意力机制,无需重新训练即可在不同序列长度上实现高效高性能处理。
GRAFT是一种用于零样本文本到语音的逐词发音调节机制,它利用目标单词的语音样本来控制其发音,在多种语言中显著降低了目标单词的音素错误率,同时保持了说话人相似度。
论文引入了Telescope Perplexity这一指标,通过测量标记重复概率以零样本方式检测LLM生成的文本,在多个数据集上实现了最先进或具有竞争力的性能。
本文研究了利用大型语言模型(LLM)重写碎片化对话话语以改进冻结的篇章解析器,发现零样本澄清不可靠,且通过重写进行错误修复存在实际上限,表明可重写性预测是一项缺失的关键能力。
本文介绍了一种零样本时间序列基础模型,应用于功能MRI与合成信号的预测和因果关系分析。
本文对三种大语言模型(Claude、GPT-5.4、Gemini)在13类情感分类任务上进行了零样本评估,发现所有模型的准确率均未超过39.9%,并揭示了在爱、困惑、羞耻等特定情感上的系统性失败。
介绍了一种无需训练的零样本组合图像检索框架PEC-CIR,该框架采用Planner-Executor-Critic架构,通过将查询构建组织为多阶段推理流程来提高检索精度。
本文通过翻译SemEval-2010 Task 8基准数据集,并在零样本、少样本和QLoRA微调条件下评估Gemma 4,与更小的编码器基线进行比较,研究针对罗马尼亚语的跨语言关系抽取。
介绍MetaFlow,一种通过结合监督微调和带执行反馈的强化学习来训练大语言模型为零样本任务生成工作流的方法,实现对未训练任务和算子集的强大泛化能力。