zero-shot

标签

Cards List
#zero-shot

一次响应,始终响应:通过潜在提示恢复检测LLM生成的文本

arXiv cs.CL · 2天前 缓存

本文提出了EchoPrompt,一种无需训练的LLM生成文本检测器,通过添加通用前缀恢复潜在提示依赖性,并衡量指令微调模型与基础模型之间的似然增益差异,实现了最先进的零样本检测性能。

0 人收藏 0 人点赞
#zero-shot

不同扰动,不同机制:理解面向零样本方言鲁棒性的持续预训练

arXiv cs.CL · 2天前 缓存

本文系统研究了基于扰动的持续预训练(CPT)在提升多语言大语言模型零样本方言鲁棒性方面的作用,比较了德语、意大利语和阿拉伯语中的六种训练条件。研究发现,字符级噪声CPT是最有效的通用策略,并揭示了不同扰动方法会引发不同的鲁棒性机制。

0 人收藏 0 人点赞
#zero-shot

HyperODE:动力系统仿真与推断的零样本替代模型

arXiv cs.LG · 5天前 缓存

介绍HyperODE,一种零样本替代模型,将ODE结构映射到超图,无需重新训练即可对整类动力系统进行仿真和参数推断。

0 人收藏 0 人点赞
#zero-shot

DE-NER:通过大型语言模型的对话引导实现零样本命名实体识别

arXiv cs.CL · 5天前 缓存

介绍DE-NER,一种用于零样本命名实体识别的对话引导框架,通过提问者和角色扮演LLM之间的自我对弈来明确实体边界,相比基线平均提高了3.75%的F1值。

0 人收藏 0 人点赞
#zero-shot

零样本大语言模型能否预测儿童营养不良?公平性与时间稳健性研究

arXiv cs.CL · 6天前 缓存

一项研究评估了零样本 GPT-4o-mini 在孟加拉国人口与健康调查数据中预测儿童发育迟缓的表现,并与随机森林基线进行对比,同时评估了不同人口群体间的公平性及时间稳健性。结果显示两者平衡准确率相当,但在居住地和财富类别上存在显著的公平性差异。

0 人收藏 0 人点赞
#zero-shot

SwanTale:面向指令和零样本任务的统一多说话人语音与音频生成

Hugging Face Daily Papers · 2026-08-03 缓存

本文介绍了SwanTale,一个支持零样本和指令任务的统一多说话人语音与音频生成模型,以及用于数据标注的SwanData-Caption和用于高质量多音频模态生成的SwanVAE。

0 人收藏 0 人点赞
#zero-shot

选择开放权重语言模型进行零样本意图分类:41个模型的系统评估

arXiv cs.CL · 2026-07-31 缓存

本文系统评估了41个开放权重语言模型(135M–9B)在8个数据集上的零样本意图分类性能,分析了准确性、校准、鲁棒性和部署效率。研究发现,经过指令调优的3B模型可以胜过7B基础模型,并且像SNIPS这样的一些基准已经饱和。

0 人收藏 0 人点赞
#zero-shot

知识先于推理:EC-Reason-Bench,一个无需训练的LLM酶分类诊断基准

arXiv cs.CL · 2026-07-30 缓存

本文介绍了EC-Reason-Bench,一个无需训练的诊断基准,用于分析通用LLM为何在酶EC编号预测上失败。研究发现外部知识是关键并且必须优先于推理,而基于证据的推理充当了冲突近邻的仲裁者,而非新知识的来源。

0 人收藏 0 人点赞
#zero-shot

基于记忆的推理:一种时间粒度自适应的免训练长视频理解框架

arXiv cs.AI · 2026-07-29 缓存

ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。

0 人收藏 0 人点赞
#zero-shot

OVEarth-Bench:评估开放词汇地球观测的类别广度与查询多样性

Hugging Face Daily Papers · 2026-07-29 缓存

介绍了OVEarth-Bench,一个用于开放词汇地球观测的基准,扩展了类别覆盖和查询多样性,揭示了现有方法仍有限,而基于MLLM的方法表现最佳。

0 人收藏 0 人点赞
#zero-shot

空中MLLM智能体的零样本任务级评估

arXiv cs.CL · 2026-07-27 缓存

MissionBench是一个新的基准测试,用于评估多模态大语言模型(MLLMs)在三维空中环境中执行长期具身任务的表现。结果显示,即使是表现最好的模型,其任务成功率也不到35%,而人类的表现达到84.4%。

0 人收藏 0 人点赞
#zero-shot

DWT-Fusion: 一种基于信号的免训练LLM生成文本检测框架

arXiv cs.CL · 2026-07-27 缓存

介绍DWT-Fusion,一种免训练框架,通过对token级对数概率进行离散小波分析来检测LLM生成的文本,在多个数据集上取得了优异的AUROC结果。

0 人收藏 0 人点赞
#zero-shot

一种用于LLM零样本适应谵妄预测的知识注入框架

arXiv cs.CL · 2026-07-24 缓存

提出一种用于零样本ICU谵妄预测的轻量化知识注入框架,该框架在推理时用外部临床知识增强结构化电子健康记录数据摘要,在无需微调的LLaMA模型上,AUROC提升高达8.57个百分点。

0 人收藏 0 人点赞
#zero-shot

面向零样本数字孪生的图神经网络方法

arXiv cs.LG · 2026-07-24 缓存

本文提出了一种新颖的零样本数字孪生框架,该框架将实时视觉感知与几何无关、物理驱动的图神经网络相结合。该方法采用热力学驱动的图神经网络,强制执行能量守恒和熵产生,从而无需重新训练即可在未见过的几何体上实现物理准确的模拟。

0 人收藏 0 人点赞
#zero-shot

用于引文功能分类的大型语言模型

arXiv cs.CL · 2026-07-21 缓存

本文对五种大型语言模型在引文功能分类任务上进行了全面评估,基于微调后的 Falcon 7B 模型在 ACL-ARC 数据集上取得了新的最优结果。同时引入了 AC3 数据集,该数据集采用七类别标注方案,能够区分中性致谢与评价性立场。

0 人收藏 0 人点赞
#zero-shot

Delineate Anything v2: 一个用于农田地块分割的全球基础模型

Hugging Face Daily Papers · 2026-07-21 缓存

Delineate Anything v2 是一个全球可扩展的农田地块边界映射基础模型,在 [email protected] 上相对提升 103.3%,超越现有最佳水平。该模型使用了涵盖 61 个国家、7300 万实例的多分辨率数据集,并建立了一个手工筛选的 100 国评估基准。

0 人收藏 0 人点赞
#zero-shot

使用BERT进行候选参与的对话状态追踪

arXiv cs.CL · 2026-07-20 缓存

本文提出了一个使用BERT的可扩展多领域对话状态追踪框架,实现了零样本泛化,并在SGD数据集上提升了性能。

0 人收藏 0 人点赞
#zero-shot

利用基于图的工具改进小型语言模型中的分子性质预测

arXiv cs.AI · 2026-07-16 缓存

本文提出了一种上下文增强提示框架,利用图神经网络专家模型提供预测提示和解释性子图,以改进小型语言模型中的分子性质预测。在MUTAG和Tox21上的实验显示,与仅使用SMILES的基线相比,准确率提升高达74%。

0 人收藏 0 人点赞
#zero-shot

SUFLECA:扩大特征学习以实现CAD到图像对齐

Hugging Face Daily Papers · 2026-07-16 缓存

SUFLECA是一个弱监督框架,用于零样本CAD到图像对齐,通过从预训练视觉表示中扩大基于几何的特征学习,在ScanNet25k上实现了最先进的准确率。

0 人收藏 0 人点赞
#zero-shot

从繁多到有意义:利用大语言模型进行特征引导的零样本慢性肾病筛查

arXiv cs.LG · 2026-07-15 缓存

本研究提出了一种基于特征引导的零样本框架,利用大语言模型进行早期慢性肾病筛查,在异构数据集上使用最少的社区可获取特征实现了一致的改进。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈