标签
Audio8 TTS Preview 0.1b 是一个紧凑的零样本文本转语音模型,主模型拥有约1.7亿参数,支持语音克隆和多语言。
Roboflow Playground 是一款新的开发者工具,能够对超过30种计算机视觉模型进行并排比较,涵盖目标检测和分类等任务,从而简化评估流程。
TinyCast 是一款紧凑的零样本时间序列基础模型,具有计算周期功能,可在 Cortex-M7 等边缘设备上实现高效的概率预测。
This paper compares natively multimodal embedding models (Gemini Embedding 2, Amazon Nova 2) against frontier LLMs (GPT-4.1, Claude Sonnet 4.6) for hard-negative text-to-image retrieval, finding comparable accuracy but much lower latency for embedding-based ranking.
This paper introduces a continuous metric field framework trained by a single causal contrastive loss that unifies geometric structure discovery from robot navigation to black hole emergence, demonstrating zero-shot generalization across dimensions.
本文提出了EchoPrompt,一种无需训练的LLM生成文本检测器,通过添加通用前缀恢复潜在提示依赖性,并衡量指令微调模型与基础模型之间的似然增益差异,实现了最先进的零样本检测性能。
本文系统研究了基于扰动的持续预训练(CPT)在提升多语言大语言模型零样本方言鲁棒性方面的作用,比较了德语、意大利语和阿拉伯语中的六种训练条件。研究发现,字符级噪声CPT是最有效的通用策略,并揭示了不同扰动方法会引发不同的鲁棒性机制。
介绍HyperODE,一种零样本替代模型,将ODE结构映射到超图,无需重新训练即可对整类动力系统进行仿真和参数推断。
介绍DE-NER,一种用于零样本命名实体识别的对话引导框架,通过提问者和角色扮演LLM之间的自我对弈来明确实体边界,相比基线平均提高了3.75%的F1值。
一项研究评估了零样本 GPT-4o-mini 在孟加拉国人口与健康调查数据中预测儿童发育迟缓的表现,并与随机森林基线进行对比,同时评估了不同人口群体间的公平性及时间稳健性。结果显示两者平衡准确率相当,但在居住地和财富类别上存在显著的公平性差异。
本文介绍了SwanTale,一个支持零样本和指令任务的统一多说话人语音与音频生成模型,以及用于数据标注的SwanData-Caption和用于高质量多音频模态生成的SwanVAE。
本文系统评估了41个开放权重语言模型(135M–9B)在8个数据集上的零样本意图分类性能,分析了准确性、校准、鲁棒性和部署效率。研究发现,经过指令调优的3B模型可以胜过7B基础模型,并且像SNIPS这样的一些基准已经饱和。
本文介绍了EC-Reason-Bench,一个无需训练的诊断基准,用于分析通用LLM为何在酶EC编号预测上失败。研究发现外部知识是关键并且必须优先于推理,而基于证据的推理充当了冲突近邻的仲裁者,而非新知识的来源。
ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。
介绍了OVEarth-Bench,一个用于开放词汇地球观测的基准,扩展了类别覆盖和查询多样性,揭示了现有方法仍有限,而基于MLLM的方法表现最佳。
MissionBench是一个新的基准测试,用于评估多模态大语言模型(MLLMs)在三维空中环境中执行长期具身任务的表现。结果显示,即使是表现最好的模型,其任务成功率也不到35%,而人类的表现达到84.4%。
介绍DWT-Fusion,一种免训练框架,通过对token级对数概率进行离散小波分析来检测LLM生成的文本,在多个数据集上取得了优异的AUROC结果。
提出一种用于零样本ICU谵妄预测的轻量化知识注入框架,该框架在推理时用外部临床知识增强结构化电子健康记录数据摘要,在无需微调的LLaMA模型上,AUROC提升高达8.57个百分点。
本文提出了一种新颖的零样本数字孪生框架,该框架将实时视觉感知与几何无关、物理驱动的图神经网络相结合。该方法采用热力学驱动的图神经网络,强制执行能量守恒和熵产生,从而无需重新训练即可在未见过的几何体上实现物理准确的模拟。
本文对五种大型语言模型在引文功能分类任务上进行了全面评估,基于微调后的 Falcon 7B 模型在 ACL-ARC 数据集上取得了新的最优结果。同时引入了 AC3 数据集,该数据集采用七类别标注方案,能够区分中性致谢与评价性立场。