标签
SkalskiP 重点介绍了 Qwen3.8-Max,这是一个用于目标检测的视觉语言模型,可以通过正负框提示生成检测结果,在单个或多个提示下实现 60-80% 的 mAP,并且在不同类型的图像上表现良好。
提出DuPLeR,一种用于多模态小样本知识图谱补全的双路径大语言模型推理框架,将大语言模型导出的类型先验与事实结构相结合,以改善数据稀缺下的归纳式知识图谱补全性能。
本文介绍了面向上下文赌博机的跨域离线策略评估与学习(OPE/L),允许利用多个源域的日志数据来改进目标域中的策略评估与学习,这些目标域面临少样本数据、确定性日志策略和新动作等挑战性条件。
介绍 DriveDNA,这是一个包含来自 115 种车型的 465 名驾驶员的 4,121 次行程的大规模多模态自然驾驶数据集,以及通过小样本驾驶员重识别和个性化行为预测等任务进行驾驶风格识别的基准。
本文研究了在气候披露分类的源偏移下,LLM适配策略(定义、示例、微调)的迁移情况,发现定义等简单策略比复杂策略具有更稳定的迁移效果。
本文对五种大型语言模型在引文功能分类任务上进行了全面评估,基于微调后的 Falcon 7B 模型在 ACL-ARC 数据集上取得了新的最优结果。同时引入了 AC3 数据集,该数据集采用七类别标注方案,能够区分中性致谢与评价性立场。
Fable 5 模型仅通过4个提示词和173美元token就制作了一款名为《超级智能竞速赛》的游戏,展示了极强的生成能力。
本文挑战了重排序总是能提升少样本选择性能的假设,提出了一种无需训练的门控重排序方法,该方法利用模型不确定性来决定何时进行重排序,从而将计算成本降低15%至80%,同时略微提升性能。
本文比较了微调BERT(gbert-large)与少样本大语言模型提示(Llama 4 Maverick)在德语气候新闻句子中检测威胁与解决方案框架的效果。BERT获得了更高的F1分数(0.83 vs 0.78),消融研究表明提供前一句上下文可提升性能。
介绍 AnySimLite,一种用于设备端语音相关分类任务的轻量级相似度编码器,在模型大小不到 qLLaMA-LoRA-7B 基线的 1/250 的情况下,实现了最先进或具有竞争力的性能。
本研究探究了经过指令微调的大语言模型(Llama-3.1-8B、Qwen2.5-7B、Mistral-7B、Phi-3-mini)能否可靠地分类失语症语篇转录中的正确信息单元。少样本提示使三个模型获得了具有竞争力的F1分数(0.776–0.817),但性能因严重程度而异,且与人类标注的一致性仍不足以实现完全自主使用。
本文研究了使用基于提示学习的大语言模型进行少样本生物医学关系抽取,比较了配对分类和联合生成两种方法。最佳模型实现了0.44的微F1值,显著优于此前的少样本结果,但仍低于监督基线。在宏F1值上,基于提示的方法在稀有关系类型上超越了监督基线,达到了0.45比0.38。
PrintGuard 2.0 是对基于 ShuffleNetV2 骨干网络和原型网络的少样本 FDM 故障检测器的重大重写,现在通过平台抽象层实现了单一 Python 引擎,可在 CPython 和浏览器中的 Pyodide 上无需修改运行,支持每台打印机的灵敏度调整和公平推理调度。
本文提出LLM-GNN协同教学(LLM-GNN Co-Teaching),一种面向文本属性图的小样本图学习的双向框架。LLM和GNN交换高置信度的伪标签,并利用基于轮次的偏好优化(RPL-PO)相互改进,在基准测试上优于先前方法。
提出Demo2Reward,一种针对VLM奖励模型的测试时提示优化技术,利用少量专家演示,显著减少误报,并在无需额外模型训练的情况下改进机器人策略学习。
本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。
GraphARC是一个针对图结构数据抽象推理的新基准,将ARC范式扩展到图领域。对最新语言模型的评估揭示了理解与执行之间的差距,且在大规模实例上性能下降,凸显了扩展挑战。
本文介绍了ACIL,一种自动Chain-of-Thought框架,通过生成和修剪推理链来增强上下文学习,从而提升LLM在复杂任务上的表现。
本文探讨了使用小样本提示的大语言模型对在线患者咨询进行可操作分诊分类,分为自我护理、预约就诊、紧急临床审查或急诊转诊。最佳模型(Claude Haiku 4.5,12次小样本提示)的macro-F1达到0.475,超过了有监督基线,但作者得出结论:LLMs可以支持分诊优先级排序和选择性人工审核,但不能自主部署。
FFAvatar提出了一种前馈框架,能在数秒内从少量非摆拍图像中重建高质量、可动画的3D高斯头部头像,在NeRSemble基准测试上相比现有最优方法实现了5.5 PSNR的提升。