标签
Fable 5 模型仅通过4个提示词和173美元token就制作了一款名为《超级智能竞速赛》的游戏,展示了极强的生成能力。
本文挑战了重排序总是能提升少样本选择性能的假设,提出了一种无需训练的门控重排序方法,该方法利用模型不确定性来决定何时进行重排序,从而将计算成本降低15%至80%,同时略微提升性能。
本文比较了微调BERT(gbert-large)与少样本大语言模型提示(Llama 4 Maverick)在德语气候新闻句子中检测威胁与解决方案框架的效果。BERT获得了更高的F1分数(0.83 vs 0.78),消融研究表明提供前一句上下文可提升性能。
介绍 AnySimLite,一种用于设备端语音相关分类任务的轻量级相似度编码器,在模型大小不到 qLLaMA-LoRA-7B 基线的 1/250 的情况下,实现了最先进或具有竞争力的性能。
本研究探究了经过指令微调的大语言模型(Llama-3.1-8B、Qwen2.5-7B、Mistral-7B、Phi-3-mini)能否可靠地分类失语症语篇转录中的正确信息单元。少样本提示使三个模型获得了具有竞争力的F1分数(0.776–0.817),但性能因严重程度而异,且与人类标注的一致性仍不足以实现完全自主使用。
本文研究了使用基于提示学习的大语言模型进行少样本生物医学关系抽取,比较了配对分类和联合生成两种方法。最佳模型实现了0.44的微F1值,显著优于此前的少样本结果,但仍低于监督基线。在宏F1值上,基于提示的方法在稀有关系类型上超越了监督基线,达到了0.45比0.38。
PrintGuard 2.0 是对基于 ShuffleNetV2 骨干网络和原型网络的少样本 FDM 故障检测器的重大重写,现在通过平台抽象层实现了单一 Python 引擎,可在 CPython 和浏览器中的 Pyodide 上无需修改运行,支持每台打印机的灵敏度调整和公平推理调度。
本文提出LLM-GNN协同教学(LLM-GNN Co-Teaching),一种面向文本属性图的小样本图学习的双向框架。LLM和GNN交换高置信度的伪标签,并利用基于轮次的偏好优化(RPL-PO)相互改进,在基准测试上优于先前方法。
提出Demo2Reward,一种针对VLM奖励模型的测试时提示优化技术,利用少量专家演示,显著减少误报,并在无需额外模型训练的情况下改进机器人策略学习。
本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。
GraphARC是一个针对图结构数据抽象推理的新基准,将ARC范式扩展到图领域。对最新语言模型的评估揭示了理解与执行之间的差距,且在大规模实例上性能下降,凸显了扩展挑战。
本文介绍了ACIL,一种自动Chain-of-Thought框架,通过生成和修剪推理链来增强上下文学习,从而提升LLM在复杂任务上的表现。
本文探讨了使用小样本提示的大语言模型对在线患者咨询进行可操作分诊分类,分为自我护理、预约就诊、紧急临床审查或急诊转诊。最佳模型(Claude Haiku 4.5,12次小样本提示)的macro-F1达到0.475,超过了有监督基线,但作者得出结论:LLMs可以支持分诊优先级排序和选择性人工审核,但不能自主部署。
FFAvatar提出了一种前馈框架,能在数秒内从少量非摆拍图像中重建高质量、可动画的3D高斯头部头像,在NeRSemble基准测试上相比现有最优方法实现了5.5 PSNR的提升。
FEST是一种少样本演示引导的强化学习算法,通过结合监督信号、在线策略学习和加权训练以防止过拟合,仅需极少的监督微调数据即可实现强劲性能。
独立研究表明,在 3B Llama 的工具使用中,227M 参数的超网络相比精心设计的少样本提示毫无增益,仅用 1/10 延迟即可达到 GPT-5 性能的 79.7%。
FSPO提出了一种用于大语言模型个性化的少样本偏好优化算法,该算法将奖励建模重新定义为元学习,使模型能够从有限的用户偏好中快速推断出个性化的奖励函数。该方法通过精心构建合成偏好数据集,在合成用户上实现了87%的个性化性能,在真实用户上实现了70%的个性化性能。