标签
本文提出了一种名为SRCF的攻击方法,该方法通过反向对齐少样本对话来引导大型推理模型(LRMs)产生不安全或拒绝行为,并提出了一种名为ARCF的后训练防御机制,该机制在不降低效用的情况下增强了安全性和有用性。
ClusterFewshot是一种新颖的方法,通过集成语义聚类和效用评分来改进大语言模型工作流中的少样本示范选择,从而降低优化成本并提高基于DSPy的管道的准确性。
本文提出了一种称为Summarize-Judge-Refine(SJR)的双模型架构,用于多模态内容审核。该架构通过自然语言摘要解耦内容理解与策略学习,实现了显著的性能提升和少样本策略适配。
一位用户分享了一个生产用例,其中 Jev 工具高效地重新标记了 2300 篇 AI 研究论文,具有高准确性和低成本,改进了先前的分类方法。
本文介绍了Embed-TTT,一种两步式测试时训练协议,通过首先微调任务嵌入,然后微调骨干网络,来改进类ARC任务中的规则归纳,从而更好地与底层规则对齐,并在ARC-AGI-1和ConceptARC等基准测试上提升性能。
本文通过引入随机文本控制来挑战语言模型中少样本退化的扭曲假说,表明表示偏移主要由提示长度引起,而具有更高内容增量的模型从少样本提示中获益更多。
ALPINE 介绍了一种超轻量级的空间关系架构,用于小样本图像分类,与基线模型如 Prototypical Networks 和 MAML 相比,它用更少的参数实现了精度提升,收敛更快,鲁棒性更好。
本文提出了 Convergent Emergence Hypothesis,指出少样本上下文学习在跨模态难度剖面上具有共同性,并通过六种模态的实验提供实证支持,显示其中五种模态存在相关性效应。
本文介绍了迭代顺序迁移(IST)来解决在严格评估预算下小样本多目标多任务优化中的知识迁移挑战,采用基于似然的任务优先排序机制。
IBM研究人员介绍了STAIR,一种使用目录来保持文档结构的生成式检索器,实现了82.6%的Recall@1,并降低了RAG系统中的幻觉。
PiPMRE是一种用于医学关系提取的新型管道框架,它使用关系生成器和过滤器来增强性能,在公共数据集上超越了先前的最先进方法。
Gen1-5机器人基础模型展示了前所未有的即时学习、少样本学习和物理泛化能力,能通过简短演示快速掌握新任务并即兴创造使用工具。
本文介绍了 Aslema,这是一个针对 NADI 2026 共享任务(口语语言理解)的系统,通过微调音频大语言模型和合成数据增强来提升突尼斯阿拉伯语方言的意图识别和槽位填充性能。
作者描述了一个突破,其中使用GEN-1.5模型的机器人在单次演示后无需微调即可模仿任务,标志着在物理提示的少样本学习方面取得了重大进展。
本文提出了一种几何过滤框架,通过评估LLM生成样本在嵌入空间中与真实类别示例的欧氏距离来选择高质量样本,从而将少样本文本分类性能提升了2.61个百分点,优于SMOTE方法。
This paper introduces PAC-Bayes-regularized Meta-LoRA for cross-domain LLM personalization, enabling zero- and few-shot adaptation to user preferences while preventing overfitting under sparse evidence. Experiments on benchmarks like HiCUPID show significant improvements in cross-domain win rates and cold-start scenarios.
本文介绍了DyRIS,一种使用动态少样本检索和规则引导推理的LLM智能体框架,用于预测双钙钛矿的空间群,在取得有竞争力准确率的同时,显著提升了少数空间群类别上的性能。
FLARE是一个新框架,将少样本学习与反思机制相结合,以优化大语言模型的指令,在包括HotPotQA、工具调用和GoEmotions在内的多个基准测试中均优于GEPA。
本文综述并评测了法律语境下基于NLP的自动欺骗检测,比较了微调Transformer和七个大语言模型(LLM)在七个数据集上采用多种提示策略的表现。结果表明存在明显的领域敏感性:微调模型在数据丰富的通用领域表现出色,而少样本LLM在低资源法律场景中具有竞争力。
DIRECT是一个使用大型语言模型进行序列标注的框架,通过监督微调后的直接偏好优化(DPO)改善领域对齐,并通过带有模板填充和KV缓存重用的受控解码提高推理效率。