标签
作者分享了实际对比体验,显示 Gemma 4 在实用的指令遵循方面优于 Gemini 3.5 Flash 和 Claude Opus 5 等更大的模型,认为当前的 LLM 基准测试未能反映真实世界的可用性。
介绍了Instruct-FD,一个用于评估全双工语音系统能否遵循显式轮换指令的基准。结果显示最佳模型仅达到64.4%的遵从率,凸显了在遵循指令的轮换管理方面存在显著差距。
本文通过在合成语料库上进行受控实验,研究了格式、指令数量和上下文长度如何影响大型语言模型(LLM)的指令遵循与幻觉。研究发现,无论何种格式,当规则数量超过80条时,指令遵循会崩溃;而回忆准确率在64-128k token之后急剧下降,且受格式影响。本文还发布了VeyraBench工具包以支持复现。
作者讲述了使用Gemma模型翻译推理痕迹时遇到的问题,模型执行了文本中的指令而非进行翻译,突出了指令与有效负载之间的边界失效。
BLOOMZ 和 mT0 是在跨语言任务混合 xP3 上微调的多语言模型,能够在数十种语言中实现零样本指令遵循。
本文介绍了一个基于 SeamlessM4T-v2-large 和 Qwen3-4B-Instruct 的开源复现,用于 IWSLT 2026 指令跟随流水线,并使用 10 万个合成样本。
LLM-as-a-Tutor提出了一种框架,通过成对比较和添加约束动态调整提示难度,将LLM的角色从评判者扩展为导师,从而提升强化学习中的指令跟随性能。
MiniCPM5-1B-Claude-Opus-Fable5-Thinking 是一个紧凑的 10 亿参数思考型语言模型,基于 openbmb/MiniCPM5-1B 在 Fable 5 数据上微调而成,增强了编码和指令跟随能力,同时保留了原生的思考聊天模板和工具调用格式。它支持高达 128K 的上下文长度,适合本地部署。
本文提出SpeechCombine,一种无需任何指令微调的指令跟随语音语言模型,仅通过语音预训练和一种权重组合策略,将文本大语言模型的能力迁移到语音领域。
本文描述了 NAVER LABS Europe 参与 IWSLT 2026 指令跟随短轨道的提交方案。该方案改进了他们之前获胜的系统,使用了仅基于 ASR 数据训练的新语音投影器(SpeechMapper),并通过合成 SQA 数据集(fakACL)增强了训练。最终系统在使用较弱 LLM 骨干的情况下,在受约束轨道中并列第一。
IFStruct是由Liquid AI开发的结构化输出指令遵循基准,现在在Hugging Face上有了排行榜,旨在改进小模型以进行本地执行和正确的工具使用。
ifstruct 是 Liquid AI 推出的一个针对结构化输出的指令遵循基准测试,旨在推动该领域发展出更好的、可本地运行的小型模型。
介绍了Indi-RomCoM,这是一个用于评估LLM在四种印度语言罗马化代码混合(RCM)指令上的基准,发现LLM在RCM任务上表现不佳,且性能随代码混合密度增加而下降。
Seed2.0 是一个新的模型系列,通过增强长尾知识、指令遵循、推理、视觉理解和搜索能力,解决复杂的现实世界任务。它提出了一个基于用户需求的强大评估框架。
本文介绍了掩码语言流模型(MLFMs),该模型将掩码机制引入基于流的语言模型,从而实现连续流进行条件生成,并允许转换预训练的掩码扩散模型。作者提出了一种新型采样器,交替进行连续去噪和离散去掩码,首次证明了基于流的语言模型可以扩展至下游推理和指令遵循任务。
MIT CSAIL研究人员开发了掩码逆强化学习(Masked IRL),利用大型语言模型澄清机器人的模糊指令并聚焦环境关键细节,从而减少对大量演示数据的需求。
本文介绍了FBK在IWSLT 2026指令跟随共享任务中的提交,开发了用于短时和长时语音指令跟随的SpeechLLMs,探索了分割方法,并通过固定30秒分割实现了稳健的长时性能。
本文通过构建基准测试并提出一种方法,将进一步预训练与权重差异迁移相结合,以更低的成本创建专门的指令遵循模型,从而解决无资源编程语言的代码生成问题。
一个在550步内对两个指令遵循数据集进行微调的Pythia-6.9B模型,具备了13种语言的能力,相比基础模型有显著提升。