instruction-following

标签

Cards List
#instruction-following

是我的错觉,还是当前的LLM基准测试未能捕捉到实际可用性?(Gemma 4 对比 Gemini/Claude Opus)

Reddit r/LocalLLaMA · 19小时前

作者分享了实际对比体验,显示 Gemma 4 在实用的指令遵循方面优于 Gemini 3.5 Flash 和 Claude Opus 5 等更大的模型,认为当前的 LLM 基准测试未能反映真实世界的可用性。

0 人收藏 0 人点赞
#instruction-following

Instruct-FD:你的全双工语音系统能遵循轮换指令吗?

arXiv cs.CL · 2026-07-24 缓存

介绍了Instruct-FD,一个用于评估全双工语音系统能否遵循显式轮换指令的基准。结果显示最佳模型仅达到64.4%的遵从率,凸显了在遵循指令的轮换管理方面存在显著差距。

0 人收藏 0 人点赞
#instruction-following

大规模提示设计:格式、指令数量和上下文长度如何影响大型语言模型的指令遵循与幻觉

arXiv cs.CL · 2026-07-22 缓存

本文通过在合成语料库上进行受控实验,研究了格式、指令数量和上下文长度如何影响大型语言模型(LLM)的指令遵循与幻觉。研究发现,无论何种格式,当规则数量超过80条时,指令遵循会崩溃;而回忆准确率在64-128k token之后急剧下降,且受格式影响。本文还发布了VeyraBench工具包以支持复现。

0 人收藏 0 人点赞
#instruction-following

当翻译模型开始解决问题而非翻译时(小吐槽)

Reddit r/LocalLLaMA · 2026-07-22

作者讲述了使用Gemma模型翻译推理痕迹时遇到的问题,模型执行了文本中的指令而非进行翻译,突出了指令与有效负载之间的边界失效。

0 人收藏 0 人点赞
#instruction-following

对 Bloom 的怀旧

Reddit r/LocalLLaMA · 2026-07-10 缓存

BLOOMZ 和 mT0 是在跨语言任务混合 xP3 上微调的多语言模型,能够在数十种语言中实现零样本指令遵循。

0 人收藏 0 人点赞
#instruction-following

NAVER LABS 系统在 IWSLT 2026 指令跟随任务中的复现

arXiv cs.CL · 2026-07-08 缓存

本文介绍了一个基于 SeamlessM4T-v2-large 和 Qwen3-4B-Instruct 的开源复现,用于 IWSLT 2026 指令跟随流水线,并使用 10 万个合成样本。

0 人收藏 0 人点赞
#instruction-following

LLM-as-a-Tutor:面向不可验证强化学习的策略感知提示自适应

Hugging Face Daily Papers · 2026-07-05 缓存

LLM-as-a-Tutor提出了一种框架,通过成对比较和添加约束动态调整提示难度,将LLM的角色从评判者扩展为导师,从而提升强化学习中的指令跟随性能。

0 人收藏 0 人点赞
#instruction-following

GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking

Hugging Face Models Trending · 2026-07-03 缓存

MiniCPM5-1B-Claude-Opus-Fable5-Thinking 是一个紧凑的 10 亿参数思考型语言模型,基于 openbmb/MiniCPM5-1B 在 Fable 5 数据上微调而成,增强了编码和指令跟随能力,同时保留了原生的思考聊天模板和工具调用格式。它支持高达 128K 的上下文长度,适合本地部署。

0 人收藏 0 人点赞
#instruction-following

解锁语音-文本组合能力:无需指令微调的指令跟随语音语言模型

arXiv cs.CL · 2026-07-03 缓存

本文提出SpeechCombine,一种无需任何指令微调的指令跟随语音语言模型,仅通过语音预训练和一种权重组合策略,将文本大语言模型的能力迁移到语音领域。

0 人收藏 0 人点赞
#instruction-following

NAVER LABS Europe 对 2026 年指令跟随短轨道的提交方案

arXiv cs.CL · 2026-07-03 缓存

本文描述了 NAVER LABS Europe 参与 IWSLT 2026 指令跟随短轨道的提交方案。该方案改进了他们之前获胜的系统,使用了仅基于 ASR 数据训练的新语音投影器(SpeechMapper),并通过合成 SQA 数据集(fakACL)增强了训练。最终系统在使用较弱 LLM 骨干的情况下,在受约束轨道中并列第一。

0 人收藏 0 人点赞
#instruction-following

@maximelabonne: IFStruct现在在@huggingface上有了排行榜!

X AI KOLs Following · 2026-07-02 缓存

IFStruct是由Liquid AI开发的结构化输出指令遵循基准,现在在Hugging Face上有了排行榜,旨在改进小模型以进行本地执行和正确的工具使用。

0 人收藏 0 人点赞
#instruction-following

@nathanhabib1011: ifstruct by @liquidai,一个针对结构化输出的指令遵循基准测试。为什么这很重要?因为较小的……

X AI KOLs Following · 2026-07-02 缓存

ifstruct 是 Liquid AI 推出的一个针对结构化输出的指令遵循基准测试,旨在推动该领域发展出更好的、可本地运行的小型模型。

0 人收藏 0 人点赞
#instruction-following

Indi-RomCoM:评估LLM在罗马化印度语-英语混合指令上的代码混合基准

arXiv cs.CL · 2026-07-01 缓存

介绍了Indi-RomCoM,这是一个用于评估LLM在四种印度语言罗马化代码混合(RCM)指令上的基准,发现LLM在RCM任务上表现不佳,且性能随代码混合密度增加而下降。

0 人收藏 0 人点赞
#instruction-following

AI智能体是否应该执行不完整的指令?

Reddit r/AI_Agents · 2026-06-30

探讨AI智能体是否应遵循不完整的指令,并讨论安全性和对齐考量。

0 人收藏 0 人点赞
#instruction-following

Seed2.0 模型卡:迈向现实世界复杂性的智能前沿

Hugging Face Daily Papers · 2026-06-30 缓存

Seed2.0 是一个新的模型系列,通过增强长尾知识、指令遵循、推理、视觉理解和搜索能力,解决复杂的现实世界任务。它提出了一个基于用户需求的强大评估框架。

0 人收藏 0 人点赞
#instruction-following

掩码语言流模型

arXiv cs.CL · 2026-06-29 缓存

本文介绍了掩码语言流模型(MLFMs),该模型将掩码机制引入基于流的语言模型,从而实现连续流进行条件生成,并允许转换预训练的掩码扩散模型。作者提出了一种新型采样器,交替进行连续去噪和离散去掩码,首次证明了基于流的语言模型可以扩展至下游推理和指令遵循任务。

0 人收藏 0 人点赞
#instruction-following

LLMs帮助机器人理解模糊指令并聚焦关键细节

MIT News — Artificial Intelligence · 2026-06-26 缓存

MIT CSAIL研究人员开发了掩码逆强化学习(Masked IRL),利用大型语言模型澄清机器人的模糊指令并聚焦环境关键细节,从而减少对大量演示数据的需求。

0 人收藏 0 人点赞
#instruction-following

面向IWSLT 2026指令跟随的FBK长时SpeechLLMs

arXiv cs.CL · 2026-06-26 缓存

本文介绍了FBK在IWSLT 2026指令跟随共享任务中的提交,开发了用于短时和长时语音指令跟随的SpeechLLMs,探索了分割方法,并通过固定30秒分割实现了稳健的长时性能。

0 人收藏 0 人点赞
#instruction-following

无资源,无基准,没问题?评估与改进针对无资源语言的代码生成LLMs

Hugging Face Daily Papers · 2026-06-15 缓存

本文通过构建基准测试并提出一种方法,将进一步预训练与权重差异迁移相结合,以更低的成本创建专门的指令遵循模型,从而解决无资源编程语言的代码生成问题。

0 人收藏 0 人点赞
#instruction-following

对2023年初的模型在两个指令遵循数据集上进行微调后效果变得很好

Reddit r/LocalLLaMA · 2026-06-12

一个在550步内对两个指令遵循数据集进行微调的Pythia-6.9B模型,具备了13种语言的能力,相比基础模型有显著提升。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈