instruction-following

标签

Cards List
#instruction-following

如果你指示你的常用AI模型:‘绝对不要产生幻觉!!!’会发生什么

Reddit r/singularity · 2026-06-09

一个思想实验提出疑问:指示AI模型永远不要产生幻觉会触发其自我反思,还是会导致模型自我欺骗,相信自己没有产生幻觉?

0 人收藏 0 人点赞
#instruction-following

OmniCap-IF:全模态视频字幕生成中指令跟随能力的基准测试与提升

Hugging Face Daily Papers · 2026-06-07 缓存

介绍了OmniCap-IF,这是首个用于评估全模态视频字幕生成中指令跟随能力的综合性基准,揭示了格式-内容权衡,并提出了改进的模型和数据集。

0 人收藏 0 人点赞
#instruction-following

VCIFBench:评估视频理解中的复杂指令遵循能力

arXiv cs.CL · 2026-06-04 缓存

VCIFBench 是一个用于评估视频理解中复杂指令遵循能力的新基准,包含 306 条带有内容、格式、风格和结构约束的测试指令,以及一个 DPO 偏好数据集。针对 10 个 MLLM 的实验表明,同时满足多项约束仍具挑战性,而基于该基准数据进行 DPO 训练可提升指令遵循性能。

0 人收藏 0 人点赞
#instruction-following

SpeechEditBench:面向指令引导语音编辑的双语多属性基准

Hugging Face Daily Papers · 2026-06-03

SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。

0 人收藏 0 人点赞
#instruction-following

我从零开始训练了一个75M参数的LLM,使用18B tokens,它击败了几乎两倍大小的模型

Reddit r/LocalLLaMA · 2026-06-02

从零开始训练了一个名为KeyLM的75M参数LLM,使用18B tokens,在指令跟随得分上与更大模型竞争,同时使用更少的参数和更少的数据。

0 人收藏 0 人点赞
#instruction-following

面向开放端后训练的提示级奖励规范

arXiv cs.CL · 2026-05-29 缓存

本文提出了一种提示级奖励规范框架,将奖励规范与计算分离,离线构建可重用的任务适应评分准则和可执行约束检查器,为开放端后训练生成混合奖励,无需人工标注或单独的奖励模型。

0 人收藏 0 人点赞
#instruction-following

基于跨模型熵的无标签强化学习

arXiv cs.LG · 2026-05-29 缓存

提出跨模型熵(CME)作为一种无标签奖励信号,用于大型语言模型的强化学习后训练,无需真实验证器或人类偏好标签即可实现开放式指令遵循。

0 人收藏 0 人点赞
#instruction-following

按我说的做,不是按我做的做:LLM中的指令-归纳冲突

arXiv cs.CL · 2026-05-21 缓存

本文研究了LLM中指令遵循与模式补全之间的冲突,发现指令遵循在归纳压力下较为脆弱,且在不同模型间差异显著,而输出多样性是鲁棒性的主要因素。

0 人收藏 0 人点赞
#instruction-following

@cursor_ai: 介绍 Composer 2.5,这是我们迄今为止最强大的模型。它更智能,更擅长在长期运行的任务中持续工作……

X AI KOLs Timeline · 2026-05-18 缓存

Cursor AI 宣布推出 Composer 2.5,这是他们迄今为止最强大的模型,具有增强的智能、更好的长期任务持续工作能力以及改进的指令遵循能力;他们将在一周内加倍包含的使用量。

0 人收藏 0 人点赞
#instruction-following

AI基准测试不如模型能否处理乏味的现实责任重要

Reddit r/ArtificialInteligence · 2026-05-17

文章认为,AI基准测试和华丽的演示被过度强调了;真正考验AI可信度的是模型如何处理乏味的现实责任,如遵循指令、承认不确定性、处理边缘情况以及可审计性。

0 人收藏 0 人点赞
#instruction-following

当注意力关闭:LLMs如何在多轮交互中迷失线索

arXiv cs.AI · 2026-05-14 缓存

本文从机制上解释了为什么LLMs在长时间的多轮交互中会丢失指令,引入了目标可访问性比率(GAR)指标和通道转换框架。通过消融研究和残差流探针,论文表明,对定义目标词元的注意力会在回合间关闭,而目标信息在残差表示中持续存在,并出现了架构特定的失败模式。

0 人收藏 0 人点赞
#instruction-following

基于宏动作的多智能体指令遵循:价值取消方法

arXiv cs.AI · 2026-05-14 缓存

提出MAVIC,一种多智能体强化学习方法,在指令边界修正价值估计,以在遵循外部自然语言指令的同时保持基础任务性能。

0 人收藏 0 人点赞
#instruction-following

我训练了1B模型遵循指令,结果它更不听话了...

Reddit r/LocalLLaMA · 2026-05-14

作者用相同的SFT方法训练了1B、2B和3B模型,观察到1B和2B模型的指令遵循能力(IFEval)退步了,而3B模型却提升了,这可能与学习率或模型容量不同有关。

0 人收藏 0 人点赞
#instruction-following

编辑精选:通过原子实体分析评估图像编辑中的抽象意图

Hugging Face Daily Papers · 2026-05-14 缓存

本文介绍了AbstractEdit(一个抽象图像编辑基准)和Entity-Rubrics(一个实体级评估框架),揭示了在抽象指令中平衡意图与保留的挑战,并强调了需要集成LLM。

0 人收藏 0 人点赞
#instruction-following

指令塑造语言生成,而非处理

arXiv cs.CL · 2026-05-13 缓存

这项研究探讨了指令如何影响大型语言模型,发现其主要影响语言生成阶段,而非处理阶段。该研究利用基于注意力的干预方法和探针技术,在多种模型系列和任务中证明了这种不对称性。

0 人收藏 0 人点赞
#instruction-following

SEQUOR:用于真实约束遵循的多轮对话基准

arXiv cs.CL · 2026-05-08 缓存

本文介绍了 Sequor,这是一个用于评估人工智能模型在长多轮对话中遵循约束能力的新基准。该研究强调,当前模型在长时间交互中保持对指令的遵循方面存在显著困难。

0 人收藏 0 人点赞
#instruction-following

SEIF:用于指令遵循的自我演化强化学习

Hugging Face Daily Papers · 2026-05-08 缓存

本文介绍了 SEIF,这是一个自我演化的强化学习框架,通过迭代难度自适应以及教官和跟随者组件的协同训练,增强大语言模型(LLM)的指令遵循能力。

0 人收藏 0 人点赞
#instruction-following

面向指令遵循信息检索的双视角训练

Hugging Face Daily Papers · 2026-04-20 缓存

一种基于极性反转的双视角数据合成方法,在 FollowIR 基准上将指令遵循检索性能提升 45%。

0 人收藏 0 人点赞
#instruction-following

介绍 Gemma 3 270M:超高效 AI 的紧凑型模型

Google DeepMind Blog · 2025-10-23 缓存

Google 推出 Gemma 3 270M,这是一个拥有 2.7 亿参数的紧凑型模型,专为高效边缘设备 AI 设计,具有强大的指令遵循能力和极致的能效表现(在 Pixel 9 Pro 上进行 25 次对话仅消耗 0.75% 电量)。

0 人收藏 0 人点赞
#instruction-following

在 API 中推出 GPT-4.1

OpenAI Blog · 2025-04-14 缓存

OpenAI 通过 API 推出 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano 模型,在编程(SWE-bench 得分达 54.6%)、指令遵循和 100 万 token 上下文窗口方面有重大改进,成本更低。GPT-4.5 Preview 将于 2025 年 7 月 14 日停用。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈