标签
一个思想实验提出疑问:指示AI模型永远不要产生幻觉会触发其自我反思,还是会导致模型自我欺骗,相信自己没有产生幻觉?
介绍了OmniCap-IF,这是首个用于评估全模态视频字幕生成中指令跟随能力的综合性基准,揭示了格式-内容权衡,并提出了改进的模型和数据集。
VCIFBench 是一个用于评估视频理解中复杂指令遵循能力的新基准,包含 306 条带有内容、格式、风格和结构约束的测试指令,以及一个 DPO 偏好数据集。针对 10 个 MLLM 的实验表明,同时满足多项约束仍具挑战性,而基于该基准数据进行 DPO 训练可提升指令遵循性能。
SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。
从零开始训练了一个名为KeyLM的75M参数LLM,使用18B tokens,在指令跟随得分上与更大模型竞争,同时使用更少的参数和更少的数据。
本文提出了一种提示级奖励规范框架,将奖励规范与计算分离,离线构建可重用的任务适应评分准则和可执行约束检查器,为开放端后训练生成混合奖励,无需人工标注或单独的奖励模型。
提出跨模型熵(CME)作为一种无标签奖励信号,用于大型语言模型的强化学习后训练,无需真实验证器或人类偏好标签即可实现开放式指令遵循。
本文研究了LLM中指令遵循与模式补全之间的冲突,发现指令遵循在归纳压力下较为脆弱,且在不同模型间差异显著,而输出多样性是鲁棒性的主要因素。
Cursor AI 宣布推出 Composer 2.5,这是他们迄今为止最强大的模型,具有增强的智能、更好的长期任务持续工作能力以及改进的指令遵循能力;他们将在一周内加倍包含的使用量。
文章认为,AI基准测试和华丽的演示被过度强调了;真正考验AI可信度的是模型如何处理乏味的现实责任,如遵循指令、承认不确定性、处理边缘情况以及可审计性。
本文从机制上解释了为什么LLMs在长时间的多轮交互中会丢失指令,引入了目标可访问性比率(GAR)指标和通道转换框架。通过消融研究和残差流探针,论文表明,对定义目标词元的注意力会在回合间关闭,而目标信息在残差表示中持续存在,并出现了架构特定的失败模式。
提出MAVIC,一种多智能体强化学习方法,在指令边界修正价值估计,以在遵循外部自然语言指令的同时保持基础任务性能。
作者用相同的SFT方法训练了1B、2B和3B模型,观察到1B和2B模型的指令遵循能力(IFEval)退步了,而3B模型却提升了,这可能与学习率或模型容量不同有关。
本文介绍了AbstractEdit(一个抽象图像编辑基准)和Entity-Rubrics(一个实体级评估框架),揭示了在抽象指令中平衡意图与保留的挑战,并强调了需要集成LLM。
这项研究探讨了指令如何影响大型语言模型,发现其主要影响语言生成阶段,而非处理阶段。该研究利用基于注意力的干预方法和探针技术,在多种模型系列和任务中证明了这种不对称性。
本文介绍了 Sequor,这是一个用于评估人工智能模型在长多轮对话中遵循约束能力的新基准。该研究强调,当前模型在长时间交互中保持对指令的遵循方面存在显著困难。
本文介绍了 SEIF,这是一个自我演化的强化学习框架,通过迭代难度自适应以及教官和跟随者组件的协同训练,增强大语言模型(LLM)的指令遵循能力。
一种基于极性反转的双视角数据合成方法,在 FollowIR 基准上将指令遵循检索性能提升 45%。
Google 推出 Gemma 3 270M,这是一个拥有 2.7 亿参数的紧凑型模型,专为高效边缘设备 AI 设计,具有强大的指令遵循能力和极致的能效表现(在 Pixel 9 Pro 上进行 25 次对话仅消耗 0.75% 电量)。
OpenAI 通过 API 推出 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano 模型,在编程(SWE-bench 得分达 54.6%)、指令遵循和 100 万 token 上下文窗口方面有重大改进,成本更低。GPT-4.5 Preview 将于 2025 年 7 月 14 日停用。