标签
本文提出了一种基于自动编码器和迭代优化的无注意力掩码语言建模方法,其性能与BERT相当,且FLOPs更少。
RefinePPO 引入迭代动作细化以改进连续控制策略,在基准任务中达到与标准PPO相当或更优的性能,并且收敛更快。
REPAIR是一种自演化的数据增强框架,用于科学稠密检索器,通过事实验证迭代改进解决长尾混淆,在材料科学和生物医学基准测试中展示了显著的性能提升。
SABET-QA 提出了一个用于时序知识图谱问答的迭代框架,通过双向实体-时序评分和上下文化增强了多跳推理,并在 CronQuestions 和 TimeQuestions 等基准测试中显示出相对于基线的一致改进。
本文提出使用Runge-Kutta积分方法的基于ODE的Transformer解码器,以改进手语翻译的迭代细化过程,在不增加模型大小的情况下,取得了比IPSLT基线更好的BLEU分数。
This paper proposes a novel contextual bandit algorithm that explicitly models reward decay for progressive content refinement in LLMs, using EM to estimate arm-specific and decay parameters. Experiments on Sentiment Reversal and GSM8K show significant gains over strong baselines.
本文提出WILC,一个通过互补驱动的迭代协作来协调多个LLM的框架,在多个基准测试上展现出优于现有方法的性能,且估计成本比GPT-5.2更低。
介绍IRIS框架,该框架无需显式反馈即可从隐式交互流中学习动态用户画像,在决策预测上优于静态和仅记忆基线。
MusiChat 提出了一种用于人机音乐协作创作的对话系统,通过自然语言交互实现迭代优化,在多轮编辑中达到了高准确率。
由Volodymyr Kuleshov的康奈尔团队撰写的综合博客文章,解释了如何构建扩散语言模型,涵盖了核心技术如掩码扩散、迭代细化、变长生成、可控生成、快速采样器和RL后训练,并以开源模型如Mercury、Gemma Diffusion和Nemotron Diffusion为例。
提议将语义压缩视为一种扩散噪声函数,用于处理超出模型窗口的庞大上下文,采用多遍读取并以递减的压缩级别进行。未经训练模型的实验表明,各组件在隔离状态下工作良好,但完整链条需要训练来解决绑定瓶颈。
ScholarSum是一个层次化反思图框架,用于科学文献的抽象摘要生成,模拟了师生写作过程。它利用层次化知识图谱捕获全局结构,生成初稿,并通过证据检索和类似教师的审阅迭代地优化摘要,以提高流畅性和事实忠实性。
本文提出反射掩码(Reflective Masking),一种轻量级后训练方法,通过令牌级修订策略和历史引用机制,使掩码扩散模型能够进行多轮自我修正,提升在数独、数学、代码生成和图像编辑等推理任务上的性能。
本文描述了一个脚手架(scaffold),它通过在 Qwen-3.6-27B 和 Gemma-4-31B 上使用迭代修正和分支探索来扩展测试时计算,从而在代码优化方面超越 Claude Mythos。文中附有论文链接和 GitHub 仓库地址。
KForge是一个跨平台框架,利用两个协作的基于LLM的智能体,自动生成和优化适用于多种AI加速器的高性能计算内核,在NVIDIA B200和Intel Arc B580硬件上实现了显著的加速效果。
本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。
本文介绍了迭代细化神经算子(IRNO),它通过固定点迭代应用学习到的细化模块来增强预训练的神经算子,以缓解频谱偏差。IRNO逐步修正高频误差,在湍流上实现了高达56%的改进,并且在超过训练迭代次数时仍能稳定外推。
Research Math Agents (RMA) 是一个用于研究级数学问题自动推理的智能体框架,在 First Proof 基准测试中取得最先进结果,解决了10个问题中的8个,优于 GPT-5.2R 和 Aletheia 等强基线。
本文介绍了一种用于多智能体大语言模型系统的批评与路由控制器,将协调过程建模为序贯决策问题。该方法利用策略梯度优化控制器以实现迭代优化,在表现优于基线方法的同时,降低了对顶级模型的依赖。
本文介绍了吸引子模型,该模型利用定点求解和隐式微分进行高效的迭代优化,在降低计算成本的同时,实现了相较于传统Transformer更优的语言建模和推理性能。