iterative-refinement

标签

Cards List
#iterative-refinement

基于ODE的Transformer解码器用于迭代手语翻译

arXiv cs.CL · 昨天 缓存

本文提出使用Runge-Kutta积分方法的基于ODE的Transformer解码器,以改进手语翻译的迭代细化过程,在不增加模型大小的情况下,取得了比IPSLT基线更好的BLEU分数。

0 人收藏 0 人点赞
#iterative-refinement

Progressive Content Refinement with Decaying Reward Joint LinUCB

arXiv cs.CL · 4天前 缓存

This paper proposes a novel contextual bandit algorithm that explicitly models reward decay for progressive content refinement in LLMs, using EM to estimate arm-specific and decay parameters. Experiments on Sentiment Reversal and GSM8K show significant gains over strong baselines.

0 人收藏 0 人点赞
#iterative-refinement

利用互补驱动的迭代协作发挥LLM群体的智慧

arXiv cs.AI · 2026-08-03 缓存

本文提出WILC,一个通过互补驱动的迭代协作来协调多个LLM的框架,在多个基准测试上展现出优于现有方法的性能,且估计成本比GPT-5.2更低。

0 人收藏 0 人点赞
#iterative-refinement

通过迭代优化从隐式交互流中学习动态用户画像

arXiv cs.LG · 2026-07-30 缓存

介绍IRIS框架,该框架无需显式反馈即可从隐式交互流中学习动态用户画像,在决策预测上优于静态和仅记忆基线。

0 人收藏 0 人点赞
#iterative-refinement

MusiChat:音乐创作的氛围式创作

arXiv cs.AI · 2026-07-29 缓存

MusiChat 提出了一种用于人机音乐协作创作的对话系统,通过自然语言交互实现迭代优化,在多轮编辑中达到了高准确率。

0 人收藏 0 人点赞
#iterative-refinement

@volokuleshov: 新博客文章:如何构建扩散语言模型。扩散LLM从开放问题变为现实,用了2年时间 (Me…)

X AI KOLs Timeline · 2026-07-08 缓存

由Volodymyr Kuleshov的康奈尔团队撰写的综合博客文章,解释了如何构建扩散语言模型,涵盖了核心技术如掩码扩散、迭代细化、变长生成、可控生成、快速采样器和RL后训练,并以开源模型如Mercury、Gemma Diffusion和Nemotron Diffusion为例。

0 人收藏 0 人点赞
#iterative-refinement

如果上下文压缩是扩散噪声函数会怎样?提案 + 未经训练模型实验的真实结果 [R]

Reddit r/MachineLearning · 2026-06-26

提议将语义压缩视为一种扩散噪声函数,用于处理超出模型窗口的庞大上下文,采用多遍读取并以递减的压缩级别进行。未经训练模型的实验表明,各组件在隔离状态下工作良好,但完整链条需要训练来解决绑定瓶颈。

0 人收藏 0 人点赞
#iterative-refinement

ScholarSum:基于知识图谱推理与反思式优化的师生式抽象摘要生成

arXiv cs.CL · 2026-06-18 缓存

ScholarSum是一个层次化反思图框架,用于科学文献的抽象摘要生成,模拟了师生写作过程。它利用层次化知识图谱捕获全局结构,生成初稿,并通过证据检索和类似教师的审阅迭代地优化摘要,以提高流畅性和事实忠实性。

0 人收藏 0 人点赞
#iterative-refinement

多轮反射掩码激发掩码扩散模型的推理能力

Hugging Face Daily Papers · 2026-06-15 缓存

本文提出反射掩码(Reflective Masking),一种轻量级后训练方法,通过令牌级修订策略和历史引用机制,使掩码扩散模型能够进行多轮自我修正,提升在数独、数学、代码生成和图像编辑等推理任务上的性能。

0 人收藏 0 人点赞
#iterative-refinement

我将测试时计算扩展到 Qwen-3.6-27B 和 Gemma-4-31B,以在代码优化和加速方面超越 Claude Mythos。

Reddit r/LocalLLaMA · 2026-06-12

本文描述了一个脚手架(scaffold),它通过在 Qwen-3.6-27B 和 Gemma-4-31B 上使用迭代修正和分支探索来扩展测试时计算,从而在代码优化方面超越 Claude Mythos。文中附有论文链接和 GitHub 仓库地址。

0 人收藏 0 人点赞
#iterative-refinement

KForge:面向AI加速器的LLM驱动跨平台内核生成

arXiv cs.LG · 2026-06-03 缓存

KForge是一个跨平台框架,利用两个协作的基于LLM的智能体,自动生成和优化适用于多种AI加速器的高性能计算内核,在NVIDIA B200和Intel Arc B580硬件上实现了显著的加速效果。

0 人收藏 0 人点赞
#iterative-refinement

当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化

arXiv cs.LG · 2026-05-29 缓存

本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。

0 人收藏 0 人点赞
#iterative-refinement

迭代细化神经算子是一种学习的固定点求解器:缓解频谱偏差的理论方法

arXiv cs.LG · 2026-05-26 缓存

本文介绍了迭代细化神经算子(IRNO),它通过固定点迭代应用学习到的细化模块来增强预训练的神经算子,以缓解频谱偏差。IRNO逐步修正高频误差,在湍流上实现了高达56%的改进,并且在超过训练迭代次数时仍能稳定外推。

0 人收藏 0 人点赞
#iterative-refinement

RMA:面向研究级数学问题的智能体系统

arXiv cs.AI · 2026-05-25 缓存

Research Math Agents (RMA) 是一个用于研究级数学问题自动推理的智能体框架,在 First Proof 基准测试中取得最先进结果,解决了10个问题中的8个,优于 GPT-5.2R 和 Aletheia 等强基线。

0 人收藏 0 人点赞
#iterative-refinement

面向异构大语言模型多智能体系统的迭代式批评与路由控制器

arXiv cs.AI · 2026-05-12 缓存

本文介绍了一种用于多智能体大语言模型系统的批评与路由控制器,将协调过程建模为序贯决策问题。该方法利用策略梯度优化控制器以实现迭代优化,在表现优于基线方法的同时,降低了对顶级模型的依赖。

0 人收藏 0 人点赞
#iterative-refinement

解决循环:用于语言和推理的吸引子模型

Hugging Face Daily Papers · 2026-05-12 缓存

本文介绍了吸引子模型,该模型利用定点求解和隐式微分进行高效的迭代优化,在降低计算成本的同时,实现了相较于传统Transformer更优的语言建模和推理性能。

0 人收藏 0 人点赞
#iterative-refinement

递归推理系统的状态表示与终止条件

arXiv cs.AI · 2026-05-11 缓存

本文提出了一种用于递归推理系统的认知状态图表示方法以及一种基于顺序间隙的终止标准,旨在解决如何管理不断演变的推理状态以及何时停止迭代的问题。

0 人收藏 0 人点赞
#iterative-refinement

WiCER:面向 LLM Wiki 系统的 Wiki 记忆编译、评估与精炼迭代式知识编译

arXiv cs.CL · 2026-05-11 缓存

本文介绍了 WiCER,这是一种将领域知识编译到 LLM Wiki 系统中的迭代算法,旨在最大限度地减少知识蒸馏过程中的信息丢失和灾难性失败率。研究表明,与盲编译方法相比,该方法通过更好地保留关键事实,改进了全上下文 KV 缓存推理的效果。

0 人收藏 0 人点赞
#iterative-refinement

GPT-Image-2 现在会自行审查输出,并不断迭代,直到对输出结果的正确性满意为止。

Reddit r/singularity · 2026-04-21

这张图片的生成耗时约 11 分钟,期间它多次对自身输出进行审查和迭代。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈