标签
本文将验证差距确定为AI推理进步的关键约束,对验证器可靠性权衡进行了理论和实证分析,并引入携带证明的认知以增强强化学习中的奖励结算。
一种修复工具,能从单个完整示例中推断修复方案,并在未见过的代码中成功修复了5个bug中的5个,仅使用4条CPU指令和零令牌,并进行穷尽验证。
ClosureBench 是一个用于评估语言模型在组合图推理任务上表现的建构性基准,揭示了前沿模型随着复杂度增加而性能下降,而通过程序合成微调的模型能保持性能。
本文介绍了aDSL,一种协同设计的领域特定语言和多代理系统,通过关系运算符和迭代反馈改进大语言模型驱动的3D程序合成,增强3D内容创建的鲁棒性和可控性。
本文探讨了重复出现的 LLM 工作负载是否可以在适当情况下被自动合成的、由类型化 ML/NLP 算子组成的确定性流水线所替代,并征求关于可行性和方法的反馈。
This paper introduces two library combinators, prune and defrel/bank, that bring bottom-up enumeration with observational deduplication to miniKanren relational programming, improving program-by-example synthesis performance.
本文介绍 Brevis,一种无损张量压缩方法,它将压缩形式化为使用类型化 DSL 的程序合成。该方法在公开检查点上实现了 33.93% 的存储缩减,性能优于通用压缩器和张量专用压缩器。
SpecFirst 提出将行为规范获取作为基于智能体的程序合成中的首要步骤,将其与探索和编码分离。在 200 个程序实例上进行评估,它在多个模型上显著提高了测试通过率和二进制探索覆盖率。
MindForge 是一个自动化管道,将开源命令行程序转换为无源码的训练环境,供小型语言模型使用。在由 GLM-5.2 生成的轨迹上微调 Qwen3.6-27B,显著提升了其在软件工程基准测试中的表现,取得了与更大模型相当的结果。
ARCANA是一个反射式多智能体框架,将ARC-AGI-2抽象推理任务分解为迭代感知、假设生成、符号执行和反射精炼,在严格约束下提升推理效率。
Anima Anandkumar 宣布其团队在 ICML 研讨会上发表了四篇与 Lean 相关的论文,涵盖验证机器学习系统、函数式程序合成、证明助手互操作性以及科学推理,将 Lean 定位为 AI 的基础设施。
本文提出了面向ARC-AGI-1的经济型智能体框架,通过探索者-定义者流水线和反思型协调器,使用DeepSeek V3.2无需微调即可实现强大性能,以低成本达到67.25%的pass@2。
François Chollet预测AI将收敛于直觉引导的符号世界建模,具体来说是深度学习引导的程序合成,这允许系统利用最少数据构建紧凑、可复用且可泛化的心智模型。
介绍了AlgoEvolve,一个LLM驱动的进化框架,用于生成并迭代改进算法交易策略。该框架包含一个元进化外层循环,用于进化提示词以指导内层循环的合成。
介绍进化程序性瓶颈(EPB),一种通过LLM驱动的进化将黑箱模型蒸馏为人类可读的程序组合以解读神经组合优化策略的框架。
讨论AI生成代码中形式规范的必要性,并介绍PICK,一种利用人类判断帮助程序员为LLM生成的正则表达式指定所需属性的工具。
文章介绍了‘提升E-Graphs’,这是一种改进的e-graph方法,它显式编码函数的上下文(维度),以解决变量命名、遗漏共享和意外过度共享的问题,该方法基于从R^n到R的函数语义模型。
本文提出将反例引导学习用于LLM执行正则表达式归纳,其中验证器提供反例以优化候选表达式。该方法显著提高了具有挑战性任务上的样本效率和成功率,表明LLM可以从结构化反馈中受益,而不仅仅是将其视为额外数据。
介绍了 Semantic Reification,一种随机程序生成的新范式,如本研究论文所述。