program-synthesis

标签

Cards List
#program-synthesis

基于政策即代码搜索的医疗机制:应对策略性提供者响应

arXiv cs.AI · 2026-06-01 缓存

本文重新将医院机制设计表述为语言模型的程序合成,使用多智能体模拟器(Medi-Sim)在策略性提供者响应下评估政策规则。它展示了跨提供者渠道的压力迁移,并合成了一种可检查的混合目标程序,该程序减少了向上编码和拒绝,同时保留了资金。

0 人收藏 0 人点赞
#program-synthesis

我创造了一种名为RPS的LLM后训练方法。初步结果显示它提高了Qwen3-8b的程序合成可靠性。[R]

Reddit r/MachineLearning · 2026-05-21

RPS是一种受神经科学启发的两阶段LLM后训练方法,结合了课程学习和学习率衰减。初步结果显示,与等学习率训练相比,在Qwen3-8b上程序合成可靠性得到提升。

0 人收藏 0 人点赞
#program-synthesis

Baba in Wonderland:面向可执行世界模型的在线自监督动态发现

arXiv cs.AI · 2026-05-19 缓存

介绍了Alice,一个闭环系统,通过将失败的候选更新视为结构信号,在先验不对齐的情况下在线学习可执行世界模型,在具有语义重新映射标签的Baba Is You变体上实现了改进的性能。

0 人收藏 0 人点赞
#program-synthesis

从I/O到代码的发现智能体

arXiv cs.LG · 2026-05-18 缓存

本文介绍了DIO-Agent,这是一种发现智能体,它利用LLM引导的进化搜索和变换优先级前提从输入输出行为中综合生成程序,避免了死胡同。实验表明,在一个新的IO2CodeBench基准测试上,该方法优于传统方法和基线。

0 人收藏 0 人点赞
#program-synthesis

属性引导的LLM规划程序综合

arXiv cs.AI · 2026-05-18 缓存

本文提出属性引导的LLM程序综合方法,利用反例引导归纳综合(CEGIS)在候选程序违反形式化属性时提供具体反馈,从而减少生成次数和评估成本。应用于PDDL规划领域以综合直接启发式函数,该方法优于先前方法,生成的程序数量减少七倍,且无需搜索即可解决更多任务。

0 人收藏 0 人点赞
#program-synthesis

检索很廉价,给我看代码:面向检索增强生成的可执行多跳推理

arXiv cs.AI · 2026-05-14 缓存

本文介绍了PyRAG,这是一个将多跳检索增强生成重新表述为程序合成与执行的框架,使用可执行的Python代码来表示推理步骤,从而实现确定性反馈和自适应检索。

0 人收藏 0 人点赞
#program-synthesis

ReaComp:将LLM推理编译为符号求解器以实现高效程序合成

arXiv cs.CL · 2026-05-08 缓存

ReaComp将LLM推理轨迹编译为可重用的符号程序合成器,在程序合成基准测试中实现了强大的准确性,同时消除了测试时的LLM调用,显著降低了计算成本。

0 人收藏 0 人点赞
#program-synthesis

足够全面的规范并不(必然)就是代码

Hillel Wayne — Computer Things · 2026-04-15 缓存

本文主张,一个全面的规范并不等同于代码,因为规范定义了一组可能的实现,而代码则是其中的一个具体实例。文章讨论了抽象的作用,并解释了为什么即使在自动代码生成的情况下,仍然需要程序员来编写规范。

0 人收藏 0 人点赞
#program-synthesis

评估在代码上训练的大型语言模型

OpenAI Blog · 2021-07-07 缓存

OpenAI 推出了 Codex,这是一个在 GitHub 代码上微调的 GPT 模型,在 HumanEval(一个用于从文档字符串进行代码合成的新基准)上实现了 28.8% 的功能正确性,远超 GPT-3(0%)和 GPT-J(11.4%)。该论文表明重复采样可以将性能提升至 70.2%(采样 100 次),并讨论了代码生成系统的局限性和更广泛的影响。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈