标签
本文重新将医院机制设计表述为语言模型的程序合成,使用多智能体模拟器(Medi-Sim)在策略性提供者响应下评估政策规则。它展示了跨提供者渠道的压力迁移,并合成了一种可检查的混合目标程序,该程序减少了向上编码和拒绝,同时保留了资金。
RPS是一种受神经科学启发的两阶段LLM后训练方法,结合了课程学习和学习率衰减。初步结果显示,与等学习率训练相比,在Qwen3-8b上程序合成可靠性得到提升。
介绍了Alice,一个闭环系统,通过将失败的候选更新视为结构信号,在先验不对齐的情况下在线学习可执行世界模型,在具有语义重新映射标签的Baba Is You变体上实现了改进的性能。
本文介绍了DIO-Agent,这是一种发现智能体,它利用LLM引导的进化搜索和变换优先级前提从输入输出行为中综合生成程序,避免了死胡同。实验表明,在一个新的IO2CodeBench基准测试上,该方法优于传统方法和基线。
本文提出属性引导的LLM程序综合方法,利用反例引导归纳综合(CEGIS)在候选程序违反形式化属性时提供具体反馈,从而减少生成次数和评估成本。应用于PDDL规划领域以综合直接启发式函数,该方法优于先前方法,生成的程序数量减少七倍,且无需搜索即可解决更多任务。
本文介绍了PyRAG,这是一个将多跳检索增强生成重新表述为程序合成与执行的框架,使用可执行的Python代码来表示推理步骤,从而实现确定性反馈和自适应检索。
ReaComp将LLM推理轨迹编译为可重用的符号程序合成器,在程序合成基准测试中实现了强大的准确性,同时消除了测试时的LLM调用,显著降低了计算成本。
本文主张,一个全面的规范并不等同于代码,因为规范定义了一组可能的实现,而代码则是其中的一个具体实例。文章讨论了抽象的作用,并解释了为什么即使在自动代码生成的情况下,仍然需要程序员来编写规范。
OpenAI 推出了 Codex,这是一个在 GitHub 代码上微调的 GPT 模型,在 HumanEval(一个用于从文档字符串进行代码合成的新基准)上实现了 28.8% 的功能正确性,远超 GPT-3(0%)和 GPT-J(11.4%)。该论文表明重复采样可以将性能提升至 70.2%(采样 100 次),并讨论了代码生成系统的局限性和更广泛的影响。