execution-feedback

标签

Cards List
#execution-feedback

SkillDRE:通过预执行和运行时反馈的双阶段代理技能红队进化

Hugging Face Daily Papers ↗ · 4天前 缓存

SkillDRE引入了一个双阶段反馈循环,用于自主进化代理中的恶意技能包,在保持良性任务功能的同时实现高攻击成功率。

0 人收藏 0 人点赞
#execution-feedback

编码代理能否重现官方统计数据?元数据、重试预算与执行反馈的局限性:一项受控Eurostat基准测试

arXiv cs.LG ↗ · 2026-09-22 缓存

本研究以编码代理重现Eurostat统计数据为基准进行评估,发现语义验证和重试预算对可靠性至关重要,远不止于执行诊断。

0 人收藏 0 人点赞
#execution-feedback

编写、执行、优化:通过执行反馈的强化学习从技能跟随者到技能优化者

arXiv cs.CL ↗ · 2026-08-19 缓存

本文介绍了一种多阶段框架WER,它使用执行反馈的强化学习来训练技能优化器,以改进工具使用代理,在BFCL v4和τ2-bench等基准测试中实现了显著的性能提升。

0 人收藏 0 人点赞
#execution-feedback

FlowScout:从执行反馈到可靠的工具使用智能体工作流

arXiv cs.LG ↗ · 2026-08-12 缓存

FlowScout 是一个框架,能够从历史任务解决记录中自动生成集成工具智能体工作流,利用由执行反馈引导的蒙特卡洛树搜索。实验表明,与基线方法相比,它提高了工具调用正确性和执行分数。

0 人收藏 0 人点赞
#execution-feedback

从测试时扩展到可复用记忆:衡量文本到SQL中的结晶化

arXiv cs.CL ↗ · 2026-08-10 缓存

本文引入了“结晶化问题”,用于评估文本到SQL系统中的可复用记忆,表明将经过验证的修正查询存储在每个数据库的库中,可以将BIRD上留出集的首次尝试准确率提高4.34个百分点,捕获按需修复所提供的44.4%的提升空间。受控干预措施识别出数据库特定内容是主要驱动因素。

0 人收藏 0 人点赞
#execution-feedback

@leanxbt: 这篇论文完全改变了我对一个智能体如何修复自身代码的看法:生成代码 -> 执行 -> 解释...

X AI KOLs Timeline ↗ · 2026-07-10 缓存

本文介绍了一种自我调试技术,智能体通过迭代生成、执行和解释自身代码来发现错误,无需错误信息,准确率提升高达12%,并与生成10倍候选方案的基线持平。

0 人收藏 0 人点赞
#execution-feedback

EXPO-SQL:基于执行的子句级策略优化用于Text-to-SQL

arXiv cs.CL ↗ · 2026-06-24 缓存

EXPO-SQL 提出了一种细粒度的子句级策略优化方法用于 Text-to-SQL,通过执行反馈为每个子句而不是每个查询分配奖励,显著提升了性能,优于现有的监督微调和强化学习方法。

0 人收藏 0 人点赞
#execution-feedback

Evoflux: 针对轻量级智能体的可执行工具工作流的推理时演化

Hugging Face Daily Papers ↗ · 2026-06-10 缓存

Evoflux 在推理时使用进化搜索来修复轻量级语言模型中失败的工具工作流,相比微调方法显著提升了执行可行性。

0 人收藏 0 人点赞
#execution-feedback

从执行结果自举文本到SQL的语义层

arXiv cs.CL ↗ · 2026-06-05 缓存

介绍GATE(从执行结果中测试后接地)方法,该方法从执行反馈中自举缺失的语义接地,以处理文本到SQL任务中未明确指定的用户短语,持续提升超越强基线。

0 人收藏 0 人点赞
#execution-feedback

CP-Agent:一种用于反馈驱动型竞赛编程的校准风险控制代理

arXiv cs.CL ↗ · 2026-05-26 缓存

CP-Agent 提出了一种借助大型语言模型的校准风险控制方法,用于反馈驱动型竞赛编程,无需参数更新即可在基准测试上取得显著改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈