synthetic-environments

标签

Cards List
#synthetic-environments

@rohanpaul_ai:你的代理训练环境应该和评估集一样吗?AgentMercury说不,并且展示了从…构建的世界能更广泛地迁移。

X AI KOLs Following · 2026-08-27 缓存

AgentMercury表明,在基于纯文本描述生成的模拟商业环境中训练AI代理,即使训练环境与评估基准无关,也能有效迁移到评估基准。该系统通过在构建轨迹上进行微调提升了性能。

0 人收藏 0 人点赞
#synthetic-environments

训练需要可信的世界:用于智能体学习的验证合成网络环境

arXiv cs.AI · 2026-08-25 缓存

本文介绍了一个构建验证合成网络环境的框架,以改进网络智能体的训练,展示了在基准测试中增强的性能和可迁移性。

0 人收藏 0 人点赞
#synthetic-environments

SPADE:自适应合成可执行环境中的自我博弈

Hugging Face Daily Papers · 2026-08-19 缓存

SPADE 引入了一种针对语言模型的自我博弈强化学习框架,该框架生成自适应的可执行训练环境,以增强推理和工具使用能力,并在多个基准测试中展示了显著的性能提升。

0 人收藏 0 人点赞
#synthetic-environments

@Vtrivedy10:基于人类反馈的合成环境生成——智能体作为一次性评估/环境生成器表现不佳,因为它们……

X AI KOLs Following · 2026-08-04 缓存

一条推文,介绍来自 langchain-ai/langchain-skills 的 eval-engineering 技能,该技能利用人类反馈为智能体评估生成对齐的环境、测试框架(harness)和任务。它解释了工作流程,并提供了该开源工具的安装说明。

0 人收藏 0 人点赞
#synthetic-environments

@Azaliamirh: 看看TRACE,这是一种新的自我改进方法,代理识别自身失败背后缺少的能力并自我训练以解决这些问题……

X AI KOLs Timeline · 2026-07-09 缓存

TRACE是一种新的自我改进方法,AI代理识别自身失败背后缺少的能力,并自我训练以解决这些问题。经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,以更少的训练次数超越了更大的模型。

0 人收藏 0 人点赞
#synthetic-environments

超越下一个词元预测:面向Atlassian工作流程中工具使用智能体的RLVR概念验证

arXiv cs.AI · 2026-07-03 缓存

本文提出了一项概念验证,使用基于可验证奖励的强化学习(RLVR)来训练小型语言模型,使其能够在Jira和Confluence等企业SaaS工作流程中使用工具。该方法利用合成环境和GRPO训练来提高工具调用准确率,相较于基线取得了显著的奖励增益。

0 人收藏 0 人点赞
#synthetic-environments

Patronus AI获得5000万美元融资,用于构建对AI智能体进行压力测试的“数字世界”

TechCrunch AI · 2026-06-25 缓存

Patronus AI完成5000万美元B轮融资,用于构建模拟数字世界以对AI智能体进行压力测试,帮助确保它们在现实场景中可靠运行。

0 人收藏 0 人点赞
#synthetic-environments

HalluWorld:基于参考世界模型的可控幻觉基准

arXiv cs.CL · 2026-05-20 缓存

HalluWorld 是一个可控基准框架,通过显式的参考世界模型在网格世界、国际象棋和实际终端任务等合成环境中评估大型语言模型中的幻觉。它可以细粒度分析各种故障模式,例如感知幻觉、多步状态追踪和因果模拟,揭示出前沿模型在处理扩展思维无法解决的复杂推理时仍然存在困难。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈