@askalphaxiv: 这里是我们全新功能 OpenResearch 的早期预览,用于复现和基于论文进行实验。我们…
摘要
名为 OpenResearch 的新功能支持复现和基于论文进行实验,通过一键模板即可在 ToolRL 上训练 Vector Policy Optimization (VPO),从而实现多样化的答案生成并改进测试时搜索。
查看缓存全文
缓存时间: 2026/05/26 19:13
以下是OpenResearch的早期预览,这是我们全新的功能,用于复现论文并在此基础上进行实验。
我们制作了一个模板,让你只需点击一次,就能在单GPU上基于ToolRL训练VPO(向量策略优化)。
向量策略优化通过随机加权奖励维度,让模型生成多样化的答案集,使得每个答案专注于不同的权衡点。
结果是在样本预算增长时,测试时的搜索效果更佳。快来查看吧!
相似文章
alphaXiv/OpenResearch
OpenResearch是一个本地优先的工作区,允许使用AI模型如Claude Code和Codex创建研究代理,以执行自主任务,例如文献综述、实验自动化和研究产物生成。
@trendtech33566: 【突发新闻】一款完全以开放方式复现Deep Research工作流程的开源软件(OSS)已出现——OpenResearcher……
OpenResearcher是一个开源项目,它完全复现了Deep Research的工作流程,并提供了数据集、模型和演示。它使研究人员和AI智能体开发者能够以开放的方式构建、训练和评估深度研究管道。
@seclink: 另一个开源样本... 通常,你得为此付费,但既然它是开源的,它绝对是那些在手中不那么有价值的东西之一,所以他们将其作为开源发布。
这篇文章宣布了Autoresearch Bench,一个用于编码代理自主解决研究问题的开源基准测试,指出模型在自主研究循环中存在显著差异。
@VukRosic99: DeepSeek 研究员刚刚开源了他的个人项目 AutoResearch。该项目首次实现了自动化研究代理...
DeepSeek 研究员开源了 AutoResearch,这是一个自主框架,能够在无需人工干预的情况下,为 DeepSeek 285B 模型规划、执行并调试强化学习实验,并附带了一篇关于自我对弈的综述论文。
@JeremyNguyenPhD: OpenDraft:“研究论文的Claude Code”。19个专业智能体并行进行科研工作。开源。可能…
OpenDraft 是一款开源工具,它通过并行运行19个专业AI智能体来辅助研究论文写作和文献综述,被形容为“研究论文的Claude Code”。