@Ex0byt: 一个必须收藏的.. 小但厉害的团队, 4个H100节点, 开源三阶段训练方案, 在8k合成评分任务上训练, fu…
摘要
一个小团队在学术预算下,仅使用32块H100和8K个合成样本,训练了一个前沿级别的深度研究智能体,并完全公开了从2B到35B模型的权重、代码和论文,这些模型在关键基准测试中匹配或超越了封闭的前沿智能体。
查看缓存全文
缓存时间: 2026/06/18 14:17
一个必须收藏..小小的破解团队,4个H100节点,开源3阶段方案,在8K合成任务上训练,完全开放权重、代码和论文;结果是一个35B模型,在关键基准上匹配或击败了封闭的前沿深度研究代理。这个模型产生的轨迹是黄金。
Yu Su (@ysu_nlp): 我们在学术预算下训练了一个~前沿的深度研究代理
> 32个H100 > 8K合成样本 > 完全开放训练基础设施 + 方案(SFT、中期训练、RL) > 不同大小的模型(2B -> 35B)开箱即用
这又一次展示了前沿的边界
相似文章
@KaiZhang_CS: 看看由 @jianxie_ 训练的最佳开源搜索代理之一!!很高兴看到早期经验方法在……
Yu Su 的团队在有限的学术预算下训练了一个前沿的 Deep Research Agent,使用 8K 合成样本和强化学习,并发布了完全开放的训练基础设施和从 2B 到 35B 参数的模型。
研究人员使用32块H100 GPU训练了一个Deep Research智能体,并开源了所有内容
研究人员使用32块H100 GPU训练了一个Deep Research智能体,并开源了所有组件,从而促进了社区访问和进一步开发。
DR-Venus:仅用1万开源数据打造边缘级前沿深度研究智能体
DR-Venus-4B 是一个40亿参数的深研智能体,仅利用1万条开源样本,通过「智能体SFT+回合级奖励RL」训练,在多项研究基准上超越以往90亿以下模型,逼近300亿级系统,且可部署于边缘设备。
@Apodex_AI: 深入阅读博客:https://apodex.com/blog/apodex-1.0 技术报告:http://apodex.com/pdf/20260608 GitHub:https://github.com…
ApodexAI 发布了 Apodex-1.0,这是一个深度研究模型,作为使用工具的 ReAct 代理运行。其重型模式 Apodex-1.0-H 采用异步代理团队,最多包含 150 个子代理,在深度研究基准测试(包括 BrowseComp、DeepSearchQA、HLE 和 FrontierScience)上取得了新的最先进结果,超越了 GPT-5.5-pro 和 Claude-Opus-4.8 等模型。
@heyshrutimishra: Apodex 1.0 发布,架构确实与众不同。它基于 Qwen3.5 进行后训练,成为一个自我进化的系统:…
Apodex 1.0 是一个基于 Qwen3.5 后训练的自我进化 AI 系统,在 BrowseComp、DeepSearchQA 和 HLE-text 上达到 SOTA。其 4B 迷你模型性能超越 30B 级别模型,并配有 AgentOS 运行时用于任务编排。开放权重可用。