@Ex0byt: 一个必须收藏的.. 小但厉害的团队, 4个H100节点, 开源三阶段训练方案, 在8k合成评分任务上训练, fu…

X AI KOLs Timeline 模型

摘要

一个小团队在学术预算下,仅使用32块H100和8K个合成样本,训练了一个前沿级别的深度研究智能体,并完全公开了从2B到35B模型的权重、代码和论文,这些模型在关键基准测试中匹配或超越了封闭的前沿智能体。

一个必须收藏的.. 小而强的团队, 4个H100节点, 开源的三阶段训练方案, 在8k个合成评分任务上训练, 完全公开权重、代码和论文; 结果是一个35B模型, 在关键基准测试中匹配或击败了封闭的前沿深度研究智能体。该模型产生的追踪记录是金子。
查看原文
查看缓存全文

缓存时间: 2026/06/18 14:17

一个必须收藏..小小的破解团队,4个H100节点,开源3阶段方案,在8K合成任务上训练,完全开放权重、代码和论文;结果是一个35B模型,在关键基准上匹配或击败了封闭的前沿深度研究代理。这个模型产生的轨迹是黄金。

Yu Su (@ysu_nlp): 我们在学术预算下训练了一个~前沿的深度研究代理

> 32个H100 > 8K合成样本 > 完全开放训练基础设施 + 方案(SFT、中期训练、RL) > 不同大小的模型(2B -> 35B)开箱即用

这又一次展示了前沿的边界

相似文章

@Apodex_AI: 深入阅读博客:https://apodex.com/blog/apodex-1.0 技术报告:http://apodex.com/pdf/20260608 GitHub:https://github.com…

X AI KOLs Following

ApodexAI 发布了 Apodex-1.0,这是一个深度研究模型,作为使用工具的 ReAct 代理运行。其重型模式 Apodex-1.0-H 采用异步代理团队,最多包含 150 个子代理,在深度研究基准测试(包括 BrowseComp、DeepSearchQA、HLE 和 FrontierScience)上取得了新的最先进结果,超越了 GPT-5.5-pro 和 Claude-Opus-4.8 等模型。