@KaiZhang_CS: 看看由 @jianxie_ 训练的最佳开源搜索代理之一!!很高兴看到早期经验方法在……

X AI KOLs Timeline 模型

摘要

Yu Su 的团队在有限的学术预算下训练了一个前沿的 Deep Research Agent,使用 8K 合成样本和强化学习,并发布了完全开放的训练基础设施和从 2B 到 35B 参数的模型。

看看由 @jianxie_ 训练的最佳开源搜索代理之一!!很高兴看到早期经验方法在前沿代理上奏效!😀
查看原文
查看缓存全文

缓存时间: 2026/06/18 10:12

看看由 @jianxie_ 训练的顶尖开源搜索代理!!很开心看到早期经验方法在前沿代理上照样奏效了!😀

Yu Su (@ysu_nlp): 我们用学术预算训练了一个接近前沿的深度研究代理

> 32 块 H100
> 8000 个合成样本
> 完全开源训练基础设施和配方(SFT、中期训练、RL)
> 不同尺寸的模型(2B 到 35B),开箱即用

这又一次展示了前沿领域是如何的

相似文章