@AlphaSignalAI: 一个4B模型现在可以在科学家之前预测科学突破。研究人员通常通过组…
摘要
一篇新论文介绍了GIANTS-4B,一个通过强化学习训练、拥有40亿参数的模型,它通过结合基础论文中的想法来预测科学见解,在相似度和引文潜力方面优于像Gemini 3 Pro这样的大型模型。
查看缓存全文
缓存时间: 2026/05/23 08:08
一个4B参数模型现在能在科学家之前预见科学突破。
研究人员常常通过结合旧论文中的想法来取得突破。
一篇新论文探讨语言模型能否按需做到同样的事情。
这项任务被称为“洞察预见“。
给模型两篇基础论文,它就能预测基于它们构建的未来论文的核心洞察。
为了测试这一点,研究团队构建了GiantsBench,这是一个覆盖8个科学领域的17000篇论文元组的开放基准。
然后他们使用强化学习训练了GIANTS-4B,奖励它生成接近真实后续论文的洞察。
结果:
相似度分数比Gemini 3 Pro高34% 在引用潜力方面有68%的时间被优先选择 零样本泛化到物理学、生物学、经济学
仅4B参数,完全开源。
该模型产生的想法推理更清晰,而不仅仅是更复杂。
相似文章
一个4b模型现在在网络研究上击败30b模型,原因不在于规模
来自Apodex家族的一个40亿参数开放模型在网页研究基准上优于300亿参数模型,这归因于精心构建的训练数据和自我验证技术,而非原始规模,表明AI能力发展趋向更民主化。
@alex_verem: 一组研究人员刚刚证明,你不需要更大的模型,你需要更聪明的计划。来自清华大学和……
来自清华大学和华南理工大学的研究人员引入了原子任务图(ATG),这是一个框架,通过基于有向图的规划和内部模拟,大幅降低幻觉率,使7B-8B开源模型在不进行微调的情况下,在复杂智能体基准测试中超越GPT-4。
@ModelScope2022:SciJudge-30B和4B学习预测哪些科学工作将具有更强的引用影响力。许可证:Apache-2.0 30B…
ModelScope发布了SciJudge-30B和SciJudge-4B,这两个模型在数百万篇arXiv论文上训练,用于预测引用影响力,达到了超越GPT-5.2和Gemini 3 Pro等更大模型的最先进准确率。
@EXM7777:这项新AI研究刚刚发布,如果你使用AI智能体,它简直疯狂……一个连单一问题都无法回答的微型模型……
一篇新的AI研究论文描述了一个微型模型作为管理者,将任务路由到更大的模型,通过在困难编程基准上编排一组模型而非依赖单一模型,超越了ChatGPT、Gemini和Claude等前沿模型。
@nickscamara_: 新发现将来自能够推理最新科学的模型。科学进步的速率变成…
Firecrawl发布了针对AI/ML论文的顶级研究索引,声称在arXivQA上召回率比竞争对手高出18%,专为自主研究代理设计。