@ModelScope2022:SciJudge-30B和4B学习预测哪些科学工作将具有更强的引用影响力。许可证:Apache-2.0 30B…
摘要
ModelScope发布了SciJudge-30B和SciJudge-4B,这两个模型在数百万篇arXiv论文上训练,用于预测引用影响力,达到了超越GPT-5.2和Gemini 3 Pro等更大模型的最先进准确率。
查看缓存全文
缓存时间: 2026/07/03 02:29
SciJudge-30B和4B学习预测哪些科学成果将产生更强的引用影响力。 许可协议:Apache-2.0
30B https://modelscope.ai/models/openmoss/SciJudge-30B-2605… 4B https://modelscope.ai/models/openmoss/SciJudge-4B-2605… https://modelscope.ai/papers/2603.14473…
科学裁判准确率:SciJudge-30B在领域内达到80.6%,超越GPT-5.2、GLM-5和Gemini 3 Pro;SciJudge-4B同样优于规模更大的基线模型
数据信号:基于210万篇arXiv论文和69.6万对经过领域和时间匹配的引文偏好数据构建
训练方法:采用基于GRPO的DAPO损失函数及引文配对奖励机制
相似文章
@AlphaSignalAI: 一个4B模型现在可以在科学家之前预测科学突破。研究人员通常通过组…
一篇新论文介绍了GIANTS-4B,一个通过强化学习训练、拥有40亿参数的模型,它通过结合基础论文中的想法来预测科学见解,在相似度和引文潜力方面优于像Gemini 3 Pro这样的大型模型。
MOOSE-Star (ICML 2026): 7B模型 + 108K论文数据集用于科学假设发现
MOOSE-Star 提出了一个从 DeepSeek-R1-Distill-Qwen-7B 微调而来的 7B 模型,用于科学假设发现,同时附带一个包含 108K NCBI 论文的数据集。该模型在灵感检索准确率上达到了最先进水平,超越了像 GPT-5.4 和 Gemini-3 Pro 这样更大的模型。
科学写作评估的奖励建模
本文提出 SciRM,一种经济高效的开源奖励模型,通过两阶段训练框架专门用于评估科学写作,该框架优化了评估偏好和推理能力。这些模型可以泛化到多种科学写作任务,无需任务特定的重新训练,解决了现有基于 LLM 的评判器在特定领域评估标准上的局限性。
@jinyuhou0: 在主流基准测试中,我们的30B模型与规模大20-30倍的系统(gpt-5.4-xhigh、DeepSeek-V3.2、Kimi-K2.5)匹敌,而……
一款新的30B模型在主流基准测试中与规模大20-30倍的系统匹敌,同时相比同类30/32B智能体大语言模型,使用的推理令牌减少高达95%。这是通过一个学习型配置器实现的,该配置器决定何时以及如何进行推理。模型和代码已开放。
@VikParuchuri: 我们正在开源一个9B模型,它可以从文档中提取结构化数据,性能接近前沿水平。 - 90.2% 在我们基准测试上…
Vik Paruchuri 正在开源一个9B模型,该模型可以从文档中提取结构化数据,性能接近前沿水平(在其基准测试中达到90.2%,而Gemini 3.5 Flash为91.3%)。