@dlouapre: 认识一下 physics-intern,我们为理论物理打造的智能体框架。它使 Gemini 3.1 Pro 在 Crit… 上的成绩从 17.7% 提升至 31.4%。
摘要
Physics-intern 是一个为理论物理设计的智能体框架,它将 Gemini 3.1 Pro 在 CritPt 基准测试上的表现从 17.7% 提升至 31.4%,达到了新的最优水平。
认识一下 physics-intern,我们为理论物理打造的智能体框架。它使 Gemini 3.1 Pro 在 CritPt(大语言模型最难的基准测试之一)上的成绩从 17.7% 提升至 31.4%,达到了新的最优水平。理论物理对人类和大语言模型而言都很难。但 physics-intern 能够分解问题并分派给一组专业智能体,从而比基础模型独自解决研究级问题有效得多。
相似文章
@lvwerra:我们发布了physics-intern:一个用于科学问题的简单工具!它能让Gemini 3.1 Pro等模型的性能从17.7提升至…
发布了physics-intern,一个简单工具,能显著提升Gemini 3.1 Pro等推理模型在科学问题上的性能,从17.7提升到31.4,超越了GPT 5.5 Pro。
面向理论物理研究的智能体框架
Hugging Face 发布了“physics-intern”,这是一个用于理论物理研究的智能体框架。该框架使 Gemini 模型在 CritPt 基准测试上的性能翻倍,并与 GPT-5.5 Pro 相比达到了新的最先进水平。
使用 Gemini Deep Think 加速数学与科学发现
DeepMind 宣布 Gemini Deep Think 具备解决数学、物理学和计算机科学领域专业研究问题的能力,其核心亮点在于全新智能体 "Aletheia",能够迭代式地验证和修正解决方案。
Gemini 3.5:前沿智能与行动力
Google 发布 Gemini 3.5,一个全新 AI 模型系列,聚焦智能体工作流与编程,首发 3.5 Flash 以高速提供前沿性能。
@interjc: Gemini 3.5 Pro 快着点儿吧,我都要把你开除出御三家了
据泄露的基准测试结果,Gemini 3.5 Pro 在内部评估中性能超过 Claude Fable 5 和 GPT-5.6,零样本性能相比 3.1 Pro 有显著提升,目前处于私下验证测试阶段,即将公开推出。