Stargazer:面向天体物理约束下 AI 智能体的可扩展模型拟合基准环境

Hugging Face Daily Papers 论文

摘要

Stargazer 推出包含 120 项天体物理任务的可扩展基准环境,通过径向速度数据物理约束模型拟合评估 AI 智能体,揭示统计优化与物理约束遵循之间的落差。

自主 AI 智能体的兴起,要求构建具备科学任务实时反馈的动态基准环境,以衡量其在科研场景中的能力。我们推出 Stargazer,一个可扩展环境,用于评估 AI 智能体在动态、迭代的物理约束模型拟合任务中对径向速度(RV)时间序列数据的推理表现。Stargazer 共含 120 项任务,分三个难度层级,包括 20 个真实存档案例,覆盖从高信噪比单行星系统到需复杂低信噪比分析的多行星配置等多样场景。我们对八款前沿智能体的评估显示,数值优化与物理约束遵循之间存在落差:尽管智能体常能获得良好统计拟合,却频繁无法还原正确的物理系统参数,即便配备 vanilla 技能亦如此。此外,增加测试时计算仅带来边际收益,过量 token 消耗往往反映递归失败循环,而非有意义的探索。Stargazer 为训练、评估、搭建与扩展当今具有实际研究价值的模型拟合策略提供契机。我们构建仿真驱动环境的方法论,有望推广至众多其他科学领域的模型拟合问题。源代码与项目网站分别见 https://github.com/Gudmorning2025/Stargazer 与 https://gudmorning2025.github.io/Stargazer。
查看原文
查看缓存全文

缓存时间: 2026/04/23 03:35

论文页面 - Stargazer:面向天体物理约束下 AI 智能体的可扩展模型拟合基准环境

来源:https://huggingface.co/papers/2604.15664

摘要

Stargazer 是一个可扩展环境,用于在径向速度时序数据上评估 AI 智能体在动态物理模型拟合任务中的表现,揭示了统计拟合与物理约束遵循之间的落差。

随着自主 AI 智能体(https://huggingface.co/papers?q=AI%20agents)的兴起,需要内置科学任务反馈的动态基准环境(https://huggingface.co/papers?q=dynamic%20benchmark%20environments)来评估它们在科研中的能力。我们推出 Stargazer,一个可扩展环境,用于在径向速度(RV)时序数据上评估 AI 智能体(https://huggingface.co/papers?q=AI%20agents)在动态、迭代的物理模型拟合任务(https://huggingface.co/papers?q=model-fitting%20tasks)中的表现。Stargazer 包含 120 个任务,分三个难度等级,其中 20 个为真实存档案例,覆盖从高信噪比单行星系统到需要复杂低信噪比分析的多行星构型等多种场景。我们对 8 个前沿智能体的评估发现,数值优化与物理约束遵循之间存在明显差距:尽管智能体常能获得良好的统计拟合,却频繁无法恢复正确的物理系统参数,即使配备 vanilla 技能亦如此。此外,增加测试时计算量仅带来边际收益,过度的 token 消耗往往反映的是递归失败循环而非有意义的探索。Stargazer 为在今日仍具实际研究意义的模型拟合问题上训练、评估、搭建与扩展策略提供了机会。我们设计仿真驱动环境(https://huggingface.co/papers?q=simulation-driven%20environment)以评估 AI 智能体(https://huggingface.co/papers?q=AI%20agents)的方法,有望推广至众多科学领域的模型拟合问题。源代码与项目网站分别见 https://github.com/Gudmorning2025/Stargazer 与 https://gudmorning2025.github.io/Stargazer。

查看 arXiv 页面(https://arxiv.org/abs/2604.15664)
查看 PDF(https://arxiv.org/pdf/2604.15664)
项目主页(https://aips-uoft.github.io/Stargazer/)
GitHub(https://github.com/AIPS-UofT/Stargazer)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.15664)

在智能体中获取该论文:

hf papers read 2604.15664

未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

暂无模型引用

在模型 README.md 中引用 arxiv.org/abs/2604.15664 即可在此页面显示链接。

引用本文的数据集 1

liuxinge/Stargazer 预览 • 2 天前更新 • 62 • 2(https://huggingface.co/datasets/liuxinge/Stargazer)

引用本文的 Spaces 0

暂无 Space 引用

在 Space README.md 中引用 arxiv.org/abs/2604.15664 即可在此页面显示链接。

包含本文的 Collections 0

暂无 Collection 包含

将本文添加到收藏(https://huggingface.co/new-collection)即可在此页面显示链接。

相似文章

跨尺度科学挑战的AI智能体基准测试

arXiv cs.AI

介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。

VESTA:基于统计工具代理的视觉探索

arXiv cs.AI

本文介绍了VESTA,一个为视觉-语言模型配备动态增长工具包的框架,用于数据探索和统计模型优化,在复杂的科学建模任务上优于先前的基于代理的方法。作者还提出了Dawn基准,用于分布拟合和时间序列建模,涵盖真实的天文学挑战。