AI 现在正被评估其是否能真正进行实验室科学,而不仅仅是回答问题:包括运行实验、操作设备、读取仪器以及从失败中恢复。

Reddit r/singularity 新闻

摘要

AI 系统现正接受评估,以检验其在实际实验室任务中的表现,如运行实验、操作设备、读取仪器和从失败中恢复,这标志着从理论科学到应用科学的转变。

暂无内容
查看原文

相似文章

ASI-Bench:在人工超级智能的黎明

Hugging Face Daily Papers

ASI-Bench 是一个新的基准测试,旨在评估 AI 系统在 11 个科学领域中创新探索和自主科学执行的能力,揭示了当前 AI 对人类指导的严重依赖。

感觉AI正在进入其“基础设施问题”阶段

Reddit r/artificial

文章强调了AI行业的一个转变,焦点正从单纯的模型基准性能转向延迟、编排和成本效率等基础设施挑战。这表明AI正成熟为一个系统问题,实际体验变得比原始模型能力更重要。