ASI-Bench:在人工超级智能的黎明

Hugging Face Daily Papers 论文

摘要

ASI-Bench 是一个新的基准测试,旨在评估 AI 系统在 11 个科学领域中创新探索和自主科学执行的能力,揭示了当前 AI 对人类指导的严重依赖。

人工超级智能(ASI)要求 AI 不仅掌握现有知识,还要探索未知、创造新知识,并将新想法转化为可验证的结果。然而,当今 AI 系统的能力仍然主要基于学习、压缩和应用现有的人类知识。因此,现有的基准测试主要测试 AI 是否能基于所学知识产生正确答案,或者是否能在广泛的人类指导下完成任务。因此,我们推出 ASI-Bench,这是第一个共同评估 AI 系统在通用研究领域中创新探索和自主科学执行能力的基准测试,也是第一个在同一研究项目中逐步撤除人类方法指导以测试 AI 能独立进展多远的基准测试。由超过 40 名专家耗时 31,000 多小时构建,ASI-Bench 包含 11 个科学领域的 60 个项目级研究任务,并逐步减少方法指导,以测试 AI 是否能独立选择方法、进行研究并产生可验证的结果。所有任务均经过专家评审、AI 辅助审核、沙箱执行和评分者验证。在 18 种最先进的代理模型配置中,平均分数从完全方法指导下的 50.91 下降到仅指定方法时的 29.10,以及代理必须自行确定方法时的 26.62。这一急剧下降表明,当前系统仍然严重依赖人类指导,距离自主进行端到端、项目级科学研究还相差甚远。ASI-Bench 向全球开放。我们邀请各地的研究人员和开发者贡献新任务,挑战当今 AI 的极限,并帮助加速人类共同迈向人工超级智能的道路,详情请访问 https://asibench.apexin.ai/submit。
查看原文
查看缓存全文

缓存时间: 2026/08/19 03:57

论文页面 - ASI-Bench:人工超级智能的黎明

来源:https://huggingface.co/papers/2608.17271 发布于 8月18日

#2 当日推荐论文 (https://huggingface.co/papers/date/2026-08-19) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

人工超级智能(ASI)要求人工智能超越对现有知识的掌握,进而探索未知、创造新知识,并将新思想转化为可验证的成果。然而,当今的人工智能系统的能力仍然主要建立在对现有知识的学习、压缩和应用之上。因此,现有的基准测试主要考察人工智能能否基于已学知识产生正确答案,或能否在广泛的人类指导下完成任务。为此,我们推出了ASI-Bench,这是首个共同评估人工智能系统在通用研究领域中创新性探索与自主科研执行能力的基准测试,也是首个在同一研究项目内逐步撤回人类方法论指导、以测试人工智能能独立走多远的基准。该基准由40多位专家耗时31,000+人时构建,包含11个科学领域中的60个项目级研究任务,并通过逐步减少方法论指导来测试人工智能能否独立选择方法、开展研究并产生可验证的结果。所有任务都经过专家评审、AI辅助审核、沙箱执行和评分器验证。在18种最先进的智能体-模型配置中,平均分从提供完整方法论指导时的50.91分,下降到仅指定方法时的29.10分,再到必须由智能体自主决定方法时的26.62分。这一急剧下降表明,当前系统仍然严重依赖人类指导,距离自主执行端到端的项目级科学研究还相去甚远。ASI-Bench向全球开放。我们邀请各地的研究人员和开发者贡献新任务,挑战当今人工智能的极限,并帮助加速人类通往人工超级智能的共同之路:https://asibench.apexin.ai/submit。

查看 arXiv 页面 (https://arxiv.org/abs/2608.17271)查看 PDF (https://arxiv.org/pdf/2608.17271)项目主页 (https://asibench.apexin.ai/)GitHub (https://github.com/apexin-ai/ASI-Bench)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.17271)

将本文加载至你的智能体:

hf papers read 2608.17271

没有最新版CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

没有链接此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2608.17271 以从本页链接。

引用本文的数据集 2

Apexintelligence-AI/ASI-Bench-seed31415 已更新于 40分钟前 • 775 (https://huggingface.co/datasets/Apexintelligence-AI/ASI-Bench-seed31415)

Apexintelligence-AI/ASI-Bench-seed42 预览 • 已更新于 40分钟前 • 489 (https://huggingface.co/datasets/Apexintelligence-AI/ASI-Bench-seed42)

引用本文的 Spaces 0

没有链接此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2608.17271 以从本页链接。

包含本文的收藏集 0

没有包含此论文的收藏集

将本文添加至收藏集 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

介绍 LifeSciBench

OpenAI Blog

OpenAI 推出 LifeSciBench,这是一个包含 750 个专家编写任务的基准测试,用于评估 AI 系统在现实生命科学研究工作流中的表现,包括证据处理、分析和科学推理。

ASD-Bench:用于自闭症谱系障碍的 AI 模型四维综合基准测试

arXiv cs.LG

本文介绍了 ASD-Bench,这是一个全面的基准测试,从预测性能、校准度、可解释性和鲁棒性四个维度评估用于自闭症谱系障碍(ASD)筛查的 AI 模型。该研究使用 AQ-10 数据分析了不同年龄组的多种模型,强调了在临床 AI 应用中采用多指标评估的重要性。

AgBench:面向个人 AI 设备的智能体 AI 基准测试

arXiv cs.AI

AgBench 推出了一套基准测试和开源工具,用于评估智能体 AI 在个人设备上的表现,在超过 1.62 亿个数据点的基础上,从任务成功率、延迟、API 成本和数据暴露风险等维度对比了本地、混合和云端三种执行方式。研究发现没有哪一种架构占据绝对优势:本地执行虽然降低了云服务成本和隐私风险,但通常会降低任务成功率。