新年特辑!来自 David Cox、Adji Bousso Dieng、Juan M. Lavista Ferres、Tanmay Gupta、Pengtao Xie 和 Sharon Zhou 对 2026 年的展望
摘要
Andrew Ng 提出了一个新的“Turing-AGI Test”,旨在让系统在联网环境下执行实际工作任务,以更准确地评估通用人工智能水平。他指出,“AGI”一词目前已被过度炒作,亟需精确定义,以免利益相关方对 AI 的实际能力产生误判。
《The Batch》AI 新闻与洞察:新年快乐!2026 年会是我们终于实现 AGI 的一年吗?在此,我想提出一种改良版的图灵测试,我将其命名为“Turing-AGI Test”,以此验证我们是否真正达成了这一目标。
查看缓存全文
缓存时间: 2026/04/21 02:13
# 新年特辑!来自 David Cox、Adji Bousso Dieng、Juan M. Lavista Ferres、Tanmay Gupta、Pengtao Xie、Sharon Zhou 的 2026 年展望
来源:https://www.deeplearning.ai/the-batch/issue-334/
亲爱的朋友们,
2026 年快乐!今年会是我们终于实现 AGI 的一年吗?我想提出一个图灵测试的新版本,我将其称为“图灵-AGI 测试”(Turing-AGI Test),来检验我们是否真的达成了这一目标。稍后我会解释为什么制定新测试很重要。
大众认为实现 AGI 意味着计算机将拥有与人类相当的智慧,并能完成大部分或全部的知识型工作。我想提出一项新测试。测试对象——无论是计算机还是专业的熟练人类——将被提供一台能上网并装有网页浏览器和 Zoom 等软件的电脑。评审员会通过电脑为测试对象设计一个多天的体验流程,让其完成工作任务。例如,体验可能包括一段培训期(比如作为客服代表),随后被要求执行任务(接听电话),并接受持续的反馈。这与一名配备完整电脑(但无摄像头)的远程办公员工所面临的工作场景类似。
如果计算机能够像熟练的人类一样出色地完成任务,即视为通过图灵-AGI 测试。
大多数人大概都相信,真正的 AGI 系统应该能通过这项测试。毫无疑问,如果计算机像人类一样聪明,它们理应能像人类员工一样胜任各项工作任务。因此,图灵-AGI 测试符合大众对 AGI 含义的普遍认知。
我们需要新测试的原因在于:“AGI” 已演变成一个炒作词汇,而非具有精确含义的概念。AGI 的一个合理定义是:能够完成人类所能完成的任何智力任务的 AI。当企业宣扬他们可能在几季度内实现 AGI 时,通常会通过设定一个低得多的门槛来为这种说法辩解。这种定义的错位是有害的,因为它让人误以为 AI 的实际能力比真实情况更强大。我发现这种现象正在误导从高中生到 CEO 等各类人群:高中生因为觉得 AGI 即将到来而回避某些专业学习;CEO 们在决定投资项目时,有时甚至假设 1-2 年内 AI 的能力会远超现实可能。
Andrew Ng 的照片:他正坐在大窗前用笔记本写字,背景可见花园和泳池。原始的图灵测试要求计算机通过文字聊天欺骗人类评审,使其无法将其与人类区分开来,但这已不足以表明具备人类水平的智能。Loebner Prize (https://web.archive.org/web/20190220020219/https://aisb.org.uk/events/loebner-prize?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9Gdapm9djJGh5bjVfu2tbqWN2NGQaoQY1MJg11oy1fd03sYlWekSLhRMxIB8oIttbIfJLr) 比赛实际上就运行了图灵测试,结果发现,要骗过评审,能够模拟人类打字错误甚至比真正展示智能更为重要。如今 AI 开发的主要目标是构建能产生经济价值的实用系统,而不是去忽悠评审。因此,衡量实际工作能力的改良版测试,会比衡量欺骗人类能力的测试更有价值。
对于当今几乎所有 AI 基准测试(如 GPQA、AIME、SWE-bench 等),测试集都是提前确定的。这意味着 AI 团队最终至少会间接地将他们的模型针对已发布的测试集进行调优。此外,任何固定的测试集只能衡量智能中极其狭窄的一个侧面。相比之下,在图灵测试中,评审可以自由提问以探知模型的底细。这使得评审能够检验计算机或人类的知识库究竟有多“通用”。同理,在图灵-AGI 测试中,评审可以设计任意体验流程,且该流程不会提前透露给待测的 AI(或人类受试者)。相比于预设的测试集,这是一种衡量 AI 通用性更好的方法。
AI 正处于令人惊叹的发展轨迹上。在过去的几十年里,过度炒高的期望导致了 AI 寒冬,即对 AI 能力的失望引发了兴趣和资金的缩减,直到该领域取得更多进展后才再度回暖。可能会阻碍 AI 巨大发展势头的少数因素之一,就是制造投资泡沫 (https://www.deeplearning.ai/the-batch/understanding-the-ai-bubble-if-there-is-one/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9Gdapm9djJGh5bjVfu2tbqWN2NGQaoQY1MJg11oy1fd03sYlWekSLhRMxIB8oIttbIfJLr) 的不切实际的炒作,这不仅会带来失望,还会导致兴趣崩塌。为了避免这种情况,我们需要重新校准社会对 AI 的预期。开展测试将有所帮助。
如果我们举办一场图灵-AGI 测试竞赛,而所有 AI 系统都未能达标,那其实是一件好事!通过淡化围绕 AGI 的炒作并降低泡沫风险,我们将为持续投资 AI 铺就更可靠的路径。这将使我们能够继续推动真正的技术进步并构建有价值的应用——即使这些应用远未达到 AGI 的水平。而如果这项测试能为团队设定一个明确的目标,让他们朝着实现 AGI 的方向努力并以此为荣,那也会非常棒。我们可以确信,如果有公司通过了这项测试,他们产出的将绝不仅仅是一次营销宣传,而会是极具价值的东西。
新年快乐,祝大家在建设中度过一个精彩的一年!
Andrew
## 2026 年的智能体(Agents)
基础已经就位:AI 模型已具备生成连贯文本、图像、视频及其他数据的能力;能够调用专有数据库;并且可以浏览网页并在互联网上采取行动。准备好迎接智能应用的“寒武纪大爆发”,它们将帮助我们过上更好的生活,并更好地管理我们的组织与社区。在本期《The Batch》特刊中,正如以往的新年特刊 [第282期](https://www.deeplearning.ai/the-batch/issue-282/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9Gdapm9djJGh5bjVfu2tbqWN2NGQaoQY1MJg11oy1fd03sYlWekSLhRMxIB8oIttbIfJLr)、[第229期](https://www.deeplearning.ai/the-batch/issue-229/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9Gdapm9djJGh5bjVfu2tbqWN2NGQaoQY1MJg11oy1fd03sYlWekSLhRMxIB8oIttbIfJLr)、[第177期](https://www.deeplearning.ai/the-batch/issue-177/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9Gdapm9djJGh5bjVfu2tbqWN2NGQaoQY1MJg11oy1fd03sYlWekSLhRMxIB8oIttbIfJLr)、[第125期](https://www.deeplearning.ai/the-batch/issue-125/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9Gdapm9djJGh5bjVfu2tbqWN2NGQaoQY1MJg11oy1fd03sYlWekSLhRMxIB8oIttbIfJLr)、[第72期](https://www.deeplearning.ai/the-batch/issue-72/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9Gdapm9djJGh5bjVfu2tbqWN2NGQaoQY1MJg11oy1fd03sYlWekSLhRMxIB8oIttbIfJLr) 及 [第20期](https://www.deeplearning.ai/the-batch/issue-20/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9Gdapm9djJGh5bjVfu2tbqWN2NGQaoQY1MJg11oy1fd03sYlWekSLhRMxIB8oIttbIfJLr) 所呈现的那样,一些最杰出的 AI 专家分享了他们对未来的期许。
---
David Cox 的照片:他在玻璃墙办公室中进行讨论,契合开源创新与团队协作的主题。## 开源必胜
我的希望是,开放 AI 能够继续蓬勃发展并最终赢得未来。
开放生态一直是真正创新的引擎。它让社区能够建立在数十年的进步之上,调动集体人才的力量,而不仅仅依赖单一公司的资源。早在 20 世纪 90 年代,Linux、Apache 和 Eclipse 等开放软件就曾挑战占据主导地位的专有系统。那场抗争塑造了我们今天所熟知的互联网。如今,同样的原则也必须指引 AI 的演进。
这种平行关系令人不安。一些玩家正试图像当年微软在向发展中国家倾销免费 Windows 副本以遏制 Linux 站稳脚跟时所做的事情一样,独占和控制 AI。
如同过去微软免费发放的软盘一样,主要的 AI 开发者推出了所谓的“开放模型”,但实际上并不开放。他们不公开任何关于训练集或算法公式的信息,并对你能赚取的营收设置上限。这一切都是为了阻止其他任何人获得优势,从而让你的产品脱颖而出。
但真正开放 AI 的潜力至关重要。AI 不应被任何个人或单一公司垄断,也不应仅仅代表某一家公司的价值观。更重要的是,每个人都能参与塑造它的未来,无论他们是其他公司的员工、学者还是普通用户。
开放开发具有重要优势。首先,它能降低厂商锁定(vendor lock-in)的风险。没有人愿意被困在一个通过 API 运作、最终成为关键基础设施的专有模型上。其次,它支持更高的定制化程度。你不仅在法律上有权自定义开放模型(包括用它衍生出闭源模型),而且因为你了解其构建原理,重新改造它也更容易。
目前中国拥有一个蓬勃发展的开放生态。那里的开发者取得了惊人的成就。但也存在一种微妙的地缘政治阴影。各国之间缺乏互信。中国不信任美国,美国不信任中国,欧洲也对两者心存疑虑。使用被污染的数据训练模型很容易就会引入后门。而真正的开放开发能解决这一问题,因为所有人都清楚训练集的来源以及如何获取的。
在 IBM,我们一直在践行这一理念。我们会发布模型的详细信息、训练方式,尤其是训练所使用的数据。斯坦福透明度指数 (https://hai.stanford.edu/news/transparency-in-ai-is-on-the-decline?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9RXwJZjE8B84jXW0-hijBoadoSCoEoGapXTd9lWYKApL7h_n_e2MHZv96uqNoev-MvcifE) 将我们置于榜首,得分高达 95%,领先第二名 23 分。我们并非孤军奋战。艾伦人工智能研究所(The Allen Institute)也做出了令人瞩目的工作,中国的开发者也在付诸实践——但又回到了上述的地缘政治问题。美国不信任来自中国的模型,中国也不信任来自美国的模型。
我们知道 IBM 素以谨慎著称。但谨慎未必是坏事。“无聊”意味着稳定;它是你可以依托的基础。同时,IBM 也热衷于实验。正是这种稳定的基础,让你能在不担心系统崩溃的前提下从事前沿工作。让我们在今年的 AI 发展中做到更加开放、更具实验精神,或许也稍微保守一点。
*David Cox 是 IBM Research 的 AI 模型副总裁兼 MIT-IBM Watson AI Lab 主任。此前,他曾在哈佛大学讲授自然科学、应用科学和工程学。*
---
Adji Bousso Dieng 的照片:她在暖光下的房间里使用笔记本电脑,专注于 AI 驱动的科学研究。## AI 助力科学发现
## 作者:Adji Bousso Dieng
2026 年,我希望 AI 能从提升效率的工具转变为科学发现的催化剂。
过去十年,深度学习的主导范式是插值(interpolation)。我们构建了极其强大的模型,擅长模仿其训练数据的分布。这对于当前 AI 擅长的应用场景恰到好处,例如对话代理和编程助手,它们只需通过识别现有数据中的统计模式就能回答问题。这一范式甚至催生了成功的科学应用,例如 AlphaFold,它能够解决那些可建模为监督学习问题的科学挑战。
然而,在该范式下,模型在处理极少见的样本(即数据分布的尾部)时会遇到困难。例如,在我们与 VendiScope (https://arxiv.org/abs/2502.10828?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9Gdapm9djJGh5bjVfu2tbqWN2NGQaoQY1MJg11oy1fd03sYlWekSLhRMxIB8oIttbIfJLr) 的合作中——这是我们开发的一款用于审计数据集的工具——我们发现,即便是 AlphaFold,也难以预测稀有蛋白质的 3D 结构。此外,物理学领域的许多重大挑战,从从头设计蛋白质到发现能捕获大气中 CO2 的新型金属有机框架(MOFs),都无法被表述为监督学习问题。相反,它们属于探索性问题,其核心在于寻找稀缺的事物。
在这些场景下,分布的主模态往往在科学上缺乏吸引力,因为它们更多地代表我们已经知道的内容。2026 年,我希望我们能最终破解探索的密码,转向能够驯服分布尾部、甚至发现分布外(out-of-distribution)有意义事物的技术。目标是找到自然界允许存在但我们尚未目睹的现象。
要实现从插值到探索的飞跃,AI 社区必须优先考虑驱动机器学习的目标函数的根本性转变。我们需要超越单纯最大化准确率和概率似然性的目标,因为这些目标本质上会将模型推向插值并坍缩至数据分布的主模态。相反,我们需要将多样性提升为一等公民的目标(first-class objective),而不是仅将其作为一种模糊的社会技术规范来追求公平。
在我所在的实验室 Vertaix (https://x.com/Vertaix_?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9Gdapm9djJGh5bjVfu2tbqWN2NGQaoQY1MJg11oy1fd03sYlWekSLhRMxIB8oIttbIfJLr) 中,我们通过开发 Vendi Score (https://github.com/vertaix/Vendi-Score?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9Gdapm9djJGh5bjVfu2tbqWN2NGQaoQY1MJg11oy1fd03sYlWekSLhRMxIB8oIttbIfJLr) 引领了这一研究方向。在关于材料发现的研究 (https://pubs.rsc.org/en/content/articlelanding/2024/sc/d4sc03609c?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9Gdapm9djJGh5bjVfu2tbqWN2NGQaoQY1MJg11oy1fd03sYlWekSLhRMxIB8oIttbIfJLr) 中,我们发现优化 Vendi Score 使我们能够识别出稳定且节能的 MOFs,而这些是标准搜索方法遗漏的,因为后者无法有效探索涵盖数万亿种材料的搜索空间。
2026 年,我们应停止将多样性仅仅视为次要的评估指标,而是开始将其作为探索的核心数学引擎。如果我们做出这一转变,AI 将不再只是人类知识的模仿者,而是将成为拓展知识疆界的真正伙伴。
*Adji Bousso Dieng 是普林斯顿大学 Vertaix 研究实验室创始人,也是国家科学基金会(NSF)数据驱动动态设计研究所的共同首席研究员。她是非营利组织 The Africa I Know (https://www.theafricaiknow.org/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9Gdapm9djJGh5bjVfu2tbqWN2NGQaoQY1MJg11oy1fd03sYlWekSLhRMxIB8oIttbIfJLr) 的创始人,该组织致力于支持非洲青少年的 STEM 教育。*
---
Juan M. Lavista Ferres 的照片:他手持笔记本电脑,学生们正在屏幕前观看关于 AI 的视频,体现了教育与科技的融合。## 顺势而为的教育:与 AI 协作而非对抗
## 作者:Juan M. Lavista Ferres
三年多前,OpenAI 发布了 ChatGPT,教育从此彻底改变。对学生而言,几秒钟内按需生成流畅、可信文本的能力是一项不可思议的新工具。对教育工作者来说,这是一种全新的挑战。在接下来的这一年里,我希望教育界能与 AI 作为教育工具这一现实和解,并集中精力开发在生成式媒体时代可靠评估学生表现的方法。
ChatGPT 问世后的几个月里,一个令人安心的故事被广泛传播:如果生成式 AI
相似文章
DeepMind 创始人 Demis Hassabis 刚刚发布了今年关于 AGI 最重要的文章。以下是解读。
Demis Hassabis 发表了一篇关于 AGI 的框架文章,认为 AGI 还需几年时间,其经济影响可能达到工业革命的 10 倍。他还提议建立一个类似于 FINRA 的公共-私营前沿 AI 标准机构,用于部署前测试和风险评估。
@agisummitai: 演讲者聚焦:Christopher Manning @chrmanning 迈向更强大AI的路径离不开对语言的更深理解…
AGI Summit 2026 宣布,为期两天的人工智能大会将在旧金山举行,邀请领先研究人员和行业人士,包括 Christopher Manning、Sebastian Thrun,以及 OpenAI 和 Anthropic 的代表。
AGI 2030
关于2030年可能实现通用人工智能(AGI)的讨论或预测。
@WSInsights: https://x.com/WSInsights/status/2052986400740638991
一篇关于红杉资本2026年AI Ascent闭门峰会的中文分析文章,总结了与会嘉宾(包括Demis Hassabis、Andrej Karpathy、Greg Brockman等)的核心观点:AGI已经到来、2026年是Agent之年、AI将重塑白领职场格局,并给出了6步普通人应对方案。
衡量通向AGI的进展:一个认知框架
Google DeepMind发布了一篇论文,提出了一个衡量通向通用人工智能(AGI)进展的认知框架,识别了十项关键认知能力,并发起了一场Kaggle黑客马拉松以构建相关评估方法。