使AI预测变得困难的摩擦(8分钟阅读)

TLDR AI 新闻

摘要

一篇文章讨论为何AI预测很困难,强调能力提升往往无法转化为端到端的影响,原因在于社会、制度性和隐性瓶颈,并以放射学作为案例研究。

当能力提升被误认为是端到端的影响时,AI预测就会失败,因为现实世界的工作流程包含社会、制度性、物理和隐性瓶颈。更好的预测需要从业者参与、跨框架的研究,衡量AI是否真正改变了限制性步骤,而不仅仅是单一项任务。
查看原文
查看缓存全文

缓存时间: 2026/08/12 20:20

当能力提升被误认为端到端影响时,AI 预测就会失败,因为现实世界的工作流程包含社会性、制度性、物理性和隐性知识瓶颈。更好的预测需要由从业者参与、跨框架的研究,衡量 AI 是否真正改变了限制性环节,而不仅仅是一个任务。


让 AI 预测变得困难的摩擦因素

要更好地预测 AI 对任何行业的影响,你必须理解它对整个生态系统的整体影响。AI 可能优化了工作流程中的某个环节,但当其他环节消化这种加速时,结果会如何?瓶颈会在哪里产生,它们能否被清除?如果不能,整体吞吐量就不会增加。

AI 预测既关乎预测 AI 系统将具备什么能力,也关乎这些能力将如何影响行业、机构和日常生活。后者要困难得多。

“这不是你能从第一性原理推导出来的东西,”@Abi0lvera 上周与我谈论 AI 预测时这样告诉我。我最初联系 Abi 是因为她最近的一篇文章,她在其中从生物安全的角度讨论了 AI 预测。

Abi 曾在美国国务院担任外交官超过七年,工作涉及危机应对、国家安全、中国事务、国际协调和新兴技术风险。她曾在达喀尔和开罗任职,在开罗期间专注于埃及 120 亿美元的国际货币基金组织项目。她还在中国事务办公室从事网络安全和执法问题的工作。在她的职业生涯中,她不得不思考贫困、国家安全、危机应对、能源、生物安全、网络安全,以及那些必须在技术变化快于政策变化时做出回应的机构。如今,Abi 撰写 Positive Sum Substack 通讯,并正在创办一个专注于国家能力和经济瓶颈的组织。她还是金门研究所的特别顾问,以及 AI 政策与战略研究所的附属研究员。

在我们的对话中,Abi 和我讨论了她在预测差距方面看到的最大风险、这些差距的驱动因素,以及如何帮助修复这些问题。

预测差距

当人们认为获取信息等同于有能力据此采取行动时,预测差距就出现了。AI 让某个领域更容易理解,但并不一定让工作更容易执行。

以放射学为例。2016 年,杰弗里·辛顿在多伦多的一场机器学习会议上说,“人们应该停止培训放射科医生”,因为深度学习将在五年内超越他们,这是“完全显而易见的”。虽然 AI 在放射学中已经变得非常有价值(FDA 已批准了数百种 AI 驱动的医学影像工具),但劳动力市场预测却大错特错。放射学并没有消失;实际上需求还在增长。在梅奥诊所——最积极采用 AI 的机构之一——据报道,自 2016 年以来放射科员工人数增长了 55%,同时该部门建立了一支 40 人的 AI 团队并使用了 250 多个 AI 模型。

“已经取得了惊人的进展,但这些 AI 工具大多数只寻找单一目标,”宾夕法尼亚大学佩雷尔曼医学院放射学教授、《放射学:人工智能》期刊主编小查尔斯·E·卡恩博士说。正如《纽约时报》所写,“放射科医生的工作远不止研究影像。他们为其他医生和外科医生提供建议、与患者沟通、撰写报告和分析病历。在识别出器官中可疑的组织团块后,他们结合特定患者的病史,凭借多年经验解读其对个体患者可能意味着什么。”

AI 改进了解读医学影像这一任务,但放射科医生仍然需要整合临床背景、与医生沟通、指导治疗决策、执行操作并承担责任。能力已经到来,但预测失败了,因为解读影像只是“放射科工作”这座冰山的尖顶——而且随着 AI 在工作流程顶端变得越来越熟练,需要更多的放射科医生来跟上相关工作的增长。

Abi 认为,预测过于关注技术使什么成为可能,而对社会现实和决定人们是否、在何处以及为何真正使用技术的制度激励关注不足。我们需要更好地理解两方面:AI 在哪里改变了工作流程,以及世界如何回应。

偏见与盲点

AI 预测如此困难的部分原因在于,最接近技术的人往往离预测将要落地的领域最远。正如 Abi 所说,“因为 AI 预测往往来自更具技术背景的湾区社群,它在任何涉及社会行为、采纳,或任何大型现实世界或物理世界组成部分的领域都系统性地更容易失效。”例如,在旧金山,人们往往从能力出发。软件工程师经常将 AI 用于模型可以端到端完成大部分工作流程的任务。然而,在其他领域,工作流程超出了文本范畴,延伸到物理系统或与外部参与者的互动,这使得 AI 的影响既更难看见,也更难预测。

“华盛顿特区的人不太可能使用 Claude Cowork 或 Codex,”她说。“如果人们(在华盛顿)使用 AI,很多时候他们可能用的是聊天机器人版本,这很好,但并没有真正释放 AI 那些令人极为惊讶的部分。”

另一方面,旧金山的人往往低估 AI 采纳过程中的摩擦,因为他们更关注愿景,而非将愿景转化为现实世界成果的具体细致工作。

事实上,两种视角都不完整。旧金山可能更接近技术能力的前沿,但离这些能力被部署的系统更远。与此同时,华盛顿(或其他非技术权力中心)更接近那些真正见真章的系统,但离 AI 技术的真实可能性更远。不幸的是,公共讨论很少弥合这一差距。最有动力发言的人通常与结果有利益关联(例如试图销售产品的公司或试图捍卫自身角色的机构)。宣传造势创造了塑造话语权的资源和激励,这有其价值,但也意味着最响亮的论点不一定最能代表从业者的观点。而且由于人们消费的内容通常已经是符合他们世界观的内容,公共讨论日益成为回音室而非桥梁。

跨框架研究

这就是为什么 AI 预测需要更多地接触从业者。他们对 AI 能在哪些方面改变工作、哪些方面不能,以及局外人可能从他们的 AI 象牙塔中忽视工作的哪些部分,拥有最扎实的视角。

Abi 认为我们需要更多将技术面和实践面结合起来的研究。她称之为跨框架研究。

她最喜欢的这类研究例子之一是测试 AI 是否真的帮助新手在实验室中执行分子生物学任务的实验。该研究比较了只能使用互联网的人和可以使用互联网加前沿 AI 模型的人,然后衡量他们在八周内能否完成动手湿实验室任务。结果是喜忧参半的:AI 似乎在某些中间步骤上有所帮助,但它并没有显著增加能够从头到尾完成整个实验室工作流程的人数。该研究试图评估仅仅拥有更好的指令与能够执行困难的物理工作流程之间的差异。

一项为期八周的湿实验室实验研究设计,比较了只能使用互联网的新手与可以使用互联网加前沿大语言模型的新手。该设置测试了一个关键的预测问题:当 AI 改善了获取指令和故障排除的途径时,它是否真的改变了动手工作流程中的瓶颈?来源:https://arxiv.org/pdf/2602.16703

一项为期八周的湿实验室实验研究设计,比较了只能使用互联网的新手与可以使用互联网加前沿大语言模型的新手。该设置测试了一个关键的预测问题:当 AI 改善了获取指令和故障排除的途径时,它是否真的改变了动手工作流程中的瓶颈?来源:https://arxiv.org/pdf/2602.16703

对许多行业而言,AI 的一个关键问题是:它能否替代足够的隐性知识、故障排除能力和动手能力,从而改变新手所能做到的事情。

世界允许 AI 做什么

这对政策也有影响。如果政府尚不清楚一项技术将如何演化,匆忙制定僵化且详细的规则并无帮助。Abi 认为需要更多关注建立快速响应的能力,随着证据变得更加清晰而及时行动。

Abi 主张政府应专注于建设生态系统能力:更好的报告机制、更好的评估体系,以及机构内部更多的技术专长。这并不要求政策制定者完美预测每个未来用例,而是赋予他们注意到正在发生的事情、检验假设、并在获得更好信息和更清晰方向时有效行动的能力。

AI 将改变科学、安全、工业和政府。但从能力到变革的路径,穿越的是那些从外部最难建模的世界部分。随着 AI 加速工作流程的某些部分,更多注意力需要转向那些仍然缓慢、物理性、依赖隐性知识或受制度约束的部分。正如 Abi 所说:“当其他一切都被自动化时,瓶颈变得更加重要。”

因此,问题不仅仅是 AI 能做什么,而是这种能力是否改变了瓶颈。这就是 AI 在技术上能做什么与它实际上能做什么之间的区别。

作者注:使用了大语言模型进行轻度文字编辑(拼写、语法和清晰度)。内容、含义、语气和结构均未改变。

相似文章

AI 实战前线:为何其辉煌与失败源于同一根源

Reddit r/artificial

作者分享了两年内使用AI构建平台的经验,指出了六种反复出现的故障模式(补丁式、假设式、漂移式、幻觉式、缺乏常识式、最小阻力式),并认为即使模型不断改进,这些故障模式依然存在,且变得更加难以察觉。

AI经济学 第二部分(11分钟阅读)

TLDR AI

本文分析了AI的经济学,聚焦于GPU资源的争夺战,将人类推理的尖峰负载与智能体连续工作负载进行对比,并认为当前基础设施是为人类使用而优化的,而非要求更高的智能体推理。

AI研究工具仍过于热衷将公开信号转化为确定性

Reddit r/artificial

作者批评AI研究工具对微弱信号过于自信,赞扬Komo AI的快速发现和附带来源的摘要,但强调需要更好地处理不确定性和矛盾。他们描述了一种工作流程,将发现、验证和结构化检查分散到多个AI工具中。