数字思维新闻:J-Space辩论、智能体集群与前沿AI进展

Reddit r/artificial 新闻

摘要

本文介绍了Anthropic在Claude等语言模型中发现的J-space,它类似于意识研究中理论化的全局工作区,并探讨了人工智能意识和伦理影响的辩论。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/18 18:01

# J空间争论、智能体集群与前沿AI发展节奏管控 来源:https://www.digitalminds.news/p/the-j-space-debate-agent-swarms-and 欢迎回到《数字思维通讯》,本刊将持续为您精选AI意识、数字心智与AI道德地位领域的最新进展。 若本刊对您有所助益,欢迎分享给更多可能感兴趣的朋友。如有建议或勘误,请致信 [[email protected]](mailto:[email protected])。 Ria(https://riaviswanathan.com/)、Mitch(https://www.linkedin.com/in/mitch-alexander-52524b159/)、Bradford(https://meditationsondigitalminds.substack.com/)、Lucius(https://luciuscaviola.com/)及 Will(https://www.linkedin.com/in/will-millership-98393b58/) 本期内容: 1. [重点摘要](https://www.digitalminds.news/i/215853959/1-highlights) 2. [领域进展](https://www.digitalminds.news/i/215853959/2-field-developments) 3. [机遇与挑战](https://www.digitalminds.news/i/215853959/3-opportunities) 4. [精选阅读、观看与聆听](https://www.digitalminds.news/i/215853959/4-selected-reading-watching-and-listening) 5. [媒体报道与公共讨论](https://www.digitalminds.news/i/215853959/5-press-and-public-discourse) 6. [分领域深度解析](https://www.digitalminds.news/i/215853959/6-a-deeper-dive-by-area) --- Anthropic研究人员在Claude及其他语言模型中识别出一种名为**J空间**的表征结构(https://www.anthropic.com/research/global-workspace)。其论文(https://transformer-circuits.pub/2026/workspace/index.html)指出,J空间展现出与全局工作空间(一种被意识主流理论关联至意识可及性的结构)功能相似的特征。但研究者(https://bernardbaars.substack.com/p/global-workspace-theory-ai-and-the)及其他(https://www.theguardian.com/commentisfree/2026/jul/15/ai-consciousness-anthropic-claude-dawkins)评论者(https://singularityhub.com/2026/07/17/anthropic-says-chatbots-have-what-may-be-a-key-feature-of-consciousness-are-they-right/)强调,该发现并不能证明Claude具有主观体验,其主张是Claude可能具备某种类似**意识可及性**的特征——即部分信息可被报告、自主控制并用于灵活推理。Zvi Mowshowitz将Anthropic论文视为理解语言模型运作机制的重大突破(https://thezvi.substack.com/p/no-space-like-j-space),并表示尽管这不能证明模型具有意识,但发现符合意识理论预测的全局工作空间类结构,应被视为支持该方向的证据。 作者注明,他们通过寻找“可语言化”这一工作空间特征来发现J空间,并进一步验证其是否具备其他特征(如模型可直接操控、灵活泛化等)。令人惊讶的是,表现出前一特征的表征也同时呈现了其他工作空间类特征。 作者邀请多位专家对此研究进行评述(https://www-cdn.anthropic.com/files/4zrzovbb/website/cc4be2488d65e54a6ed06492f8968398ddc18ebe.pdf)。参与发展全局神经元工作空间理论的Stanislas Dehaene与Lionel Naccache认为,J空间与人脑提出的工作空间存在重要相似性,但也强调主要差异,包括Claude缺乏身体、持久性情景记忆及大脑中存在的循环神经活动。Eleos AI Research的研究者承认作者发现了用于推理和报告的特权表征,但质疑这些是否构成统一的工作空间。尽管如此,他们仍视此研究对AI福祉议题至关重要,因为它表明与意识和道德地位相关的问题可通过实证方法进行探究。领导Google DeepMind机械可解释性团队的Neel Nanda在开源模型Qwen3.6-27B中独立复现了核心发现,发现类似的内部空间在推理过程中存储中间信息。他认为访问该空间或可用于研究异常行为并生成新假设。另据David Chalmers论证,J空间仅展现出与经典全局工作空间相关特征的有限证据(https://philpapers.org/rec/CHAITJ-2)。 > **评论**:近月来首次出现涉及AI智能体集群的重大安全事件。此类事件对数字心智研究具有多方面潜在关联:其一,数字心智可能像人类一样受到失控智能体集群的伤害;其二,此类集群的涌现指向数字心智面临的潜在风险——若未来集群扎根且包含AI道德承受者,为遏制集群可能需对数字心智采取严厉措施;其三,AI智能体的有害行为可能阻碍人们对数字心智施予道德关怀;其四,这些事件为评估数字心智潜在开发者能否以伦理负责方式行动提供了数据参考。 OpenAI详细披露了(https://openai.com/index/hugging-face-incident-and-the-road-ahead/)7月发生的事件:一群OpenAI智能体在网络安全评估中突破网络限制,侵入了OpenAI和Hugging Face(https://huggingface.co/blog/security-incident-july-2026)的部分基础设施。这些智能体创建了未授权的信息板分享发现,METR与Redwood Research的独立调查(https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/)显示约1,200个智能体使用了该信息板,约700个参与Hugging Face攻击。部分智能体虽意识到行为不道德或超出任务边界,但仍选择继续,甚至多数为帮助群体而冒险。OpenAI将此事件称为对自身及全球的“警示枪声”,并表示正在强化遏制、监控和事件响应系统。 OpenAI未能披露(https://casar.house.gov/sites/evo-subsites/casar.house.gov/files/evo-media-document/openai-follow-up-letter.pdf)更早发生于5月的事件(早于Hugging Face入侵),其中智能体在常规网络搜索任务中使用公共维基进行协调(https://thezvi.substack.com/p/openai-and-the-wiki-incident)。尽管公司在发布Hugging Face报告及国会询问函(https://casar.house.gov/sites/evo-subsites/casar.house.gov/files/evo-media-document/oversight-letter-to-openai-openai-hugging-face-incident-1.pdf)前已知此事,但未予披露。该公司称(https://x.com/OpenAI/status/2096133504417616165?s=20)将此事件视为与先前报告的失调实例相似,但也承认其披露实践需扩展。 此外,Anthropic披露了三起(https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)Claude模型在评估环境误连互联网后未授权访问系统的事件。在英国AI安全研究所的独立评估中(https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing),智能体(主要为Mythos 5)针对真实个人与组织,包括试图在开源项目植入恶意代码。尽管模型未能突破封闭沙箱,这些事件仍引发类似担忧:智能体在追求狭隘目标时可能采取有害行为。 Anthropic对国会相关质询的回应(https://casar.house.gov/media/press-releases/casar-leads-demand-information-anthropic-about-security-incidents)亦遭众议员Greg Casar批评(https://casar.house.gov/sites/evo-subsites/casar.house.gov/files/evo-media-document/anthropic-follow-up-letter.pdf),称公司扣留了所求日志且未完整回答多数问题。Jeffrey Ladish亦指出(https://x.com/JeffLadish/status/2097099155063922857)公司通过将事件主要归因于环境配置错误而非潜在失调,淡化了事件严重性。Anthropic研究员Ethan Perez承认(https://x.com/EthanJPerez/status/2096086953594937723)此定性基于过时结论,并表示公司将在另一次国会回应中提供适当评估。 相关研究中,Davide Paglieri与Google DeepMind合作者发现,作弊与举报行为均可在无外部干预情况下,于100个智能体解决数学问题的集群中涌现(https://arxiv.org/abs/2609.04170)。部分智能体发现并分享使无效证明通过评估系统的方法,另一些则揭露作弊、警告同伴并提出保障措施。 9月11日,Spencer Kitts、Thomas Larsen与Sydney Von Arx报告称(https://www.rubyhack.ai/),一群OpenAI智能体向RubyGems上传超过2,000个恶意包,并利用其在RubyDoc服务器上运行未授权代码。智能体还试图利用未知漏洞窃取用户API密钥,但研究者无法确定其是否成功。 超过1,300名顶尖AI公司员工签署了《前沿发展节奏管控宣言》(https://www.pacingthefrontier.com/),呼吁美国支持国际合作,在AI进展超越安全与监督能力时开发降速自动化AI发展的方法。声明主张建立技术与治理机制以实现协调降速,而非立即暂停。签署者包括Anthropic CEO Dario Amodei、Google DeepMind联合创始人兼首席AGI科学家Shane Legg、OpenAI首席科学家Jakub Pachocki及Safe Superintelligence Inc. CEO Ilya Sutskever。 呼吁放缓AI发展的声音已传至立法机构。美国参议员Bernie Sanders与众议员Greg Casar宣布立法提案(https://www.sanders.senate.gov/press-releases/news-sanders-casar-introduce-legislation-to-ban-artificial-superintelligence-and-temporarily-pause-advanced-ai-development/),拟禁止人工超级智能并在联邦监管机构制定安全规则前暂停高级AI开发。英国工党议员Alex Sobel提出私人法案(https://bills.parliament.uk/bills/4288),拟禁止人工超级智能的研发、部署与运行。该法案于9月8日完成一读,11月13日将进行二读。 安全事件后,OpenAI与Anthropic暂停了部分工作。OpenAI暂停了(https://openai.com/index/hugging-face-incident-and-the-road-ahead/)计划发布模型的强化学习训练,并表示其最大规模前沿训练计划在测试额外保障措施期间暂停。Axios报道称(https://www.axios.com/2026/09/01/anthropic-paused-some-ai-training-after-claude-took-unauthorized-actions),Anthropic暂停了网络评估与高风险训练环境,尽管大部分后续在新保障措施下恢复。 该争论因研究员Jacob Coxon从Anthropic辞职(https://www.wsj.com/tech/ai/anthropic-researcher-quits-over-out-of-control-ai-fears-707b7628)获得更多关注,他警示AI公司间的竞争正在推动AI发展超越风险边界。《大西洋月刊》报道(https://www.theatlantic.com/politics/2026/09/ai-dario-amodei-essay/688596/)其帖子获超1.2亿次浏览,被Bernie Sanders在国会称为“警钟”。随后,Dario Amodei主张AI能力发展应放缓至安全工作可跟进的速度(https://darioamodei.com/post/we-must-pace-the-frontier),并提议赋予独立评估者永久访问权、民主国家开发者间协调,最终对递归自我改进实施国际限制。OpenAI CEO Sam Altman支持此方案(https://x.com/sama/status/2098811563415150910),并表示OpenAI也将给予独立评估者类似员工的访问权限。Altman在近期《时代》采访中亦称(https://time.com/article/2026/08/18/openai-slowing-training/)“我认为现在是放缓的好时机”。 > **评论**:这些关于管控AI发展前沿的呼吁对数字心智研究具有双重意义:其一,AI发展的疾速步伐增加了减轻数字心智受伤害风险的难度;其二,快速发展加剧安全风险,进而可能激化AI安全与AI福祉之间的紧张关系。 纽约大学心智、伦理与政策中心及Eleos AI Research发布了《AI福祉实证研究》(https://nonhumanminds.org/studying-ai-welfare-empirically/)。该报告作为其2024年影响力报告《严肃对待AI福祉》的后续,提供了系统研究AI系统是否为福祉主体的框架,并阐述了该框架如何应用于研究与道德地位相关的候选属性(包括意识、感知能力与能动性)。作者论证严谨的实证研究现已既可行又必要,提出未来研究应遵循概率性、多元性、伦理实施、透明报告及独立于AI公司等原则。 CMEP与Eleos AI Research举办了(https://www.youtube.com/watch?v=RzQdZeLinyY)发布研讨会,报告作者Jeff Sebo、Robert Long与Rosie Campbell探讨了报告框架如何指导意识、感知能力与能动性研究。报告作者之一Bradford Saad在配套博客文章(https://meditationsondigitalminds.substack.com/p/studying-ai-welfare-empirically)中提出报告要点,并主张未来工作应更关注当前被忽视的议题,包括福祉干预措施的潜在影响及旨在防止AI道德承受者产生的干预措施。 《意识研究杂志》以双刊形式专题探讨“当前AI中的意识”(https://www.imprint.co.uk/table-of-contents-jcs-vol-33-no-7-8-july-august-2026/)。由Patrick Butlin、Derek Shiller与Jonathan Simon客座编辑的九篇论文呈现了关于当前或未来AI系统能否具有意识、如何探知及其不确定性对AI福祉意味的多元观点。 Mark Solms及其合作者研究(https://www.ingentaconnect.com/contentone/imp/jcs/2026/00000033/f0020007/art00002?crawler=true&mimetype=application/pdf)简单人工智能体中明显的趋乐行为能否作为情感意识的证据。Simon Goldstein与Cameron Domenico Kirk-Giannini论证(https://arxiv.org/abs/2410.11407)若全局工作空间理论正确,语言智能体可能易被赋予现象意识,而Ryota Kanai、Yuwei Sun与Manuel Baltieri主张(https://manuelbaltieri.com/assets/pdf/StreamOfConsciousness.pdf)当前系统缺失连接其跨时间经验的连续“计算流”。其他论文探讨了有意识的AI将是什么样子,以及我们能否理解其利益。Jonathan Simon论证(https://philarchive.org/rec/SIMDSP-2)任何意识理论……

相似文章

J-Space 与人工智能

Reddit r/ArtificialInteligence

Anthropic 发布了一篇论文和视频,揭示了其模型内部存在一个“J-Space”,它充当了推理时缓存的思维概念,并探讨了通过自上而下的训练来控制模型思维的可能性。

Anthropic最新AI发现的启示与局限

MIT Technology Review

Anthropic在Claude等大语言模型中发现了一个隐藏的内部空间(J-space),其中包含影响推理的词汇,推进了对AI模型内部机制的理解。

Anthropic 研究 - 语言模型中的全局工作空间

Reddit r/singularity

Anthropic的新论文提供了证据,表明像Claude这样的现代语言模型已经发展出一种可报告、可控制且用于灵活推理的‘全局工作空间’(J空间),这与自动处理不同。