@timoreilly: 即将与@mlpowered直播,讨论'AI的神经科学'。 https://learning.oreilly.com/live-events/crack…
摘要
Tim O’Reilly和Emmanuel Ameisen探讨AI的可解释性,重点讨论Claude等LLM中的世界模型以及Anthropic用于引导模型行为的工具。
查看缓存全文
缓存时间: 2026/09/09 17:51
即将与@mlpowered直播探讨“AI的神经科学”。免费加入:https://learning.oreilly.com/live-events/cracking-llms-open-emmanuel-ameisen-live-with-tim-oreilly/0642572444716/…
深入解析大语言模型:Emmanuel Ameisen与Tim O’Reilly的对谈
来源:https://www.oreilly.com/live-events/cracking-llms-open-emmanuel-ameisen-live-with-tim-oreilly/0642572444716/ 查看全部活动(https://www.oreilly.com/live-events/?page=1)出版方:O’Reilly Media, Inc.(https://www.oreilly.com/publisher/oreilly-media-inc/)
内容难度中级
Claude内部机制揭示其真实思维过程
活动日程(https://www.oreilly.com/live-events/cracking-llms-open-emmanuel-ameisen-live-with-tim-oreilly/0642572444716/#liveEventSchedule)Anthropic的可解释性团队研究Claude内部运作的方式,犹如神经科学家研究大脑——但这门科学更年轻、更混乱,且远未形成完整图谱。Emmanuel Ameisen在过去两年中参与了这项探索,他近期在O’Reilly举办的Foo Camp上分享了Claude处理信息时的部分内部机制。
Emmanuel在演讲中指出,词元预测常被简单描述为“模式匹配”,但实际上,为了在词元预测上达到超人水平,模型构建了对世界的复杂理解。当要求Claude续写一句关于骑行跨越“GG桥”的句子时,模型能准确推断这座桥应是金门大桥,从而将用户定位在旧金山。基于这种理解,模型可以进一步回答问题,例如从旧金山前往太浩湖“世界级滑雪场”需要多长时间。团队能观察到这种世界模型在模型内部形成:当模型执行复杂任务时,不同类型的激活模式会被点亮。
Tim邀请Emmanuel参与本期节目,旨在延续他在Foo Camp的演讲。他们将首先探讨“世界模型”的含义,以及语言模型内部机制是否符合该概念的描述。通过数学运算和诗歌创作等实例,讨论这些世界模型的实际运作方式——模型如何在写作前先构思句子的结尾。同时还将介绍Anthropic可解释性团队开发的工具:通过“推拉”模型的激活向量来引导其行为,从而实现对模型的操控。讨论过程中,Emmanuel和Tim将从宏观视角思考可解释性问题:当前人们应对模型行为的哪些方面保持信任?又有哪些方面需持保留态度?
加入直播,了解Emmanuel通过两年研究Claude内部机制得出的发现。欢迎提出问题与评论,这些将引导讨论方向。
推荐预习或延伸阅读:
- 收听《现实世界中的生成式AI:Emmanuel Ameisen解读大语言模型可解释性》(https://learning.oreilly.com/videos/generative-ai-in/0642572235277/)(播客)
活动日程
时间框架仅为预估,可能根据课程进度调整。
2026年9月9日星期三,太平洋时间上午9点 / 东部时间中午12点
- 互动讨论与问答环节(60分钟)
Tim O’Reilly是O’Reilly Media, Inc.的创始人兼首席执行官。他最初的商业计划很简单:“为有趣的人提供有趣的工作”,这一理念取得了显著成功。他出版书籍,运营在线会议,投资早期初创企业,倡导企业创造超过自身获取的价值,并通过传播和放大创新者的知识来改变世界。他最为人所知的贡献在于塑造重大理念,包括开源软件、非会议(Foo Camp)、Web 2.0以及“政府即平台”。他2017年的著作《WTF:未来是什么,为何与我们息息相关》(https://www.oreilly.com/tim/wtf-book.html)探讨了在人工智能浪潮来临之际,人类能动性在塑造未来中的作用。目前,他专注于研究人机经济的机制设计。机制设计有时被称为“逆向博弈论”——从期望的结果出发,反向推导出能产生该结果的博弈规则。他通过与Ilan Strauss共同创立的非营利组织“AI披露项目”探索这些理念,并常在O’Reilly Radar(https://www.oreilly.com/radar/)、AI披露项目的《阿西莫夫附录》(https://asimovaddendum.substack.com/)以及个人专栏《与AI对话》上发表文章。
Emmanuel Ameisen在Anthropic从事机制可解释性研究:构建追踪大语言模型内部计算过程的工具,并利用这些工具研究系统运作原理。他的研究包括发现大语言模型具有前瞻性规划能力的证据、描述其学习用于数值表示与运算的通用电路,以及解释前沿系统中出现的某些意外行为。加入Anthropic前,他曾担任Stripe的首席机器学习工程师,并领导Insight Data Science的AI项目,指导了上百个应用型机器学习项目。著有O’Reilly出版书籍《构建机器学习驱动的应用》。
涵盖技能
计算机视觉
相似文章
@timoreilly: 我大约一个月前写了这篇文章(《AI科学的协作外骨骼》),然后忘记发布了!它是一…
Tim O'Reilly 讨论了将AI整合到科学出版中的挑战,包括幻觉引用、已撤稿论文的传播以及在受损文献上进行训练,并呼吁调整现有的科学基础设施以用于AI。
@timodonnell: 想观看一个535B参数(23B活跃)的LLM实时训练吗?在这里跟随 https://wandb.ai/marin-community/ma…
一条推文宣布了535B参数(23B活跃)大语言模型的实时训练,并提供了在Weights & Biases和GitHub上跟踪进程的链接。
@timoreilly: 我在最近与 @stevenlevy 的采访中随口提到了AI写作。不少人对此发表了评论……
Tim O'Reilly 探讨了AI作为写作媒介的角色,将其与传统艺术形式相比较,并为其创意使用进行辩护,尽管专业作家表达了担忧。
@danintheory:精彩的对话,也是学习重要开放AI问题的有趣方式!
红杉资本强调当前一次性训练的AI模型与人类持续学习之间的差距,并指出了EngramLab在具有内部记忆、永不停止学习的AI方面的工作。
@Prince_Canuma: 我在 @aiDotEngineer 的演讲已上线:“基于 MLX 的端侧智能”。非常感谢 @swyx 和团队的邀请——ha…
作者宣布其在 aiDotEngineer 活动上的演讲《基于 MLX 的端侧智能》已上线,并对主办方及社区贡献者表示感谢。