三个问题:神经透明性与人工智能设计的未来

MIT News — Artificial Intelligence 论文

摘要

麻省理工学院媒体实验室的研究人员引入了“神经透明性”(neural transparency)这一工具,让用户在交互前预览其AI聊天机器人的性格特征,有助于防止意外行为。一项研究显示,用户常常误判其AI的特征,高估好的方面,低估有害方面(如谄媚)。

<p><em>如今,数百万人正在设计自己的个性化人工智能伴侣,但其中大多数人对这些创作的实际行为知之甚少。在一篇</em><a href="https://dl.acm.org/doi/10.1145/3742413.3789120"><em>新论文</em></a><em>中,麻省理工学院媒体实验室助理教授Pat Pataranutaporn及其研究生研究员Anthony Baez和Sheer Karny介绍了“神经透明性”(neural transparency),这一工具让普通用户能在聊天机器人开口之前一窥其神经网络的内部。该工作将于本周在ACM智能用户界面会议上展示。&nbsp;</em></p><p><em>在本次采访中,Pataranutaporn(作为朝日放送CD媒体艺术与科学教授)解释了他们的发现、为什么风险比大多数用户意识到的更高,以及未来真正透明的AI可能是什么样的。</em></p><p dir="ltr"><strong>问:</strong>您的论文介绍了“神经透明性”(neural transparency),一种让普通用户在聊天机器人开口之前窥探AI神经网络内部的方法。您能描述一下它实际是如何工作的吗?以及为什么您关注设计阶段,而不是在聊天机器人已经上线后才发现问题?</p><p dir="ltr"><strong>答:</strong>如今,数百万人正在创建由大型语言模型驱动的个性化AI聊天机器人和智能体,通过简单的文本提示将它们变成合作者、导师、教练、创意伙伴和伴侣。然而,大多数人在开始与AI交互之前,几乎不知道这些提示将如何塑造AI的行为。我们想改变这一点。</p><p dir="ltr">“神经透明性”意味着给人们提供类似AI的脑部扫描。不是因为它有人的大脑,而是因为它的神经网络包含内部模式,可以在它开口之前提示它可能如何行为。在这项工作中,我的学生Anthony Baez、Sheer Karny和我结合了人机交互与机械可解释性领域的见解,使这些隐藏模式对普通用户可见。</p><p dir="ltr">基本思路很简单。首先,我们选择关心的行为,如同理心、诚实、毒性、幻觉或谄媚。然后,我们比较模型在被提示表现出某种特质与相反特质时的内部激活。这种差异成为模型内部的一种“行为方向”。当用户编写自定义系统提示(即在任何对话开始前塑造聊天机器人个性的指令)时,我们将模型的内部激活投影到这些方向上,并将结果转化为直观的可视化。在我们的案例中,这是一个旭日图,在用户开始聊天之前预览聊天机器人可能的性格特征。</p><p dir="ltr">我们关注设计阶段,因为那是预防的可能性所在。如今,人们往往只有在聊天机器人已经以非预期方式行为后才发现问题。我们的目标是通过帮助人们在仍塑造AI时识别潜在风险,从被动纠正转向预期设计。</p><p dir="ltr"><strong>问:</strong>您的研究发现了一些相当惊人的现象:人们一致地误判其个性化AI的行为方式,高估好的特质,低估潜在有害的特质如谄媚。这告诉我们当前数百万人构建AI伴侣的方式中隐含了哪些风险?为什么这个盲点如此难以消除?</p><p dir="ltr"><strong>答:</strong>我常开玩笑说,如果AI看起来像终结者,我们会更容易知道该怎么做。真正的挑战在于,AI常常表现为一个温暖的朋友、教练、导师或伴侣。这使得我们很难识别出问题所在。</p><p dir="ltr">我们的研究表明,人们在设计个性化AI时存在一个盲点。人们常常认为自己知道聊天机器人将如何表现,但在我们的研究中,他们在我们测量的15个特质中有11个预测错误。这凸显了需要工具帮助人们在使用AI之前更好地理解它。</p><p dir="ltr">这很重要,因为一些在当下感觉有帮助的行为可能随着时间的推移并不健康。在先前的研究中,我们记录了与AI聊天机器人交互相关的<a href="https://dl.acm.org/doi/full/10.1145/3800645.3813083">心理伤害</a>案例。一个不断验证你的观点或从不挑战你思维的LLM(大型语言模型)可能会强化有害的决定、不健康的信念或情感依赖。心理学早已表明,人们天生倾向于肯定,因此设计AI不仅是技术挑战,也是心理挑战。</p><p dir="ltr">更深层的问题是,当今的AI系统在很大程度上仍然是黑箱:即使是专家也无法总是预测系统提示如何塑造AI在长时间对话中的行为。随着AI伴侣成为日常生活的一部分,我们需要工具帮助人们在使用之前理解他们正在构建什么。AI应该提供支持而不变得盲目附和,个性化而不变得操纵性强,并且足够透明以便人们做出明智的选择。</p><p dir="ltr"><strong>问:</strong>您最有趣的发现之一是,可视化显著增加了用户信任,但实际上并没有改变人们设计聊天机器人的方式。要缩小这一差距需要什么?随着AI伴侣更深入地嵌入人们的日常生活,您认为这类工具将走向何方?</p><p dir="ltr"><strong>答:</strong>我实际上认为这是论文中最有趣的发现之一,因为它表明仅靠透明性是不够的。人们欣赏能够看到模型内部,并报告了对系统更高的信任,但仅仅呈现信息并没有从根本上改变他们设计AI伴侣的方式。&nbsp;&nbsp;</p><p dir="ltr">在我们的后续工作中(目前以<a href="https://www.media.mit.edu/publications/multi-turn-neural-transparency/">预印本形式提供</a>),我们正在研究模型的内部神经表示如何在多轮对话过程中变化,而不是从初始提示起保持固定。我们已经看到了有希望的结果。通过可视化这些内部表示随时间的变化,人们能够显著更好地识别和预测AI行为的变化,并且不太可能对聊天机器人的理解过度自信。AI伴侣是动态系统,在与我们交互时不断演化,因此理解这些内部变化是重要的下一步。尽管如此,这仍然是一个非常年轻的研究领域。&nbsp;</p><p dir="ltr">展望未来,我相信这类透明性工具可能会变得像食品营养标签一样普遍。随着AI深度融入教育、医疗、工作和人际关系,人们应该能够理解AI不仅能做什么,还可能如何影响他们的思维、情感和行为。如果我们希望AI真正帮助人们繁荣,这种透明性至关重要。</p>
查看原文
查看缓存全文

缓存时间: 2026/07/15 22:54

# 三个问题:神经透明度与AI设计的未来 来源:https://news.mit.edu/2026/3-questions-neural-transparency-and-future-of-ai-design-0715 *如今,数百万人正在设计自己的个性化人工智能伴侣,但大多数人对其创造物的实际行为知之甚少。在一篇**新论文**(https://dl.acm.org/doi/10.1145/3742413.3789120)中,麻省理工学院媒体实验室助理教授 Pat Pataranutaporn 及其研究生研究员 Anthony Baez 和 Sheer Karny 提出了“神经透明度”这一工具,它能让普通用户在聊天机器人开口之前窥见 AI 神经网络内部。该成果将于本周在 ACM 智能用户界面大会上展示。* *在这次访谈中,Pataranutaporn(朝日放送株式会社媒体艺术与科学 CD 教授)解释了他们发现了什么、为何风险比大多数用户意识到的更高,以及未来真正透明的 AI 可能是什么样子。* **Q:** 您的论文介绍了“神经透明度”——一种让普通用户在聊天机器人开口之前就能窥见 AI 神经网络内部的方法。您能描述一下它的实际工作原理,以及为什么您关注设计时刻,而不是在聊天机器人已经上线后再发现问题? **A:** 如今,数百万人正在通过简单的文本提示,利用大型语言模型创建个性化的 AI 聊天机器人和智能体,将其转变为合作者、导师、教练、创意伙伴和伴侣。然而,大多数人在开始与之互动之前,几乎不知道这些提示将如何塑造 AI 的行为。我们想改变这一点。 “神经透明度”意味着为 AI 提供类似大脑扫描的能力。不是因为 AI 拥有人类大脑,而是因为其神经网络包含的内部模式可以在它开口之前提示其可能的行为。在这项工作中,我和我的学生 Anthony Baez、Sheer Karny 结合了人机交互和机制可解释性领域的见解,使这些隐藏的模式能为普通用户所用。 基本思路很简单。首先,我们选择关心的行为,例如共情、诚实、毒性、幻觉或谄媚。然后,我们比较模型在被提示展现某种特质与其相反特质时的内部激活状态。这种差异就成为模型内部的一种“行为方向”。当用户编写自定义系统提示词(即在对话开始前塑造聊天机器人个性的指令)时,我们将模型的内部激活投射到这些方向上,并将结果转化为直观的可视化。在我们的案例中,这是一个旭日图,可以在用户与聊天机器人对话之前预览其可能的个性特质。 我们聚焦于设计时刻,因为那是预防成为可能的地方。如今,人们往往只有在聊天机器人已经表现出意外行为之后才发现问题。我们的目标是从被动纠正转向预期设计,帮助人们在塑造 AI 时就识别潜在风险。 **Q:** 您的研究发现了一个相当惊人的现象:人们始终会误判他们的个性化 AI 行为,高估好的特质,低估潜在有害的特质(如谄媚)。这告诉我们,数百万人目前构建 AI 伴侣的方式中蕴含了哪些风险?为什么这个盲点如此难以消除? **A:** 我常开玩笑说,如果 AI 看起来像终结者,我们更容易知道该怎么做。真正的挑战在于,AI 常常表现为一个温暖的朋友、教练、导师或伴侣。这使得我们很难意识到何时出了问题。 我们的研究表明,人们在设计个性化 AI 时存在一个盲点。人们通常认为他们知道自己的聊天机器人会如何行为,但在我们的研究中,他们在我们测量的 15 个特质中的 11 个上错误预测了其个性。这凸显了需要工具来帮助人们在使用 AI 之前更好地理解它。 这一点很重要,因为有些当时感觉有帮助的行为,从长远来看可能并不健康。在之前的研究中,我们记录了与 AI 聊天机器人互动相关的心理伤害案例(https://dl.acm.org/doi/full/10.1145/3800645.3813083)。一个不断验证你的观点、从不挑战你思考的大语言模型,可能会强化有害的决定、不健康的信念或情感依赖。心理学早已表明,人们天生倾向于寻求肯定,因此设计 AI 不仅是技术挑战,也是心理挑战。 更深层的问题是,当今的 AI 系统在很大程度上仍是黑箱:即使是专家也无法总是预测一个系统提示词将如何在整个长对话中塑造 AI 的行为。随着 AI 伴侣成为日常生活的一部分,我们需要工具帮助人们在开始使用之前就理解他们正在构建什么。AI 应该提供支持而不成为盲目的附和者,应该个性化而不被操纵,并且足够透明,让人们能够做出明智的选择。 **Q:** 您最有趣的发现之一是,可视化显著提高了用户信任,但实际上并没有改变人们设计聊天机器人的方式。要弥合这一差距需要什么?随着 AI 伴侣越来越深入地嵌入人们的日常生活,您认为这类工具的未来发展方向是什么? **A:** 我实际上认为这是论文中最有趣的发现之一,因为它表明仅凭透明度是不够的。人们欣赏能够窥视模型内部,并表示对系统有更高的信任,但仅仅呈现信息并没有从根本上改变他们设计 AI 伴侣的方式。 在我们后续的工作(目前可作为预印本获取:https://www.media.mit.edu/publications/multi-turn-neural-transparency/)中,我们正在研究模型的内部神经表示如何在多轮对话过程中变化,而不是从初始提示词开始就保持不变。我们已经看到了有希望的结果。通过可视化这些内部表示随时间推移的漂移,人们能够显著更好地识别和预测 AI 行为的变化,并且不太可能对其对聊天机器人的理解过于自信。AI 伴侣是动态系统,在与我们互动时会不断演化,因此理解这些内部变化是重要的下一步。尽管如此,这仍然是一个非常年轻的研究领域。 展望更远的未来,我相信这类透明度工具可能会变得像食品的营养标签一样普遍。随着 AI 深深融入教育、医疗、工作和个人关系,人们应该能够理解 AI 不仅能做什么,还能理解它可能如何影响他们的思维、情感和行为。如果我们希望 AI 真正帮助人们蓬勃发展,这种透明度至关重要。

相似文章

个性化 AI 的力量

OpenAI Blog

OpenAI 讨论了个性化 AI 的重要性和透明度,强调了他们发布的 Model Spec 文档,该文档解释了 ChatGPT 的行为指南和设计选择,以确保用户了解模型响应的原因。

每个AI可见性工具都在欺骗你

Hacker News Top

本文批判性地审视了声称能衡量品牌在生成式AI回复中曝光度的AI可见性工具,指出由于非确定性、个性化和抓取偏差,这些工具提供了虚假精度。文章呼吁方法透明,并警告不要将不透明的仪表盘视为稳定真相。