衡量人工智能的自由

ML at Berkeley 论文

摘要

本文利用强化学习探讨了人工智能代理中的“价值自由”概念,将其定义为基于 Q 值衍生出的不可预测性和熵的度量。

<p><em>作者:Evan Ellis</em></p><p>关于人类自由与自由意志的问题,在整个人类有记载的历史中一直争论不休。其核心在于决定论与自由意志论之间的辩论,前者认为只有一种事件进程是可能的,而后者认为多种可能性并存,未来是我们“意志”的产物,无论那具体指什么。我们如何回答这个问题,会影响我们对道德责任和成就的看法:如果未来是预定的,我们该如何追究任何人为其行为应负的责任?</p><p>我们可以在人类思维与强化学习(RL)中的计算机“代理”之间发现许多相似之处。随着 RL 代理能力的不断增强,从它们的视角出发建立自由的概念既具有启发性,也是必要的。如果机器人在社会中占据一席之地,我们该如何衡量它们的自由?这是针对通用人工智能的人工智能伦理问题。</p><h1>作为熵的自由</h1><p>我们的方法始于 Erik M. Rehn 在 2021 年底于《Free Will Belief as a Consequence of Model-Based Reinforcement Learning》一文中首次提出的方法。Rehn 区分了两种类型的自由:</p><ol><li><p>物理自由:对物理世界的自由。这受自然定律的约束,且在量子力学之外是确定性的。由于人类和代理都受自然定律的约束,物理自由存在争议,因此我今天不会深入探讨它。</p></li><li><p>价值自由:两种自由中更有用的一种,价值自由是衡量代理不可预测性的指标。在一个充满确定性过程的宇宙中,价值自由将人与自然力量区分开来。由于代理具有随机动作选择(例如在 Boltzmann 理性模型中),我们认为它们是不可预测的。可以通过衡量不可预测性的程度来赋予价值自由一个数值。Rehn 的论文重点在于衡量价值自由。这是一个强有力的指标,符合我们对自由的常识理解。考虑以下场景:</p></li></ol><p><em>Shiv 和 Ashwin 正在吃 tacos(墨西哥卷饼),Ashwin 推荐了 Al Pastor 口味。Shiv 喜欢所有的 tacos,因此选择任何一种特定口味的价值大致等同于其他任何口味。他可以自由选择,要么接受 Ashwin 的建议,要么忽略它。无论哪种情况,Shiv 都很开心。</em></p><p>在这个例子中,Shiv 的选择高度不可预测——甚至对 Shiv 本人也是如此。他对任何一种 tacos 都没有特别的偏好,因此他拥有完全的自由意志。宇宙并没有决定 Shiv 会选哪种 tacos——Shiv 自己决定。在这种情况下,Shiv 具有很高的价值自由。</p><p>在第二个例子中,Ashwin 扭转了局面:</p><p><em>Shiv 和 Ashwin 正在吃 tacos,Ashwin 告诉 Shiv 点 Al Pastor 口味,否则他将绑架 Shiv 的长子。Shiv 喜欢所有的 tacos,但他预料到他会更喜欢他的长子,因此选择 Al Pastor 的价值比选择其他任何 tacos 的价值大几个数量级。Shiv 被 Ashwin 操纵了,他只有一个明确的 tacos 选择。</em></p><p>在这个例子中,Shiv 的选择高度可预测。他对点餐的控制力很小,因为 Ashwin 将他的偏好偏向于 Al Pastor。在我们对自由意志的常识理解中,Shiv 的决定是不自由的。除了 Shiv 以外的其他因素决定了他点什么。</p><p>在强化学习中,我们可以训练代理来预测 Q 值,即在特定状态下采取特定动作的预期奖励。在第一个例子中,每个动作/状态组合的 Q 值大致相同。在第二个例子中,“点 Al Pastor”这一动作的 Q 值不成比例地更高。</p><p>使用 Q 值模型,我们可以利用 Boltzmann 理性模型(更常见的名称是 Softmax)来推导在给定状态下采取某个动作的概率。它假设代理在本质上是概率性的,但更倾向于高奖励的动作:</p><div class="latex-rendered" data-attrs="{&quot;persistentExpression&quot;:&quot;P(a_i)=\\operatorname{softmax}(Q^\\pi(a_i))=\\frac{\\exp{Q^{\\pi}(a_i)}}{\\sum_j \\exp{Q^\\pi(a_j)}}&quot;,&quot;id&quot;:&quot;WITSCHRRSU&quot;}" data-component-name="LatexBlockToDOM"></div><p>其中 <em>P(ai)</em> 是在该状态下采取动作 i 的概率。</p><p>Rehn 将代理在特定状态下的价值自由定义为“动作选择分布的信息熵”。用通俗的话来说,价值自由是指当代理采取某个动作时,我们感到惊讶的程度。在第二个例子中,我们可以预先确定 Shiv 会选择 Al Pastor,因此当他这么做时并不会令人惊讶。这是一种低价值自由。在第一个例子中,Shiv 遵循 Ashwin 建议的可能性与他选择其他任何东西的可能性一样大,因此我们可以预期对他的选择感到更加惊讶。</p><p>用数学术语来说,价值自由是:</p><div class="latex-rendered" data-attrs="{&quot;persistentExpression&quot;:&quot;H_a = - \\sum_i P(a_i)\\log_2{P(a_i)}&quot;,&quot;id&quot;:&quot;DQKOJIIQIN&quot;}" data-component-name="LatexBlockToDOM"></div><p>如果您对理解这个方程式感兴趣,我建议阅读<a href="https://ashwinreddy.github.io/writeups/info-theory.html">信息论的第一原理</a>,这是一篇关于信息论的入门介绍。</p><p>因果律和记忆在我们对自由意志的理解中扮演着重要角色。考虑案例 1,Shiv 有自由选择任何 tacos。然而,在 Shiv 做出选择后,他倾向于坚持自己的选择。他现在对自己选择的 tacos 有着强烈的偏好,而在此之前他并没有这种偏好。原因很微妙且非常人性化:我们倾向于喜欢自己做出的决定,即使我们在做决定时不确定。Shiv 的决定仍然是他自由意志的产物,尽管现在他更倾向于自己的选择,他的价值自由已经降低。</p><p>这引出了 Rehn 论点的主要观点:自由意志,无论其在更大意义上是否存在,对于从因果关系中学习都是必不可少的。这是我们的大脑用于从成功和错误中学习的强化学习工具。因果律之所以让我们把罪犯关进监狱并将成功归因于成功人士,是因为它是从过去学习中不可或缺的一部分。</p><p>然而,我们对价值自由的感知扎根于我们习得的 Q 值,而这些 Q 值往往不准确。我们可能认为许多动作同样好,但实际上只有一个明确的选择。考虑以下场景:</p><p><em>Shiv 和 Ashwin 刚刚点了 tacos。Shiv 对所有的 tacos 同样喜欢,因此他认为自己选择 Baja 口味是自由做出的。后来,因为 Shiv 没有选 Al Pastor,Ashwin 绑架了 Shiv 的长子。</em></p><p>这提出了 Rehn 的方程式未能涵盖的一点:Shiv 相信他有自由说出任何订单,但在他不知情的情况下,他只能点 Al Pastor。Shiv 并没有自由选择 tacos 的自由。他的 Q 值不准确,因为他缺乏完整的信息。</p><h1>一个新模型</h1><p>在我们的价值自由方程式中,我们需要纳入一个准确度度量:代理近似其 q 值的准确度。我们创建了一个新值,即“知识”参数 ζ,作为我们习得的动作概率 ξ 与真实动作概率分布 φ 之间的逆 KL 散度:</p><div class="latex-rendered" data-attrs="{&quot;persistentExpression&quot;:&quot;P(\\zeta = a) = softmax(Q^\\pi(a_i))&quot;,&quot;id&quot;:&quot;LWXCZFWMEB&quot;}" data-component-name="LatexBlockToDOM"></div><div class="latex-rendered" data-attrs="{&quot;persistentExpression&quot;:&quot;P(\\varphi = a) = softmax(Q^{TRUE}(a_i))&quot;,&quot;id&quot;:&quot;PWEHAMKXJO&quot;}" data-component-name="LatexBlockToDOM"></div><div class="latex-rendered" data-attrs="{&quot;persistentExpression&quot;:&quot;D_{KL}(\\zeta||\\varph" data-component-name="LatexBlockToDOM"></div>
查看原文

相似文章

无限制AI

Reddit r/AI_Agents

一篇讨论无限制AI概念或影响的文章,可能聚焦于最少约束的人工智能系统的风险或收益。