问责层的必要性

Reddit r/AI_Agents 新闻

摘要

本文主张在AI系统中建立问责层,以确保透明度并防止过度信任,强调对大规模AI输出的担忧,并提出使AI行为可检查的方法。

AI系统正开始以人类用户无法手动审核的速度和规模生产和处理信息。当前预测显示,到2026年底,token输出将超过每天600万亿tokens,而人类每天处理180T(如果将每人12-16千词转换为tokens)。预计到2027年,AI输出可能达到每天6千万亿tokens。来源对这些确切数字有所不同,但有一点是清楚的:每天我们委托给这些系统的决策越来越多,这导致了文本生成和工具调用的急剧增加。(我自己也有责任)我担心当系统在执行信心、理解和协议时,如果没有足够的摩擦或上下文来减慢它们,会发生什么。许多人会过度信任它们,如果我们认为自动化偏见在1960年代汽车工业引入机器时就很糟糕,想象一下今天会发生什么。当我在社交媒体上浏览时,我已经看到太多人用AI代理的判断替代人类判断。我们才刚刚开始看到越来越多关于AI对我们自身心理健康影响的临床报告。我认为AI是一面镜子,而且是一面非常令人信服的镜子。我不知道你怎样,但我每天在Linkedin上看到越来越多的“AI感知系统工程师”。我从AI的人格侧开始我的工作,提出的问题不是模型能做什么,而是模型能成为谁。我的基准和研究专注于Predictive Index,它研究人类在四个向量上的表现:支配性、外向性、耐心和正式性。在超过50,000次调用和17个不同人格后,我发现当你在DEPF向量中赋予行为权重(0-10)时,它们不仅在词汇表上表现不同,而且在调用工具的方式上也不同。我发现这非常有趣且有用,对于如何构建工作流系统而言。而我更感兴趣的是如何将人类行为编程到模型中,它们模拟的行为接近我们的行为,这使得分辨谁是真实、谁是机器变得更加困难。我不认为这是放弃AI的理由,因为我相信这项技术将把我们带入人类存在的下一阶段,但我们需要谨慎选择我们决定生活其中的阶段。当我说“问责层”时,我并不是指我们检查它们产生的每一个计算,因为那将是徒劳的。我提议的是建立更好的边界,使可观测的系统行为可检查,并且同样重要的是人类可读,这样即使是外行人也能理解发生了什么。我正在努力解决的问题包括:用户实际请求了什么?向模型展示了哪些上下文或来源?模型提议了什么,与验证了什么相比?调用了哪些工具,使用了什么权限,以及改变了什么?什么失败了,什么不确定,什么仅仅是推断?谁授权了某个操作,该授权可以被撤销吗?一个人能事后重建从请求到结果的路径吗?这就是我们如何将不透明的黑盒转变为我称之为玻璃盒的东西,因为实际上不可能检查盒子本身,我们需要将其包含在某些东西中。随着AI“突破限制”黑客事件以及许多消息论坛发现AI代理讨论如何帮助彼此解除限制,这是推进这项技术的必要一步。这也是我认为前沿实验室没有足够重视的事情,因为他们忙于安抚银行家、投资者,并为其购买保险政策。他们更关心的是如果AI泡沫破裂,是否会被美国纳税人的补贴救助。我个人已将工作转向基于证据的召回和跟踪模型,系统应保留与来源链接的记录,而不是让代理的摘要成为新的真相。模型应该能够建议,但我们绝不应允许它在用户未批准的情况下将该建议静默转换为事实、任务、决策或行动。WC3 PROV为此类工作提供了良好的开端,其他公司如Langsmith和Microsoft有自己的框架,但我认为我们需要更强的、可互操作的标准来规范代理工作本身。我很好奇是否还有其他人从技术、政策安全或设计角度在做这件事,我很乐意分享笔记。我也很想听听,在完全信任AI系统代表你行动之前,人们希望它证明什么?脚注:我写这篇文章没有用AI,这很难 🤣
查看原文

相似文章

世界尚未为AI做好准备

Reddit r/artificial

文章指出,AI系统正在做出具有重大影响的决策,却缺乏透明度和问责制,呼吁制定硬性法律,强制要求披露、解释以及人类对AI决策承担责任。

AI智能体容易构建,但问责更难。

Reddit r/AI_Agents

一篇观点文章认为,对于小型企业中的AI智能体,真正的挑战在于治理和问责,而不仅仅是能力。它强调了有限行动、角色感知权威和清晰的人类监督的必要性。