人人都在验证智能体,却几乎无人验证言论本身。我为多智能体链构建了一个信任层,为每个传递者打分
摘要
作者发布了ISNAD框架,借鉴约1400年历史的伊斯兰学术验证方法论,为多智能体AI链中的每个传递者打分,以验证AI生成言论的真实性和独立佐证。
我自己构建了这个系统,刚刚发布到 arXiv 上——在这里分享,是因为这个版块里的人正是能精准找出问题所在的人。关于智能体链,情况是这样的:一个答案要经过抓取器、提取器、几个模型、综合器。有些环节可靠,有些则不可靠。当它们出错时,是悄无声息地出错——给出一个自信、流畅的答案,实际上却悄悄错了。我们都在竞相验证智能体的身份、权限、访问范围。几乎没有人去验证言论本身:它说的内容是否真实、是否有独立的佐证。于是,我采用了一种大约有1400年历史、专为这种情况而生的方法论。伊斯兰学者在验证传述言论时,会根据传述链条(isnād)对每项主张评级,根据诚实度和精确度(rijāl)对每位传述者打分,认为链条的强度取决于最薄弱的一环,允许独立的链条提高可信度,并将信息本身与其链条分开判断。我把它重新构建为多智能体 AI 的言论级信任层,称为 ISNAD。论文里也写了失败之处——已验证的机制和尚未验证的机制,都一一列出。诚实本来就是信任框架的核心意义所在。我既期待认同,也期待反对意见。
相似文章
大约1400年前,学者们建立了一套严谨的系统来验证谁值得信任。我将其重建为AI代理的信任层。
作者介绍了ISNAD,这是一个受伊斯兰教isnad系统启发的AI代理信任层,旨在验证跨多代理链的声明来源。该论文发表在arXiv上,并附有代码。
将1200年历史的伊斯兰圣训验证方法改编为多智能体AI系统的信任框架
作者将古典伊斯兰圣训验证方法改编为多智能体AI系统的信任框架,并以论文和Python包(isnad)的形式发布。
ISNAD:一种面向多智能体LLMs的声明级溯源框架,用于对“叙述者”(智能体/模型/爬虫)进行分级,改编自经典圣训传承学
ISNAD引入了一种面向多智能体LLMs的声明级溯源框架,受经典圣训传承学启发,对叙述者(智能体、模型、爬虫)的可靠性进行分级。
如果 AI 代理无处不在,我们如何知道哪些值得信任?
随着 AI 代理变得无处不在,挑战从比较性能转向建立信任和声誉,需要新的发现和验证系统。
可验证的智能体基础设施:面向主权AI系统的基于证明的授权机制
本文提出了一种分布式信任框架(DTF),用于自主AI代理系统中的可验证、基于证明的授权,通过要求提供理由证明和共识执行来应对以身份为中心的权限所带来的风险。