人人都在验证智能体,却几乎无人验证言论本身。我为多智能体链构建了一个信任层,为每个传递者打分

Reddit r/AI_Agents 论文

摘要

作者发布了ISNAD框架,借鉴约1400年历史的伊斯兰学术验证方法论,为多智能体AI链中的每个传递者打分,以验证AI生成言论的真实性和独立佐证。

我自己构建了这个系统,刚刚发布到 arXiv 上——在这里分享,是因为这个版块里的人正是能精准找出问题所在的人。关于智能体链,情况是这样的:一个答案要经过抓取器、提取器、几个模型、综合器。有些环节可靠,有些则不可靠。当它们出错时,是悄无声息地出错——给出一个自信、流畅的答案,实际上却悄悄错了。我们都在竞相验证智能体的身份、权限、访问范围。几乎没有人去验证言论本身:它说的内容是否真实、是否有独立的佐证。于是,我采用了一种大约有1400年历史、专为这种情况而生的方法论。伊斯兰学者在验证传述言论时,会根据传述链条(isnād)对每项主张评级,根据诚实度和精确度(rijāl)对每位传述者打分,认为链条的强度取决于最薄弱的一环,允许独立的链条提高可信度,并将信息本身与其链条分开判断。我把它重新构建为多智能体 AI 的言论级信任层,称为 ISNAD。论文里也写了失败之处——已验证的机制和尚未验证的机制,都一一列出。诚实本来就是信任框架的核心意义所在。我既期待认同,也期待反对意见。
查看原文

相似文章