打造了一个开源AI代理事实核查器,只有能提供实际证据支持,主张才会被放行。

Reddit r/AI_Agents 工具

摘要

构建了一个用于AI代理的开源事实检查器,通过获取实时来源验证主张,并提供真实性和置信度评分,适用于公开和内部文档。

一直困扰我的问题是:问AI'你有多确定?',它几乎总是说95%,不管对错。聊天时这没问题,但当代理要基于这些信息行动时——写入报告、保存到知识库、做决策——就不行了。所以我们构建了这个先检查的东西。你给它一个主张,它就立即获取真实来源(从不依赖模型记忆),并返回两个独立数字:真实性评分(是否真的为真)和置信度评分(你应该多信任这个答案——当来源稀少或彼此矛盾时会下降)。还有来源和一个简单明了的'为什么'。对我们来说最有用的部分是:它不仅限于对照公共网络检查。它还能根据文档引用的来源验证文档中的主张——这对内部资料(政策、指标定义、模式文档)很重要,因为网络对此没有意见。我们构建了一个演示,在一个假财务政策包中植入了四个错误,它捕捉到了所有四个,同时保持未修改的控制文件不变。完全开源,MIT许可,可独立在浏览器中工作,作为你代理的MCP工具,或覆盖整个知识库。两个免费API密钥,几分钟内就能在本地运行。如果你试用,我们真诚希望得到反馈或问题——链接在第一条评论(子规则)。如果它对你有用,在仓库点个星比你想象的更有帮助。
查看原文

相似文章

FACTWASH:捕捉将传闻洗成事实的AI改写

arXiv cs.CL

介绍了factwash,一个开源的写入时门控,它通过去除来源归属、模糊限制语或时间语境,确定性地捕捉将传闻变成事实的AI改写。本文分析了何时简单检查就足够、何时需要LLM见证者,并在大型标注语料库上评估了该方法。