我正在为AI代理构建一个信念数据库。这是一个原型——你有真实数据集可以测试吗?
摘要
Verus 是一个为AI代理设计的开源信念数据库,能够追踪来自多个来源的冲突声明,并附带置信度评分和冲突检测功能;作者正在寻找真实世界的数据集和反馈。
大家好,我正在构建 **Verus** —— 一个为AI代理设计的开源信念数据库。核心理念是:传统数据库存储事实:`user.city = 'Lisbon'`,而 Verus 存储的是 **声明** —— 关于同一事物的多个断言来自不同来源,每个都带有置信度评分、有效期以及冲突检测。它帮助代理决定 **该相信什么**。示例:4个来源对用户位置给出了4种不同说法(CRM显示纽约,用户说里斯本,IP地理位置显示伦敦,日历显示东京)。Verus 追踪全部四个来源及其置信度和有效期,检测矛盾,并通过策略驱动的解决方案将其暴露给代理。原型展示了:
* 冲突图 —— 节点是声明,边是它们之间的矛盾
* 随时间视觉衰减的置信度评分
* 来源过滤(CRM、用户输入、API、文档、代理推理)
* 带有有效窗口的声明时间线
**技术栈:** Rust 核心(二进制存储,单个文件,零依赖)+ MCP 服务器(与 Claude Code、Cursor、VS Code、Windsurf 兼容)+ 用于可视化的 Web 界面。
**我所寻求的:** 我已经用合成数据(24个声明,9个冲突,来自5个来源)构建了这个原型。在进一步深入之前,我想用真实场景进行验证:
1. **你是否有来自多个来源的冲突信息数据集**,我可以用作测试?
2. **你目前在代理中处理冲突数据的方法是什么?** 硬编码规则?LLM 提示?还是其他方法?
3. **你最常遇到的冲突类型是什么** —— 矛盾、数据过时、来源可靠性问题?
对这个概念或原型的任何反馈也都很受欢迎。谢谢!
相似文章
我构建了一个信任引擎,帮助AI智能体逐步实现自主运行
一个开源信任引擎(测试版),帮助AI智能体从引导模式逐步过渡到协同工作再到自主状态,具备决策理由记录和人在回路审批功能,目前正在寻找早期采用者。
我开源了Aletheia——一个用于调查没有明确验证者的问题的代理循环。
Aletheia是一个开源的代理循环,专为调查答案不易验证的问题而设计,例如供应商可信度或财务健康状况。它维护一个明确的信念状态,选择搜索以最大化信息增益,并在证据不足时可以停止而不强行得出结论。
@QuixiAI:宣布推出QuixiAI/SYN-1B——一个合成预训练数据集,旨在教导模型跟踪规则、更新信念……
QuixiAI发布SYN-1B,这是一个合成预训练数据集,旨在教导模型在长上下文中的规则跟踪、信念更新和证据保留,可在Hugging Face上获取。
当科学发现没有标准答案时,我们如何验证人工智能提出的假设
探讨了在科学发现中验证人工智能生成假设的挑战——当不存在基准真相时如何应对,并介绍了Apodex的多智能体方法,即使用独立的验证智能体作为解决方案。
构建了一个开源工具,用于检测 AI 智能体系统中缺失的验证、重试和错误处理
我们发布了 Trustabl Agent Analyzer,一款开源工具,可扫描 AI 智能体仓库,检测缺失的验证、重试和错误处理,并生成保护隐私的本地报告。