我正在为AI生成的声明构建一个独立验证层,并寻找研究人员和合作伙伴与我们共同构建。

Reddit r/artificial 工具

摘要

作者正在开发一个用于AI生成声明的确定性验证引擎,专注于形式化验证方法,并寻求研究人员和合作伙伴进行合作。

我一直在开发一个用于AI生成金融声明的确定性验证引擎。最初的想法很简单:LLM应该生成声明,但不应该是验证它们的权威。但在构建和测试系统后,我意识到问题远不止幻觉检测。我现在正在研究的问题是:我们的架构大致如下:LLM ↓ 候选声明 ↓ 声明标准化 ↓ 证据 ↓ 假设 + 约束 ↓ 证明 / 推导 ↓ 矛盾分析 ↓ 确定性验证 ↓ 可审计结果 ↓ 信任 重要部分是验证层独立于模型。例如,如果LLM说:我们不想让LLM的置信度分数决定该陈述是否可信。相反,系统应该能够确定:具体声明了什么?使用了什么证据?声明是否真的可以推导?涉及哪些假设?相关约束是否满足?是否有矛盾证据?结果能否重现?我们能否解释验证结果? 我最近运行了一个66个案例的基准测试。结构化固定声明:66/66通过。然后我用实时GPT-5.1生成的声明运行相同的管道:19/66端到端通过。失败原因是:31个管道执行失败、18个声明绑定失败、2个矛盾检测失败。同时,几个确定性验证组件仍然通过测试,包括证据图完整性、确定性计算、规则应用、缺失证据检测、可重现性和可审计性。 结果改变了我对问题的看法。瓶颈不一定是确定性验证器。在以下方面存在一个困难的转换层:概率语言 ↓ 形式化表示 ↓ 确定性推理 我们现在正在重建基准测试,以便不再简单地说'这个案例失败',而是能识别第一个无效状态:传输 → 解析 → 模式验证 → 标准化 → 声明绑定 → 证据图 → 验证 → 结果映射 我认为这就是有趣的研究/工程问题所在。我们还在探索一个更广泛的框架,围绕声明、证据、假设、约束、证明、矛盾和信任。我们特别感兴趣的一个想法是将信任视为验证过程的涌现输出,而不是简单地使用LLM置信度分数。 这仍然是早期的研究/产品开发。基准测试是内部的,不是第三方验证,数学信任模型仍需要实证验证。我也在积极寻找合作的人。 我们寻找:对形式化验证、可信赖AI、AI评估、形式方法、论证系统、知识表示、数学建模感兴趣的研究人员;能够帮助我们清晰沟通问题、接触技术和商业受众、寻找早期采用者、建立社区、发展公司市场策略的市场营销人员/增长合作伙伴;以及对构建可靠AI系统感兴趣的工程师和技术合作者。特别是金融、风险、审计、合规或其他AI声明错误会导致严重后果领域的行业合作伙伴。 我感兴趣的是找到想与我们共同构建的人,而不仅仅是从旁反馈。如果这个问题让你感兴趣,请私信我或在下方评论。我特别想听到研究人员认为这是一个值得解决的问题。我们还处于早期——这正是为什么现在是参与的好时机。
查看原文

相似文章

提升 AI 开发中的可验证性

OpenAI Blog

OpenAI 发布了一份报告,介绍了提升 AI 开发可验证性的机制,说明了利益相关者如何验证组织关于 AI 系统属性和安全实践的声明。