我构建了一个确定性引擎,能在AI的财务计算错误发布之前就抓住它们——想找人挑刺
摘要
作者构建了一个确定性验证层,重新计算AI副驾生成的财务数字以捕捉错误,并正在寻求金融和AI从业者的反馈。
快速背景:过去一年多,我一直在做“AI幻觉”相关的事情,特别是金融领域的。在继续推进之前,我想要真诚的反馈——不是点赞,而是真正的批评。
我想解决的问题:AI副驾越来越多地起草财务数字——比率、契约检查、对账、从报表中提取的KPI。问题不在于AI不擅长这个,而在于它有时会自信地给出错误结果。在金融领域,报告或契约计算中一个自信的错误数字不是一个小bug,而是实实在在的责任。
我构建的东西:一个独立的、确定性的验证层(不是另一个AI模型),位于AI输出之后。它:
- 从底层文档(PDF、XLSX、DOCX)中提取实际的源值
- 使用精确的规则/公式独立重新计算声称的数字,而不是凭感觉
- 将AI的声称值与重新计算的结果进行比较
- 标记不匹配项,并提供完整的审计追踪——使用了什么证据、应用了什么规则、在哪里出现了分歧
所以不是“相信AI的数学”,而是“这里有证明数学是正确的,或者这里正是它出错的地方以及为什么。”
目前的进展:
- 在核心财务比率(净杠杆等)上端到端工作
- 完整的从证据到结论的可追溯性(没有指向源数据的指针,就不会断言任何内容)
- 还没有:广泛的规则覆盖、基于容差的匹配(目前是严格精确匹配,我知道这会导致四舍五入上的误报——正在积极解决)
我不要什么:钱、测试版注册、“看看我的落地页”。我真心希望在我把更多时间投入错误的方向之前,把这个东西撕开来看。
我真正想知道的是:
- 如果你在金融/会计/审计/合规领域工作——“AI起草,确定性引擎证明”听起来是你真正想要的,还是在解决一个没人有的问题?
- 如果你构建过任何相关的项目(事实核查管道、智能体护栏、财务数据提取)——你在尝试类似的事情时,什么崩溃了?
- 我还没有看到什么?
- 有没有人从合规角度处理过“AI + 审计追踪”的要求?在这里,什么才能真正满足审计师或监管机构,而什么听起来不错但不够?
很高兴回答任何关于其内部工作原理的问题。我不想遮遮掩掩,只是不想让这篇帖子变成一份规格文档。
相似文章
标题:我正在寻找喜欢解决正确性而非AI问题的工程师
作者分享了自己构建原型以验证AI生成的财务声明的经验,重点关注系统与工程挑战,如证据对账和确定性验证,并邀请志同道合的工程师进行交流。
核查问题:AI在受监管企业上线前必须满足什么条件
本文分析了企业AI在受监管企业中的部署为何停滞不前,提出了一个包含准确性、可复现性、有据可依性和可检测性的生产标准。文章测量了不同模型和工具配置下的人工审查负担,表明置信度信号和来源引用可将审查率从100%降至49%,但自我验证增加了延迟,却没有提高错误容忍度。
我测试了我的确定性AI金融验证引擎。核心部分通过了66/66,但实时LLM管道仅通过了19/66。
这篇文章报告了对确定性AI金融验证引擎的基准测试结果,显示在结构化声明上表现完美(66/66),但当使用LLM生成的声明时表现不佳(19/66),表明LLM与形式系统之间存在翻译差距。
我正在为AI生成的声明构建一个独立验证层,并寻找研究人员和合作伙伴与我们共同构建。
作者正在开发一个用于AI生成声明的确定性验证引擎,专注于形式化验证方法,并寻求研究人员和合作伙伴进行合作。
测试AI模型是否能抵御自身错误。
正在开发一款工具,通过向AI模型引入结构化不确定性,评估模型从错误中恢复的能力,并寻求反馈审查。