我构建了一个确定性引擎,能在AI的财务计算错误发布之前就抓住它们——想找人挑刺
摘要
作者构建了一个确定性验证层,重新计算AI副驾生成的财务数字以捕捉错误,并正在寻求金融和AI从业者的反馈。
快速背景:过去一年多,我一直在做“AI幻觉”相关的事情,特别是金融领域的。在继续推进之前,我想要真诚的反馈——不是点赞,而是真正的批评。
我想解决的问题:AI副驾越来越多地起草财务数字——比率、契约检查、对账、从报表中提取的KPI。问题不在于AI不擅长这个,而在于它有时会自信地给出错误结果。在金融领域,报告或契约计算中一个自信的错误数字不是一个小bug,而是实实在在的责任。
我构建的东西:一个独立的、确定性的验证层(不是另一个AI模型),位于AI输出之后。它:
- 从底层文档(PDF、XLSX、DOCX)中提取实际的源值
- 使用精确的规则/公式独立重新计算声称的数字,而不是凭感觉
- 将AI的声称值与重新计算的结果进行比较
- 标记不匹配项,并提供完整的审计追踪——使用了什么证据、应用了什么规则、在哪里出现了分歧
所以不是“相信AI的数学”,而是“这里有证明数学是正确的,或者这里正是它出错的地方以及为什么。”
目前的进展:
- 在核心财务比率(净杠杆等)上端到端工作
- 完整的从证据到结论的可追溯性(没有指向源数据的指针,就不会断言任何内容)
- 还没有:广泛的规则覆盖、基于容差的匹配(目前是严格精确匹配,我知道这会导致四舍五入上的误报——正在积极解决)
我不要什么:钱、测试版注册、“看看我的落地页”。我真心希望在我把更多时间投入错误的方向之前,把这个东西撕开来看。
我真正想知道的是:
- 如果你在金融/会计/审计/合规领域工作——“AI起草,确定性引擎证明”听起来是你真正想要的,还是在解决一个没人有的问题?
- 如果你构建过任何相关的项目(事实核查管道、智能体护栏、财务数据提取)——你在尝试类似的事情时,什么崩溃了?
- 我还没有看到什么?
- 有没有人从合规角度处理过“AI + 审计追踪”的要求?在这里,什么才能真正满足审计师或监管机构,而什么听起来不错但不够?
很高兴回答任何关于其内部工作原理的问题。我不想遮遮掩掩,只是不想让这篇帖子变成一份规格文档。
相似文章
标题:我正在寻找喜欢解决正确性而非AI问题的工程师
作者分享了自己构建原型以验证AI生成的财务声明的经验,重点关注系统与工程挑战,如证据对账和确定性验证,并邀请志同道合的工程师进行交流。
核查问题:AI在受监管企业上线前必须满足什么条件
本文分析了企业AI在受监管企业中的部署为何停滞不前,提出了一个包含准确性、可复现性、有据可依性和可检测性的生产标准。文章测量了不同模型和工具配置下的人工审查负担,表明置信度信号和来源引用可将审查率从100%降至49%,但自我验证增加了延迟,却没有提高错误容忍度。
从准确性到可审计性:金融AI系统中的确定性综述
本综述研究了金融AI系统中的计算非确定性,涵盖表格模型、图网络和基于LLM的工作流,并提出了一个用于可审计性的分层评估框架。
AI现在能构建应用了,但谁来检查它构建的是否正确?
关于AI编码代理下一个瓶颈的讨论:验证AI生成的应用是否正确,以及谁应该负责检查输出。
构建了一个将金融新闻转化为结构化分析的AI管道
构建了一个AI管道,将金融新闻转化为结构化分析,包括情感、风险和机遇,重点通过提示工程和验证确保一致性。