我们的确定性验证引擎在规范结构化输入上通过了66/66个基准测试用例。

Reddit r/ArtificialInteligence 工具

摘要

一个确定性验证引擎在基准测试中,在规范结构化输入上取得了66/66的满分,而实时模型评估通过了19/66个用例。团队正在重构基准测试,以更好地隔离故障并衡量各个流水线阶段的性能。

我们的确定性验证引擎在规范结构化输入上通过了66/66个基准测试用例。在实时模型评估中,端到端流水线目前通过了19/66个用例。我们正在重构基准测试,以根据故障的首个无效状态来隔离故障,并分别衡量确定性验证器的正确性、生产契约完整性和实时模型生成可靠性。下一个基准测试版本将提供跨传输、解析、模式验证、规范化、声明绑定、证据图构建、确定性和最终结果映射的阶段级归因。https://www.reddit.com/r/ArtificialInteligence/comments/1vucc82/i_benchmarked_my_deterministic_ai_financial/
查看原文

相似文章

@dair_ai: 值得一读的新论文。GPT-5.4 nano 加上 critic-comparator 编排循环在 SWE-bench Verified 上达到 76.4%,匹配…

X AI KOLs Following

一篇新论文表明,使用一个弱模型,通过 k=8 个提议和 critic-comparator 选择循环,可以在 SWE-bench Verified 上匹配前沿模型的性能,达到 76.4% 的准确率。关键见解是,正确的补丁通常已经存在于弱模型的前 k 个候选补丁中,挑战在于如何利用执行验证进行有效选择。