我们的确定性验证引擎在规范结构化输入上通过了66/66个基准测试用例。
摘要
一个确定性验证引擎在基准测试中,在规范结构化输入上取得了66/66的满分,而实时模型评估通过了19/66个用例。团队正在重构基准测试,以更好地隔离故障并衡量各个流水线阶段的性能。
我们的确定性验证引擎在规范结构化输入上通过了66/66个基准测试用例。在实时模型评估中,端到端流水线目前通过了19/66个用例。我们正在重构基准测试,以根据故障的首个无效状态来隔离故障,并分别衡量确定性验证器的正确性、生产契约完整性和实时模型生成可靠性。下一个基准测试版本将提供跨传输、解析、模式验证、规范化、声明绑定、证据图构建、确定性和最终结果映射的阶段级归因。https://www.reddit.com/r/ArtificialInteligence/comments/1vucc82/i_benchmarked_my_deterministic_ai_financial/
相似文章
我测试了我的确定性AI金融验证引擎。核心部分通过了66/66,但实时LLM管道仅通过了19/66。
这篇文章报告了对确定性AI金融验证引擎的基准测试结果,显示在结构化声明上表现完美(66/66),但当使用LLM生成的声明时表现不佳(19/66),表明LLM与形式系统之间存在翻译差距。
@vicky_grok: 这真是不可思议 我们对4种不同的AI代理架构在完全相同的120个任务套件上进行了基准测试。The wi…
对四种AI代理架构的基准测试表明,基于验证的设计达到了100%的成功率,这突显了架构选择比原始步骤预算对性能更为关键。
@gurtej__gill_: 来自斯坦福、伯克利和NVIDIA的这篇新论文感觉像是测试时计算拼图中至关重要的一块……
这篇来自斯坦福、伯克利和NVIDIA的论文提出了LLM-as-a-Verifier,一个利用token logits进行连续评分的通用验证框架。它在包括Terminal-Bench V2(86.5%)和SWE-Bench Verified(78.2%)在内的多个基准上达到了SOTA,并提供了可以加速强化学习训练的细粒度信号。
@dair_ai: 值得一读的新论文。GPT-5.4 nano 加上 critic-comparator 编排循环在 SWE-bench Verified 上达到 76.4%,匹配…
一篇新论文表明,使用一个弱模型,通过 k=8 个提议和 critic-comparator 选择循环,可以在 SWE-bench Verified 上匹配前沿模型的性能,达到 76.4% 的准确率。关键见解是,正确的补丁通常已经存在于弱模型的前 k 个候选补丁中,挑战在于如何利用执行验证进行有效选择。
@ArizePhoenix: 结果:在内部Code Bench上相比5.2提升了50%,Terminal-Bench 3.0从4.6提升到28.3,DeepSWE v1.1 从…
DeepSWE v1.1在内部Code Bench上提升了50%,并在Terminal-Bench 3.0和Agents' Last Exam上取得了新的SOTA成绩,同时新兴的网络能力发展超出预期。