开源税务引擎超越gpt sol和Fable 5

Reddit r/ArtificialInteligence 工具

摘要

一款开源税务引擎在TaxCalcBench上达到96%,超越了之前的模型,并发现了基准测试本身的不一致性。它为AI模型提供了确定性引擎,可用于税务研究和准备。

这是一个开源税务引擎,在TaxCalcBench上得分96%[迄今为止最高记录],超越了fable 5和sol,仅使用sonnet 5(之前得分仅6%)。它遗漏的仅有的两个案例中,它发现了基准测试本身测试用例的不一致性,且维护人员已确认!本质上,这是一个确定性引擎,AI模型可以用于研究和税务准备,以消除经常出现的猜测和计算错误。Claude Sonnet 5凭借此mcp登上了基准测试榜首。
查看原文

相似文章

Artificial Analysis 的 GPT 5.6 系列基准测试

Reddit r/singularity

Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。

GPT 5.6 Sol 基准测试

Reddit r/singularity

GPT 5.6 Sol 在 AI 语言建模方面取得新的基准测试结果,展示了性能改进。