开源税务引擎超越gpt sol和Fable 5
摘要
一款开源税务引擎在TaxCalcBench上达到96%,超越了之前的模型,并发现了基准测试本身的不一致性。它为AI模型提供了确定性引擎,可用于税务研究和准备。
这是一个开源税务引擎,在TaxCalcBench上得分96%[迄今为止最高记录],超越了fable 5和sol,仅使用sonnet 5(之前得分仅6%)。它遗漏的仅有的两个案例中,它发现了基准测试本身测试用例的不一致性,且维护人员已确认!本质上,这是一个确定性引擎,AI模型可以用于研究和税务准备,以消除经常出现的猜测和计算错误。Claude Sonnet 5凭借此mcp登上了基准测试榜首。
相似文章
开源模型正以约1.5倍于前沿模型的速度缩小与GPT/Claude/Gemini的编码差距,且在去污染基准测试中,一个27B模型已经击败了Claude Opus 4.8 [实时仪表盘 + 分析]
一个实时仪表盘和统计分析显示,开源编码模型正以1.5倍的速度缩小与闭源模型的差距,一个27B模型已经在去污染基准测试中超越了Claude Opus。工具调用可靠性仍然是主要瓶颈。
Artificial Analysis 的 GPT 5.6 系列基准测试
Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。
@cline: GLM-5.3 (max) 在新的 Terminal-Bench 4.0 上超越了 GPT-5.6 Sol (max)。看到开放权重竞争如此激烈,真是令人难以置信……
GLM-5.3 (max) 在 Terminal-Bench 4.0 上超越了 GPT-5.6 Sol (max),突显了开放权重 AI 模型的竞争力,同时推广 Cline 的折扣访问。
@rohanpaul_ai: 令人惊讶的好消息,开源编码模型,而且还有很多隐藏的机会可以降低成本……
Databricks 测试了开源编码模型 GLM-5.2,发现它在真实企业代码任务中可与 Claude Opus 4.8 等顶级闭源模型竞争,同时成本更低(每任务 1.28 美元对 1.94 美元)。评估还强调了 Pi 这个框架,它通过减少每轮发送的上下文来降低成本。
GPT 5.6 Sol 基准测试
GPT 5.6 Sol 在 AI 语言建模方面取得新的基准测试结果,展示了性能改进。