标签
根据 Artificial Analysis 的数据,Google 将 OpenRouter 上的 Gemini 3.7 Flash 降价75%,使其更便宜,并在性价比上超越了 DeepSeek 模型。
一项使用Claude Opus 4.8代理对九种代理网页搜索工具的基准测试发现,成本较低的工具往往优于较昂贵的工具,其中Firecrawl在准确性上排名第一,Serper则最具成本效益。
Databricks发布了一项内部基准测试,在数百万行代码的代码库上评估编码代理,结果显示框架选择可加倍节省成本,并且像GLM 5.2这样的开源模型在最高难度级别上表现具有竞争力。
Databricks 分享了在其数百万行代码库上评估编码智能体的内部基准测试结果,揭示了能力层级和成本性能权衡,并强调了像 GLM 5.2 这样的开源模型的有效性。
比较了四个AI模型(Fable 5、GPT 5.5、Opus 4.8、GLM 5.2)在三个HTML5物理场景任务上的表现和成本,Fable 5质量最好但价格是Opus的近6倍,质量与价格尚未兼得。
本文介绍了The Efficiency Frontier,一个用于LLM上下文管理成本-性能优化的统一框架,它将上下文策略选择建模为一个部署感知的优化问题,通过摊销内存压缩,与全上下文提示相比,实现了25%的token使用量减少和超过50%的token成本降低。
在对抗性POMDP(CybORG CAGE-2)中对复合LLM智能体设计进行了一项受控研究,系统性地在五个模型系列中变化上下文、推理与层次结构。主要发现:程序化状态抽象每token产生巨大回报,无推理工具的层次结构实现了最佳绝对性能,并且上下文工程比深度推理更具成本效益。
在乌克兰法律文本上对七个基础模型进行了基准测试,发现分词器通量差异达1.6倍,少样本提示会降低性能,成本效益分析表明NVIDIA Nemotron Super 3优于更大模型。