标签
SWE-Bench Pro V2是一个更新的基准测试,用于在软件工程中评估AI代理,包含来自11个代码库的642个任务,具有改进的评估协议和污染控制。
Opus 5.5 在 ParseBench 上针对 PDF 表格解析的得分为 93.9%,超越了 Opus 5 和其他模型,但与 LlamaParse 相比成本较高。
M5 ultra AI 测试结果显示,提示处理速度比 M3 ultra 快 4 到 4.5 倍,令牌生成速度快 1.5 倍,但功耗翻倍,风扇噪音增大,温度更高。
如图所示,在基准测试对比中,Opus 5.5 的表现优于 GPT-6 Astra 和 Sol,但成本更高。
本文评估了 Opus 5.5 AI 模型在 Terminal-Bench 4.0 基准测试中的成本效益和性能。
Claude Opus 5.5 已在 Artificial Analysis Intelligence Index 中获得首位,并伴随20%的价格下调和增强的缓存命中优惠。
据称,开源MiMo v2.6模型建立了新的帕累托前沿,在基准测试中成本比Grok 4.7低57倍,比DeepSeek v4.1 Flash便宜27%。
LinearSolveBench 是一个用于评估 C 语言线性求解器的新基准测试,重点关注针对大型稀疏系统的速度、精度和通用性,以促进算法进步。
JevBench v1.3.0 是一个用于Jev类决策模型的可复现基准测试,基于智能性、校准度、速度和成本对52个系统进行评估和排名。
一条推文对比了 GPT-6 Astra 和 Anthropic 新模型 Mythos 在 Pelican SVG 测试中的表现,并附有外部来源链接。
Cognition 在 Devin 中发布了 Grok 4.7,在 FrontierCode 1.1 Extended 任务上取得了 59.4% 的分数,展示了在后端工程方面的强大性能。
基于Artificial Analysis的基准和指标对MiMo-v2.6-Pro AI模型的智能、性能与价格进行分析。
本研究以编码代理重现Eurostat统计数据为基准进行评估,发现语义验证和重试预算对可靠性至关重要,远不止于执行诊断。
一项系统性的基准测试研究,对多模态大语言模型的免训练不确定性量化策略进行评测,将方法分为基于令牌级、语言化和语义的方法,并发现最佳策略取决于响应长度。
介绍PII-TRACE,首个用于多轮LLM对话中上下文感知PII检测的基准,以及PII-Tracer,一个实现高实体级覆盖率的紧凑检测器。
本文介绍了SCoR,一种用于预测科学概念之间关系的层次框架,其中包含一个基准和模型,通过预测类型化关系来改进研究方向的发现。
论文介绍了Whiteboard,这是首个通过交叉参考幻觉来评估大型语言模型想象力的基准测试,并在79个最先进的LLMs中揭示了两者之间反直觉的负相关。
HARMONY是一个开源框架,利用分层代理推理和VLMs从单张室内图像重建组合式3D场景,在视觉质量上与GPT-6 Astra竞争,并在几何对齐上表现更优。
RoboFollow 引入了一个诊断基准,通过分析高场景熵和扰动来揭示具身代理中的指令跟随幻觉,暴露了当前模型在强大初始性能背后的差距。