标签
ISA-Bench introduces a benchmark using programming games with constrained instruction sets to evaluate computational reasoning in large language models, revealing insights into model capabilities and a reasoning-execution gap.
IntLawNER 是一个新的用于国际法的命名实体识别数据集和基准,涵盖了来自法律文本的金标准标注句子,并评估了模型在少样本改进方面的性能。
Peerify 是一个用于自动验证同行评审声明与稿件证据的流程,使用来自 NeurIPS 2024 和 ICLR 2024 的 800 个声明的基准,证明以检索为中心的验证优于蕴含基线。
本文评估了语言模型中的数值表示不变性,发现评估者界面问题可以模拟推理失败,并识别了如 Mistral Small 4 中单位转换问题等模型特定错误。
M5 ultra AI 测试结果显示,提示处理速度比 M3 ultra 快 4 到 4.5 倍,令牌生成速度快 1.5 倍,但功耗翻倍,风扇噪音增大,温度更高。
如图所示,在基准测试对比中,Opus 5.5 的表现优于 GPT-6 Astra 和 Sol,但成本更高。
本文评估了 Opus 5.5 AI 模型在 Terminal-Bench 4.0 基准测试中的成本效益和性能。
Claude Opus 5.5 已在 Artificial Analysis Intelligence Index 中获得首位,并伴随20%的价格下调和增强的缓存命中优惠。
LinearSolveBench 是一个用于评估 C 语言线性求解器的新基准测试,重点关注针对大型稀疏系统的速度、精度和通用性,以促进算法进步。
JevBench v1.3.0 是一个用于Jev类决策模型的可复现基准测试,基于智能性、校准度、速度和成本对52个系统进行评估和排名。
一条推文对比了 GPT-6 Astra 和 Anthropic 新模型 Mythos 在 Pelican SVG 测试中的表现,并附有外部来源链接。
Cognition 在 Devin 中发布了 Grok 4.7,在 FrontierCode 1.1 Extended 任务上取得了 59.4% 的分数,展示了在后端工程方面的强大性能。
基于Artificial Analysis的基准和指标对MiMo-v2.6-Pro AI模型的智能、性能与价格进行分析。
本研究以编码代理重现Eurostat统计数据为基准进行评估,发现语义验证和重试预算对可靠性至关重要,远不止于执行诊断。
一项系统性的基准测试研究,对多模态大语言模型的免训练不确定性量化策略进行评测,将方法分为基于令牌级、语言化和语义的方法,并发现最佳策略取决于响应长度。
介绍PII-TRACE,首个用于多轮LLM对话中上下文感知PII检测的基准,以及PII-Tracer,一个实现高实体级覆盖率的紧凑检测器。
本文介绍了SCoR,一种用于预测科学概念之间关系的层次框架,其中包含一个基准和模型,通过预测类型化关系来改进研究方向的发现。
论文介绍了Whiteboard,这是首个通过交叉参考幻觉来评估大型语言模型想象力的基准测试,并在79个最先进的LLMs中揭示了两者之间反直觉的负相关。