benchmark

标签

Cards List
#benchmark

ISA-Bench: A Benchmark for Computational Reasoning Across Instruction Set Architectures

arXiv cs.AI · 5小时前 缓存

ISA-Bench introduces a benchmark using programming games with constrained instruction sets to evaluate computational reasoning in large language models, revealing insights into model capabilities and a reasoning-execution gap.

0 人收藏 0 人点赞
#benchmark

IntLawNER: 国际法中的命名实体识别数据集与基准

arXiv cs.AI · 5小时前 缓存

IntLawNER 是一个新的用于国际法的命名实体识别数据集和基准,涵盖了来自法律文本的金标准标注句子,并评估了模型在少样本改进方面的性能。

0 人收藏 0 人点赞
#benchmark

Peerify:同行评审声明验证基准测试

arXiv cs.CL · 5小时前 缓存

Peerify 是一个用于自动验证同行评审声明与稿件证据的流程,使用来自 NeurIPS 2024 和 ICLR 2024 的 800 个声明的基准,证明以检索为中心的验证优于蕴含基线。

0 人收藏 0 人点赞
#benchmark

相同数量,不同答案:语言模型中的数值表示不变性

arXiv cs.CL · 5小时前 缓存

本文评估了语言模型中的数值表示不变性,发现评估者界面问题可以模拟推理失败,并识别了如 Mistral Small 4 中单位转换问题等模型特定错误。

0 人收藏 0 人点赞
#benchmark

M5 ultra AI 测试结果

Reddit r/LocalLLaMA · 11小时前

M5 ultra AI 测试结果显示,提示处理速度比 M3 ultra 快 4 到 4.5 倍,令牌生成速度快 1.5 倍,但功耗翻倍,风扇噪音增大,温度更高。

0 人收藏 0 人点赞
#benchmark

LLM Ass Bench

Hacker News Top · 12小时前 缓存

LLM Ass Bench 是一个用于评估大型语言模型的基准测试工具,专注于提示词。

0 人收藏 0 人点赞
#benchmark

Opus 5.5 与 GPT-6 Astra/Sol 的所有基准测试对比

Reddit r/singularity · 13小时前

如图所示,在基准测试对比中,Opus 5.5 的表现优于 GPT-6 Astra 和 Sol,但成本更高。

0 人收藏 0 人点赞
#benchmark

Opus 5.5 在 Terminal-Bench 4.0 上的成本与性能对比

Reddit r/singularity · 16小时前

本文评估了 Opus 5.5 AI 模型在 Terminal-Bench 4.0 基准测试中的成本效益和性能。

0 人收藏 0 人点赞
#benchmark

Claude Opus 5.5 在 Artificial Analysis Intelligence Index 上位居榜首,同时实现20%降价与更大的缓存命中折扣。

Reddit r/ArtificialInteligence · 16小时前

Claude Opus 5.5 已在 Artificial Analysis Intelligence Index 中获得首位,并伴随20%的价格下调和增强的缓存命中优惠。

0 人收藏 0 人点赞
#benchmark

LinearSolveBench: 线性求解器的新基准测试 [P]

Reddit r/MachineLearning · 17小时前

LinearSolveBench 是一个用于评估 C 语言线性求解器的新基准测试,重点关注针对大型稀疏系统的速度、精度和通用性,以促进算法进步。

0 人收藏 0 人点赞
#benchmark

Show HN: JevBench,一个用于类型化决策模型的可复现基准测试

Hacker News Top · 20小时前 缓存

JevBench v1.3.0 是一个用于Jev类决策模型的可复现基准测试,基于智能性、校准度、速度和成本对52个系统进行评估和排名。

0 人收藏 0 人点赞
#benchmark

GPT-6 Astra 对决 Anthropic 新模型 Mythos:Pelican SVG 测试

Reddit r/singularity · 昨天

一条推文对比了 GPT-6 Astra 和 Anthropic 新模型 Mythos 在 Pelican SVG 测试中的表现,并附有外部来源链接。

0 人收藏 0 人点赞
#benchmark

@kentcdodds: 这不是你通常希望看到模型发展的方向

X AI KOLs Timeline · 昨天 缓存

Cognition 在 Devin 中发布了 Grok 4.7,在 FrontierCode 1.1 Extended 任务上取得了 59.4% 的分数,展示了在后端工程方面的强大性能。

0 人收藏 0 人点赞
#benchmark

MiMo-v2.6-Pro: 智能、性能与价格分析

Hacker News Top · 昨天 缓存

基于Artificial Analysis的基准和指标对MiMo-v2.6-Pro AI模型的智能、性能与价格进行分析。

0 人收藏 0 人点赞
#benchmark

编码代理能否重现官方统计数据?元数据、重试预算与执行反馈的局限性:一项受控Eurostat基准测试

arXiv cs.LG · 昨天 缓存

本研究以编码代理重现Eurostat统计数据为基准进行评估,发现语义验证和重试预算对可靠性至关重要,远不止于执行诊断。

0 人收藏 0 人点赞
#benchmark

剖析多模态大语言模型中的免训练不确定性估计

arXiv cs.CL · 昨天 缓存

一项系统性的基准测试研究,对多模态大语言模型的免训练不确定性量化策略进行评测,将方法分为基于令牌级、语言化和语义的方法,并发现最佳策略取决于响应长度。

0 人收藏 0 人点赞
#benchmark

PII-TRACE:面向多轮LLM对话中上下文感知PII检测的基准测试

arXiv cs.CL · 昨天 缓存

介绍PII-TRACE,首个用于多轮LLM对话中上下文感知PII检测的基准,以及PII-Tracer,一个实现高实体级覆盖率的紧凑检测器。

0 人收藏 0 人点赞
#benchmark

SCoR:一种用于预测科学概念之间关系的层次框架

arXiv cs.CL · 昨天 缓存

本文介绍了SCoR,一种用于预测科学概念之间关系的层次框架,其中包含一个基准和模型,通过预测类型化关系来改进研究方向的发现。

0 人收藏 0 人点赞
#benchmark

想象力源于幻觉吗?大型语言模型中想象力与幻觉的跨分类评估

arXiv cs.CL · 昨天 缓存

论文介绍了Whiteboard,这是首个通过交叉参考幻觉来评估大型语言模型想象力的基准测试,并在79个最先进的LLMs中揭示了两者之间反直觉的负相关。

0 人收藏 0 人点赞
#benchmark

最终基准测试

Reddit r/singularity · 昨天

本文提出了一项权威基准测试,旨在评估和比较AI模型或系统,并为未来的评估确立标准。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈