benchmark

标签

Cards List
#benchmark

RECLAIM:智能体能否复现机器学习论文的主张?

arXiv cs.AI ↗ · 3天前 缓存

RECLAIM 是一个针对人工智能智能体的基准测试,用于复现机器学习论文中的主张,其难度层级基于可用的代码、数据和权重。研究表明智能体在复现结果时面临困难,在最简单的层级中,最佳成功率为41%。

0 人收藏 0 人点赞
#benchmark

TWIST:一个用于对话记忆干预质量的人工验证草稿对齐提议基准

arXiv cs.AI ↗ · 3天前 缓存

TWIST 是一个用于评估对话记忆系统中干预质量的提议基准套件,具有人工验证的轨道,用于检测未解决的张力和过时事实等故障,揭示了传统指标忽略的召回率与特异性之间的权衡。

0 人收藏 0 人点赞
#benchmark

EnSiTa - 一个面向特定领域机器翻译的三语多领域平行数据集与基准

arXiv cs.CL ↗ · 3天前 缓存

EnSiTa 是一个支持英语、僧伽罗语和泰米尔语的三语多领域平行数据集和基准,包含人工后编辑的训练数据,并进行了大量领域特定机器翻译的实验,以应对低资源语言的挑战。

0 人收藏 0 人点赞
#benchmark

BanglaTurn: 一个用于 Bangla 语音回合结束检测的基准与 Whisper 基础模型

arXiv cs.CL ↗ · 3天前 缓存

论文介绍了 BanglaTurn,这是一个用于 Bangla 语音回合结束检测的基准语料库和基于 Whisper 的模型,实现了 84.33% 的准确率,而基线为 69.28%。

0 人收藏 0 人点赞
#benchmark

COILD:一个以印度语言为中心的平行语料库与跨语言机器翻译基准

arXiv cs.CL ↗ · 3天前 缓存

本文介绍了COILD,这是一个以印度语言为中心的平行语料库,包含超过116万对句子,覆盖20对印度语言,并提供了一个以领域为中心的基准。研究结果表明,在微调多语言模型时,机器翻译性能得到了显著提升。

0 人收藏 0 人点赞
#benchmark

一个财务基准测试要求智能体完成整个任务(阅读时长18分钟)

TLDR AI ↗ · 3天前 缓存

由Surge AI推出的名为DAYJOB的财务基准测试评估AI代理在完成财务预测任务时的表现,其详细的通过/失败标准重点关注净销售额计算和收入增长预测中的错误。

0 人收藏 0 人点赞
#benchmark

Dailychained PLX 88096 交换机,四路 RTX 5070 Ti + 四路 RTX 5060 Ti

Reddit r/LocalLLaMA ↗ · 3天前

一位用户分享了使用 RTX 5070 Ti 和 5060 Ti 构建多 GPU 系统的经验,该系统用于在 Linux 上通过 vLLM 运行 Qwen3.8-27B-FP8 等 AI 模型,详细介绍了硬件设置、基准测试和挑战。

0 人收藏 0 人点赞
#benchmark

@svpino:在将音频发送到语音转文本模型之前降低噪声会带来巨大改进。语音隔离是…

X AI KOLs Timeline ↗ · 3天前 缓存

Krisp发布了一个开放基准和数据集,显示语音隔离将语音转文本模型的单词错误率降低了73%,在工作场所和呼叫中心录音中都有显著改进。

0 人收藏 0 人点赞
#benchmark

Claude Opus 5.5 在 SimpleBench 上以 88.4% 的分数拔得头筹。

Reddit r/singularity ↗ · 3天前

Claude Opus 5.5 在 SimpleBench 基准测试中取得了 88.4% 的最高分,表明其在 AI 评估中具有卓越性能。

0 人收藏 0 人点赞
#benchmark

@_philschmid: Gemini 3.8 Flash. 直接使用Gemini进行多模态理解。

X AI KOLs Following ↗ · 3天前 缓存

一条推文建议使用Gemini 3.8 Flash进行多模态理解,并引用了一个视觉测试,该测试比较了AI模型从绘画中识别人物的能力。

0 人收藏 0 人点赞
#benchmark

教训:不要盲目相信仓库,确保长时间运行(多周)的基准测试稳定可靠。

Reddit r/LocalLLaMA ↗ · 3天前

作者分享了长时间运行的Django基准测试中学到的教训,强调了在评估工作流程稳定性方面的修复,以及更新后的结果,显示Flash Next是表现最佳的模型,现在推理努力级别得到了正确评估。

0 人收藏 0 人点赞
#benchmark

Fable 5.1 和 Astra 在 Mensa Norway 测试中均获满分

Reddit r/singularity ↗ · 3天前

Fable 5.1 和 Astra 这两款AI模型在 Mensa Norway 智力测试中均获得满分,展现了其卓越的推理能力。

0 人收藏 0 人点赞
#benchmark

Forecast Workflow Bench:使用预算预测工具评估语言模型决策

arXiv cs.LG ↗ · 4天前 缓存

FWBench 引入了一个基准,用于评估语言模型如何选择和使用时间序列预测来做出成本约束决策,并在电力和共享单车租赁数据集上比较托管与本地配置,同时由 GPT-6 Astra 实现高效的预算使用。

0 人收藏 0 人点赞
#benchmark

基于机器学习的聚合物性能预测开放基准

arXiv cs.LG ↗ · 4天前 缓存

论文介绍了Polymer Benchmark 2026,这是一个开放数据集,旨在对聚合物性能预测中的机器学习方法进行基准测试,涵盖多种架构和性能。

0 人收藏 0 人点赞
#benchmark

人工智能系统中的可达全局优化:全局性如何界定?

arXiv cs.AI ↗ · 4天前 缓存

本文介绍Reachability-Induced Optimization (RIO),主张人工智能系统中的全局优化声明应基于实际可达区域,并提供理论结果和基准数据以支持此框架。

0 人收藏 0 人点赞
#benchmark

通过过滤技术提升基于大语言模型的自主网络智能体性能

arXiv cs.CL ↗ · 4天前 缓存

本文提出了一种检索策略,用于过滤大语言模型驱动的自主网络智能体中的无关HTML内容,从而提升其在WebArena等基准测试上的表现。

0 人收藏 0 人点赞
#benchmark

并非所想:大型语言模型能否遵循指定的否定语义?

arXiv cs.AI ↗ · 4天前 缓存

本文介绍了NAF-Bench,用于研究大型语言模型对指定否定语义的遵守情况。研究发现,像o4-mini这样的前沿模型表现良好,而开源模型则滞后。建议通过求解器委托或微调来改进。

0 人收藏 0 人点赞
#benchmark

当上下文误导时:大型语言模型中的 Jurisdiction 上下文学习

arXiv cs.CL ↗ · 4天前 缓存

本文介绍了 FakeContext-bench,用于评估大型语言模型区分上下文信息和事实知识的能力,并提出了 Jurisdiction In-Context Learning (J-ICL) 以增强上下文学习性能和对误导性上下文的抵抗力。

0 人收藏 0 人点赞
#benchmark

MolDesignBench:评估基于场景的分子设计的LLM智能体

arXiv cs.AI ↗ · 4天前 缓存

MolDesignBench是一个新的基准测试,用于评估基于场景的分子设计中的LLM智能体,包含2000个具有隐式和显式约束的实例,揭示了当前前沿的LLMs成功率较低,尤其是在推理隐式约束和检测不可行性方面。

0 人收藏 0 人点赞
#benchmark

PRISM-VLM:一个面向紧凑型视觉语言模型的多维度鉴别性基准

arXiv cs.CL ↗ · 4天前 缓存

PRISM-VLM 是一个多维度鉴别性基准,评估紧凑型视觉语言模型在七个维度上的表现,包括任务质量和行为鲁棒性,与单维度基准相比,能提供更可靠的区分和洞察。它旨在发布一个开放流程,供社区改进AI评估方法。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈