benchmark

标签

Cards List
#benchmark

M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准

arXiv cs.CL · 昨天 缓存

本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。

0 人收藏 0 人点赞
#benchmark

DREAM:基于事件感知记忆图的大语言模型动态角色扮演

arXiv cs.CL · 昨天 缓存

本文介绍了DREAM,一种用于基于大语言模型角色扮演智能体的结构化记忆框架,利用事件感知记忆图来维持时间与因果连贯性,并提出了TCM基准用于评估。

0 人收藏 0 人点赞
#benchmark

LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理

arXiv cs.CL · 昨天 缓存

本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。

0 人收藏 0 人点赞
#benchmark

PoolBench:仅解码器LLM概念表示评估中的池化策略基准

arXiv cs.CL · 昨天 缓存

介绍PoolBench,一个在仅解码器LLM概念表示中隔离池化策略的基准,跨17个概念和3个模型评估19种策略,为比较池化选择提供标准化协议。

0 人收藏 0 人点赞
#benchmark

MS-MLB:基于血液的MS分类的开放机器学习基准

arXiv cs.LG · 昨天 缓存

本文介绍了MS-MLB,这是一个开放机器学习基准,利用公开的GSE17048队列,从全血RNA表达数据中对多发性硬化症进行分类。它提供了一个可重复、受泄漏控制的评估流程,并报告梯度提升(Gradient Boosting)为表现最佳的方法。

0 人收藏 0 人点赞
#benchmark

统一智能体:跨设备交互管理

arXiv cs.AI · 昨天 缓存

本文介绍了统一智能体(Unified Agent),一种有状态的AI智能体,能够在设备和时间上维护紧凑的交互状态,以处理跨设备、跨时间的用户请求,在新基准测试中优于现有智能体设计。

0 人收藏 0 人点赞
#benchmark

SkillTV-Bench:评估裁判在技能增强型智能体执行中的表现基准

arXiv cs.AI · 昨天 缓存

介绍SkillTV-Bench,一个包含681个案例的基准,用于评估LLM智能体中技能感知的轨迹验证,以及SkillTV-Evolve,一种将验证知识外部化为可复用JudgeSkill的方法,将裁判准确率提升14.8个百分点。

0 人收藏 0 人点赞
#benchmark

EcoAgent-Bench:评估预算受限的LLM代理中的经济决策

arXiv cs.AI · 昨天 缓存

本文介绍了EcoAgent-Bench,一个包含304个任务的基准测试,用于评估LLM代理在明确预算和定价操作下的经济决策,测试五个任务族中的四种与成本相关的决策。

0 人收藏 0 人点赞
#benchmark

C$^3$PO: 评估全模态模型中的跨模态组合与反事实表现

arXiv cs.AI · 昨天 缓存

介绍了C$^3$PO,一个包含3,404个样本的基准测试,用于评估多模态LLM中的跨模态组合与反事实推理。研究发现模态主导性导致了大多数失败,即使最佳模型(Gemini-3.1-Pro)也远低于人类准确率。

0 人收藏 0 人点赞
#benchmark

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs

arXiv cs.AI · 昨天 缓存

This paper introduces LUNAR, a benchmark for evaluating how large language models personalize responses from longitudinal app interaction histories across daily-life domains such as clothing, food, housing, and mobility. Experiments on 19 mainstream LLMs reveal that effective personalization depends on evidence selection and cross-domain integration, and that stronger personalization can come at the cost of privacy protection.

0 人收藏 0 人点赞
#benchmark

SearchAuditor:长时程搜索智能体故障的审计与归因

arXiv cs.AI · 昨天 缓存

本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。

0 人收藏 0 人点赞
#benchmark

@tobi:让我们都同意这是AGI的正确且最终的评估 https://jackhopkins.github.io/factorio-learning-environ…

X AI KOLs Timeline · 2天前 缓存

Factorio Learning Environment v0.3.0 是一个开源平台,用于在 Factorio 中评估 AI 智能体,增加了无头扩展、OpenAI Gym 兼容性以及用于实时演示的 Claude Code 集成。

0 人收藏 0 人点赞
#benchmark

Qwen3.8 Max 在智能体指数中被评为最佳整体模型

Hacker News Top · 2天前 缓存

Qwen3.8 Max 目前在 Artificial Analysis 的智能体指数中排名第一,在独立评估中超越了其他领先的AI模型。

0 人收藏 0 人点赞
#benchmark

我测量了13个搜索API在智能体内运行的实际成本。定价页只是账单中较小的一半

Reddit r/AI_Agents · 2天前

一位开发者在AI智能体内对13种搜索API配置进行了基准测试,发现读取负载的隐藏token成本可能占据总账单的大部分,而且不同提供商之间的差异高达67倍。

0 人收藏 0 人点赞
#benchmark

2 x 5070ti Qwen 27B 完整配置/统计

Reddit r/LocalLLaMA · 2天前

技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。

0 人收藏 0 人点赞
#benchmark

我用不同类型,比较了更多解析器在14项PDF解析能力上的表现

Reddit r/LocalLLaMA · 2天前

一项基准测试比较了8款PDF解析器在14项能力上的表现,发现Chandra最准确,同时也指出了速度等方面的权衡;LightOnOCR-1B以小体积令人印象深刻,但在无法辨认的文本上会产生幻觉。

0 人收藏 0 人点赞
#benchmark

32个本地模型正面交锋

Reddit r/LocalLLaMA · 2天前

一项对32个本地语言模型在事实提取语料库上的正面交锋评估发现,大多数模型在统计上难以区分,而LFM2.5模型尽管规模更大,表现却显著更差。

0 人收藏 0 人点赞
#benchmark

为什么 artificialanalysis.ai 在 SciCode 上将 Gemma4 排在 Qwen3.6 27b 之上

Reddit r/LocalLLaMA · 2天前

关于 Artificial Analysis 如何在 SciCode 基准测试中将 Gemma 4 排在 Qwen3.6 27b 之上的讨论,质疑该排名是否反映现实世界的编码能力,还是揭示了基准测试的问题。

0 人收藏 0 人点赞
#benchmark

Auto-fit vs tuned MoE offload: 564 → 1330 pp tok/s, unchanged decode (Qwen3.6-35B-A3B Q6 / RTX 3090)

Reddit r/LocalLLaMA · 2天前

A developer benchmarks Qwen3.6-35B-A3B Q6 on an RTX 3090, showing that offloading eight MoE expert layers to CPU and increasing batch sizes improves prompt processing by 2.36× (564→1330 tok/s) with no decode speed regression, using evolutionary search to find the tuning config.

0 人收藏 0 人点赞
#benchmark

IslamicTurathBench:评估大语言模型在伊斯兰学术传统(turath)上的多任务、多学科基准

arXiv cs.CL · 2天前 缓存

IslamicTurathBench(ISTB)是一个新的多任务、多学科基准,用于评估大语言模型在古典伊斯兰学术上的表现,包含 3,465 道专家审核的题目,涵盖 35 部著作和七个领域。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈