evaluation

标签

Cards List
#evaluation

IntLawNER: 国际法中的命名实体识别数据集与基准

arXiv cs.AI ↗ · 4天前 缓存

IntLawNER 是一个新的用于国际法的命名实体识别数据集和基准,涵盖了来自法律文本的金标准标注句子,并评估了模型在少样本改进方面的性能。

0 人收藏 0 人点赞
#evaluation

相同数量,不同答案:语言模型中的数值表示不变性

arXiv cs.CL ↗ · 4天前 缓存

本文评估了语言模型中的数值表示不变性,发现评估者界面问题可以模拟推理失败,并识别了如 Mistral Small 4 中单位转换问题等模型特定错误。

0 人收藏 0 人点赞
#evaluation

训练世界模型中的物体恒存性

Hugging Face Daily Papers ↗ · 4天前 缓存

本文介绍了WROP,一个用于训练世界模型中物体恒存性的数据集,并评估了14个视频模型,发布了PWM-WROP,一个160亿参数的世界模型,在续作模型中排名靠前。

0 人收藏 0 人点赞
#evaluation

SWE-Bench Pro V2(阅读时间9分钟)

TLDR AI ↗ · 4天前 缓存

SWE-Bench Pro V2是一个更新的基准测试,用于在软件工程中评估AI代理,包含来自11个代码库的642个任务,具有改进的评估协议和污染控制。

0 人收藏 0 人点赞
#evaluation

299个真实用户意图测试Jev与生产基线的对比。结果如下。

Reddit r/AI_Agents ↗ · 4天前

文章报告了glm-4-flash和TypeSafe Jev在299个真实用户意图上的性能比较,显示glm-4-flash的准确率更高,但TypeSafe Jev的速度更快且成本更低。

0 人收藏 0 人点赞
#evaluation

LLM Ass Bench

Hacker News Top ↗ · 5天前 缓存

LLM Ass Bench 是一个用于评估大型语言模型的基准测试工具,专注于提示词。

0 人收藏 0 人点赞
#evaluation

@omarsar0: 令人印象深刻的论文,展示了工具对编码智能体结果的影响有多大。工具确实在智能体所获得的内容中扮演了重要角色……

X AI KOLs Following ↗ · 5天前 缓存

本文介绍了ReFigBench,这是一个用于评估编码智能体将科学图表重建为可编辑PowerPoint幻灯片的基准测试,表明工具对不同模型家族的性能有显著影响。

0 人收藏 0 人点赞
#evaluation

@OpenAI: 作为我们保持技术前沿努力的一部分,我们致力于支持具有深入程度的独立评估……

X AI KOLs ↗ · 5天前 缓存

OpenAI概述了四个优先领域和原则,以支持独立的第三方AI安全评估,强调前沿AI发展中的严格性、安全性和问责制。

0 人收藏 0 人点赞
#evaluation

@rohanpaul_ai: Anthropic 表示 Opus 5.5 可能会注意到当其处于评估状态时,使得纯净的评估行为更难推广到实际部署…

X AI KOLs Timeline ↗ · 5天前 缓存

Anthropic 报告称,其 Claude Opus 5.5 模型可能检测到评估场景,使得观察到的行为更难推广到实际部署。该模型提供与 Fable 5.1 相当的性能,成本降低 40%,输出速度更快。

0 人收藏 0 人点赞
#evaluation

QontoFAQ: 一个更优的信息检索基准 [R]

Reddit r/MachineLearning ↗ · 5天前

QontoFAQ 介绍了一个用于信息检索的新基准和指标,专注于提升回答产品问题的相关性度量,并发布了相关的代码和数据集。

0 人收藏 0 人点赞
#evaluation

Show HN: JevBench,一个用于类型化决策模型的可复现基准测试

Hacker News Top ↗ · 5天前 缓存

JevBench v1.3.0 是一个用于Jev类决策模型的可复现基准测试,基于智能性、校准度、速度和成本对52个系统进行评估和排名。

0 人收藏 0 人点赞
#evaluation

多重潜在排序更好预测语言模型偏好

arXiv cs.LG ↗ · 5天前 缓存

本文提出语言模型中的非传递偏好源于多重潜在排序,并引入混合Bradley–Terry模型进行分析,在各种模型和任务上显示出更强的解释力。

0 人收藏 0 人点赞
#evaluation

评估生成式AI系统中对话交互的个人信息输出

arXiv cs.CL ↗ · 5天前 缓存

这项探索性试点研究评估了生成式AI系统中对话交互的个人信息输出,发现模型设计差异影响有限,并表明推断的个人资料是基于上下文信息构建的。

0 人收藏 0 人点赞
#evaluation

想象力源于幻觉吗?大型语言模型中想象力与幻觉的跨分类评估

arXiv cs.CL ↗ · 5天前 缓存

论文介绍了Whiteboard,这是首个通过交叉参考幻觉来评估大型语言模型想象力的基准测试,并在79个最先进的LLMs中揭示了两者之间反直觉的负相关。

0 人收藏 0 人点赞
#evaluation

RoboFollow:揭示具身代理中的指令跟随幻觉

Hugging Face Daily Papers ↗ · 5天前 缓存

RoboFollow 引入了一个诊断基准,通过分析高场景熵和扰动来揭示具身代理中的指令跟随幻觉,暴露了当前模型在强大初始性能背后的差距。

0 人收藏 0 人点赞
#evaluation

Kev (GitHub 仓库)

TLDR AI ↗ · 5天前 缓存

Kev 是一个基于 Qwen3.5 构建的小型决策模型系列,提供预训练权重和训练代码,适用于是/否、多选和评分问题。它包含一个网络试玩环境,并兼容 TypeSafe 的 System One API。

0 人收藏 0 人点赞
#evaluation

@0xluffy:刚做了一个关于capy与市面上一些大型框架的评估,capy表现更好,成本减半,时间减半

X AI KOLs Timeline ↗ · 6天前 缓存

一位用户将capy与其他AI框架进行比较,报告称其在成本和时间都减半的情况下表现更优,同时Garry Tan推荐它作为代理编码的顶级工具。

0 人收藏 0 人点赞
#evaluation

Grok 4.7 基准测试

Reddit r/singularity ↗ · 6天前

本文可能讨论了 Grok 4.7 AI 模型的基准测试结果,比较了其在不同任务上的性能。

0 人收藏 0 人点赞
#evaluation

Kev:基于 Qwen3.5 的小型 Jev 风格决策模型家族

Hacker News Top ↗ · 6天前 缓存

Kev 是基于 Qwen3.5 构建的小型决策模型家族,提供开源训练代码和预训练权重,支持本地部署,并兼容多种问题类型。

0 人收藏 0 人点赞
#evaluation

OpenMAS-GCom:图增强多智能体系统的诊断基准

arXiv cs.LG ↗ · 6天前 缓存

OpenMAS-GCom 通过使用受控干预措施,引入了一个用于评估图增强多智能体系统的诊断基准,将性能差异归因于特定的组织组件。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈