evaluation-methodology

标签

Cards List
#evaluation-methodology

对比ESA:同时对多个翻译进行人工评估

arXiv cs.CL · 3天前 缓存

介绍对比错误跨度标注(cESA),这是一种同时对多个翻译进行人工评估的协议,与标准方法相比,减少了标注时间和噪声。

0 人收藏 0 人点赞
#evaluation-methodology

@LangChain:@Similarweb 如何在没有唯一正确答案的情况下评估深度研究代理:工具调用的确定性检查……

X AI KOLs Timeline · 3天前 缓存

本文介绍了 Similarweb 如何使用 LangSmith 评估长篇代理研究报告,结合工具调用的确定性检查和 LLM 作为评委的质量评分,重点关注使回归可检查并实现 A/B 比较。

0 人收藏 0 人点赞
#evaluation-methodology

针对联合故障诊断与剩余使用寿命估计的注意力增强多任务学习的泄漏鲁棒评估与数据规模敏感性

arXiv cs.LG · 2026-07-21 缓存

本文证明了在滑动窗口序列上使用简单的训练/测试分割会严重夸大或缩小预测性维护中多任务学习的性能指标,并提出了一种泄漏鲁棒的评估协议。

0 人收藏 0 人点赞
#evaluation-methodology

最佳-$N$ TTS评估受到ASR族对齐的混淆

arXiv cs.CL · 2026-07-10 缓存

本文识别了最佳N选择TTS评估中的一个混淆因素:ASR验证器的表面质量强烈依赖于用作评估器的ASR族。作者提出了跨族排名集成方法,在多个评估器上实现了更低的词错误率。

0 人收藏 0 人点赞
#evaluation-methodology

话语角色标签作为语言模型上下文使用的呈现时间变量

arXiv cs.CL · 2026-06-04 缓存

本文研究了在 RAG 系统中用于包裹上下文的话语角色标签(例如"Reference:"、"Instruction:"、"Example:")如何显著影响语言模型采纳误导性信息的程度。研究在 GPT-4.5、DeepSeek V3 Pro、Llama-3-8B-Instruct 和 Qwen2.5-7B-Instruct 上观察到了 56 至 84 个百分点的变化幅度。作者认为,包裹标签应被视为呈现阶段的变量,并应在上下文利用基准测试中加以报告和控制。

0 人收藏 0 人点赞
#evaluation-methodology

预先注册可检测效应:面向4位量化基准的配对MDE预算及试点审计

arXiv cs.LG · 2026-05-29 缓存

本文将对配对二元样本量计算的方法应用于4位量化基准,提供了一个保守的最小可检测效应(MDE)界,帮助基准设计者在运行实验前确定可靠性。一项试点审计表明,在小子样本中观察到的许多方差是二项抽样噪声,而非真正的模型不可靠性。

0 人收藏 0 人点赞
#evaluation-methodology

值得信赖的第三方评估共享手册

OpenAI Blog · 2026-05-29 缓存

OpenAI分享了关于设计值得信赖的前沿模型第三方评估的经验教训和推荐方法,强调了评估框架和有效性检查的关键作用。

0 人收藏 0 人点赞
#evaluation-methodology

用LLM评审员增强人工评估:你需要多少人工审核?

arXiv cs.LG · 2026-05-19 缓存

本文提出了一种两阶段抽样设计,其中LLM评估用于增强而非替代人工评分,并利用缺失数据文献中的双重稳健估计量,提供了确定人工和LLM评审样本量的指导。

0 人收藏 0 人点赞
#evaluation-methodology

评估失效的缩放定律:为何简单平均在数据稀疏和题目难度差距下会崩溃,以及项目反应理论如何跨领域恢复真实情况

arXiv cs.LG · 2026-05-13 缓存

本文指出,在数据稀疏和难度异构的情况下,AI基准测试中的简单平均法会失效,并提出项目反应理论(IRT)作为一种稳健的替代方案,以恢复真实的排名情况。

0 人收藏 0 人点赞
#evaluation-methodology

@dair_ai: PwC 的一篇精彩论文。在智能体澄清方面,“越早越好”一直是默认直觉。新论文声称这……

X AI KOLs Following · 2026-05-11 缓存

来自 PwC 的一篇新论文挑战了智能体澄清中“越早越好”的直觉。研究通过一个强制注入框架表明,目标澄清的价值会迅速流失,而输入澄清则在更长的时间内保持有用。该研究提供了关于智能体何时应提问的定量需求曲线,揭示了当前前沿模型经常在错误的时机进行澄清。

0 人收藏 0 人点赞
#evaluation-methodology

量化智能体编程评估中的基础设施噪声

Anthropic Engineering · 2026-05-08 缓存

Anthropic 揭示,基础设施配置和资源管控对 Terminal-Bench 2.0 等智能体编程基准测试的分数有显著影响,其影响幅度常常超过顶尖模型之间的差距。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈