标签
本文提出了一种针对工业环境中文本分类器的匹配记录评估方法,证明了记录选择对维护、安全和召回系统性能指标的显著影响。
GAVEL 是一种用于评估从病例报告中提取的临床时间线的 LLM-法官协议,允许进行比较和修订而不将任一时间线视为真实标准。它减少了差异并提高了时间信息提取的准确性。
本文提出TEAM-Design,一种预算规则,用于分配重放任务以评估人机工作流相对于纯人类或纯智能体替代方案的有效性,应用于临床和编码环境。
文章批评人工智能排行榜因隐藏评估工具的影响而简化了代理评估,以Questflow的智能财务基准为例,并强调代理基准中需要全面报告。
本文引入多样性曲线作为评估AI生成内容多样性的曲线值方法,通过提供更透明且分辨率感知的框架,解决模糊标量指标的局限性。
本文引入了“结晶化问题”,用于评估文本到SQL系统中的可复用记忆,表明将经过验证的修正查询存储在每个数据库的库中,可以将BIRD上留出集的首次尝试准确率提高4.34个百分点,捕获按需修复所提供的44.4%的提升空间。受控干预措施识别出数据库特定内容是主要驱动因素。
介绍对比错误跨度标注(cESA),这是一种同时对多个翻译进行人工评估的协议,与标准方法相比,减少了标注时间和噪声。
本文介绍了 Similarweb 如何使用 LangSmith 评估长篇代理研究报告,结合工具调用的确定性检查和 LLM 作为评委的质量评分,重点关注使回归可检查并实现 A/B 比较。
本文证明了在滑动窗口序列上使用简单的训练/测试分割会严重夸大或缩小预测性维护中多任务学习的性能指标,并提出了一种泄漏鲁棒的评估协议。
本文识别了最佳N选择TTS评估中的一个混淆因素:ASR验证器的表面质量强烈依赖于用作评估器的ASR族。作者提出了跨族排名集成方法,在多个评估器上实现了更低的词错误率。
本文研究了在 RAG 系统中用于包裹上下文的话语角色标签(例如"Reference:"、"Instruction:"、"Example:")如何显著影响语言模型采纳误导性信息的程度。研究在 GPT-4.5、DeepSeek V3 Pro、Llama-3-8B-Instruct 和 Qwen2.5-7B-Instruct 上观察到了 56 至 84 个百分点的变化幅度。作者认为,包裹标签应被视为呈现阶段的变量,并应在上下文利用基准测试中加以报告和控制。
本文将对配对二元样本量计算的方法应用于4位量化基准,提供了一个保守的最小可检测效应(MDE)界,帮助基准设计者在运行实验前确定可靠性。一项试点审计表明,在小子样本中观察到的许多方差是二项抽样噪声,而非真正的模型不可靠性。
OpenAI分享了关于设计值得信赖的前沿模型第三方评估的经验教训和推荐方法,强调了评估框架和有效性检查的关键作用。
本文提出了一种两阶段抽样设计,其中LLM评估用于增强而非替代人工评分,并利用缺失数据文献中的双重稳健估计量,提供了确定人工和LLM评审样本量的指导。
本文指出,在数据稀疏和难度异构的情况下,AI基准测试中的简单平均法会失效,并提出项目反应理论(IRT)作为一种稳健的替代方案,以恢复真实的排名情况。
来自 PwC 的一篇新论文挑战了智能体澄清中“越早越好”的直觉。研究通过一个强制注入框架表明,目标澄清的价值会迅速流失,而输入澄清则在更长的时间内保持有用。该研究提供了关于智能体何时应提问的定量需求曲线,揭示了当前前沿模型经常在错误的时机进行澄清。
Anthropic 揭示,基础设施配置和资源管控对 Terminal-Bench 2.0 等智能体编程基准测试的分数有显著影响,其影响幅度常常超过顶尖模型之间的差距。