标签
介绍对比错误跨度标注(cESA),这是一种同时对多个翻译进行人工评估的协议,与标准方法相比,减少了标注时间和噪声。
本文介绍了 Similarweb 如何使用 LangSmith 评估长篇代理研究报告,结合工具调用的确定性检查和 LLM 作为评委的质量评分,重点关注使回归可检查并实现 A/B 比较。
本文证明了在滑动窗口序列上使用简单的训练/测试分割会严重夸大或缩小预测性维护中多任务学习的性能指标,并提出了一种泄漏鲁棒的评估协议。
本文识别了最佳N选择TTS评估中的一个混淆因素:ASR验证器的表面质量强烈依赖于用作评估器的ASR族。作者提出了跨族排名集成方法,在多个评估器上实现了更低的词错误率。
本文研究了在 RAG 系统中用于包裹上下文的话语角色标签(例如"Reference:"、"Instruction:"、"Example:")如何显著影响语言模型采纳误导性信息的程度。研究在 GPT-4.5、DeepSeek V3 Pro、Llama-3-8B-Instruct 和 Qwen2.5-7B-Instruct 上观察到了 56 至 84 个百分点的变化幅度。作者认为,包裹标签应被视为呈现阶段的变量,并应在上下文利用基准测试中加以报告和控制。
本文将对配对二元样本量计算的方法应用于4位量化基准,提供了一个保守的最小可检测效应(MDE)界,帮助基准设计者在运行实验前确定可靠性。一项试点审计表明,在小子样本中观察到的许多方差是二项抽样噪声,而非真正的模型不可靠性。
OpenAI分享了关于设计值得信赖的前沿模型第三方评估的经验教训和推荐方法,强调了评估框架和有效性检查的关键作用。
本文提出了一种两阶段抽样设计,其中LLM评估用于增强而非替代人工评分,并利用缺失数据文献中的双重稳健估计量,提供了确定人工和LLM评审样本量的指导。
本文指出,在数据稀疏和难度异构的情况下,AI基准测试中的简单平均法会失效,并提出项目反应理论(IRT)作为一种稳健的替代方案,以恢复真实的排名情况。
来自 PwC 的一篇新论文挑战了智能体澄清中“越早越好”的直觉。研究通过一个强制注入框架表明,目标澄清的价值会迅速流失,而输入澄清则在更长的时间内保持有用。该研究提供了关于智能体何时应提问的定量需求曲线,揭示了当前前沿模型经常在错误的时机进行澄清。
Anthropic 揭示,基础设施配置和资源管控对 Terminal-Bench 2.0 等智能体编程基准测试的分数有显著影响,其影响幅度常常超过顶尖模型之间的差距。