标签
本文探讨了基于LLM评分的基准测试的测量限制,指出其泛化能力受到评判者差异的影响,且协议设计对性能上限有显著影响,从而对AI基准测试方法具有借鉴意义。
本文量化了事实核查得分的提升如何在答案准确性和证据质量之间进行分配,使用了训练后的DeBERTa检查点和LLM在多个基准测试中。
本文介绍了一个用于在法律文件中分类解释准则的句子层面基准,评估了 LLMs 在 German Federal Constitutional Court 数据集上的表现。
本文介绍了一种生成基准,用于评测大型语言模型在Hindi、Tamil和Korean文化特异性亲属称谓上的表现,揭示了识别与生成能力间的显著差距。
本文提出 GittinsEval,这是一个成本感知的贝叶斯老虎机框架,用于高效的 LLM 评估,通过自适应选择配置,在显著降低成本的同时保持高性能。
MAWILE是一个开发者工作台,用于审计LLM评判者对提示词、评分标准、输入和输出扰动的敏感性,以确保评估的鲁棒性和有意义性。
本文研究了托管LLM行为评估中的复制、测量敏感性和持久性,通过Regent Chess环境展示了不同配置和标识符下结论的变化。
本文讨论了如何针对特定生产用例对LLM进行基准测试,提出了一套全面的评估流程,包括任务特定指标、质量与成本的权衡,以及失败案例分析。
本文提出了一种针对LLM生成的合同条款的风险敏感评估框架,重点关注法律失效模式和质量维度,以评估超出准确性或流畅性的风险。
LangSmith 现已集成 Jev,一个 System One 模型,用于快速且经济的代理跟踪在线评估,实现更广泛的评分和安全检查,无需高昂成本。
ChatGPT共同发明人推出了一款专注于决策的新AI,速度提升20-200倍,已在Doom、Minecraft和浏览器代理等场景中应用。
本文介绍了一个数据集和基准测试,用于评估大型语言模型对中文竞争性辩论的理解,包括148场比赛,由专业评审,并涉及比赛、阶段和发言者层面的任务。
本文首次对大规模语言模型在印地语和马拉地语的OCR后校正进行系统性评估,比较上下文学习的检索策略,并展示CharBM25的有效性。
本文介绍了Omni Demand Understanding (ODU),一个评估多模态AI模型如何从复杂音视频交互中推断用户需求的基准测试,揭示了当前模型中显著的性能差距。
本文介绍了DischargeBench,一个基于角色的模拟,用于评估LLMs作为出院教育者,通过与虚拟患者的多轮对话来衡量患者理解。
专用评估模型 JEV 在面试纪要处理中展示了高效率和低成本的潜力,强调了将大语言模型用作逻辑判定层而非内容生成器的优势。
GitHub分享了用于将语言模型系统从原型移至生产的评估实践,解决现实世界的挑战和指标,如精确率和召回率。
本文对资源中断下修订旅行行程的方法进行了统一的实证评估,比较了完全重新规划、计划修复和基于大语言模型的修订方法,评估维度包括有效性、计划稳定性和计算成本。