标签
HumanTracker 引入了一个大规模基准和一个称为 HumanScore 的偏好对齐指标,用于评估类人机器人运动追踪,重点关注感知质量和物理接触稳定性,以更好地预测人类偏好并识别传统运动学指标遗漏的失败情况。
本文提出了一种新颖的基于配对受者的评估框架,用于评估已故供者肾移植中的生存预测模型,报告了约60%的准确率,并指出了C-index指标的局限性。
本文介绍了归一化上下文利用(NCU)指标,用于量化RAG系统中上下文信息的增益。该指标挑战了规模定律,表明在严格的事实提取中,小语言模型由于较低的“先验主导性”可以与更大模型匹敌甚至更优,并且一个商业API在对抗性设置中经常覆盖外部证据。
一篇研究论文,提出了一种新的评估指标和重音感知系统,用于在英中语音到语音翻译中评估和保留词汇重音,实验表明在保持翻译质量的同时,其重音翻译能力显著优于现有方法。
GENIE 是一种细粒度评估指标,用于衡量大语言模型在特定任务特征上的响应新颖性,相比整体性指标能提供更多洞察。
本文介绍了MADQI,一种在无需标注数据的情况下评估海上AIS数据中无监督异常检测的复合指标。该框架结合了四个指标,在测试数据集上取得了80.37%的MADQI分数。
本文识别了Reflexion风格代理中的记忆虚构现象,即代理存储了错误的任务解释,并在环境重置后持续坚持错误。作者引入了反射重复率(RRR)指标来检测该现象,并提出了一种缓解方法,用程序化失败信号提取替代开放式自我诊断。
Granuscore是一种用于文本分析和问答的无参考粒度度量。它利用分层嵌入空间来捕捉细粒度与粗粒度语言,并在QA基准测试中展示了模型行为的一致差异。
论文提出了遗忘深度评分(UDS),这是一种利用激活修补来量化目标知识从大语言模型中被彻底擦除程度的指标,在多种遗忘方法上实现了最先进的忠实度和鲁棒性。
本文介绍了 QuIDE 框架,该框架利用智能指数来评估量化神经网络在压缩、准确性和延迟之间的权衡。研究证明,最佳位宽因任务而异:对于大型语言模型(LLM)和简单任务,4-bit 是最理想的;而对于复杂的卷积神经网络(CNN),8-bit 则更为合适。
ROSE是一个新颖的面向意图的NL2SQL评估指标,采用Prover-Refuter级联框架来评估语义正确性,无需依赖真实SQL,与人类专家的一致性比现有指标高24%。该论文解决了执行准确度的局限性,并对19个NL2SQL方法进行了重新评估,并公开发布了相关资源。