@zihengh1: LLM-as-a-judge 现在在自动评估中无处不在。但它可能缓慢、昂贵且不透明。如果我们问...
摘要
介绍 PAJAMA,一种混合评估系统,通过提取评分标准并以编程方式执行,改进了 LLM-as-a-judge 方法,推动了速度、成本和透明度的帕累托前沿。
LLM-as-a-judge 现在在自动评估中无处不在。但它可能缓慢、昂贵且不透明。如果我们向法官索取一次评分标准,然后以程序的形式执行该逻辑呢?介绍 PAJAMA——一种新的混合评估系统,推动了 LLM-judge 的帕累托前沿!🚀 https://t.co/wz8j8JaZ0m
查看缓存全文
缓存时间: 2026/07/03 02:28
LLM作为裁判现在无处不在,用于自动化评估。但它可能速度慢、成本高且不透明。如果我们让裁判一次性提供它的评分标准,然后将该逻辑作为程序执行会怎样?隆重介绍 PAJAMA——一种全新的混合评估系统,将LLM裁判的帕累托边界推向新高度!🚀 https://t.co/wz8j8JaZ0m
相似文章
法官代码化:通过程序蒸馏实现可扩展评估
本文介绍了PAJAMA,这是一个将大语言模型作为评判者的决策逻辑蒸馏到程序化评判者中的系统,消除了每次样本的API成本,同时匹配了13B大语言模型评判者的性能,并为可扩展评估提供了透明度和效率改进。
@ArizePhoenix:谁来评判评估者?当你使用LLM作为评判者时,你正在信任一个模型来决定你的代理、工作流……
本文讨论了使用Arize Phoenix调试和评估LLM评判者所面临的挑战,Arize Phoenix通过OpenTelemetry追踪评估者运行过程,以检查决策逻辑、成本和潜在偏差。
JudgeArena:可复现的LLM裁判评估统一框架
JudgeArena是一个开源框架,将主要的LLM裁判基准统一在单一接口下,支持对裁判选择的系统研究,并提供与闭源模型相当或更优的开源模型裁判,同时能够模拟LMArena Elo分数。
@dair_ai: // 你的LLM评判与专家意见相左 // 构建LLM评判者可能颇具挑战性。这里展示了一个有趣的案例,说明为何…
本文介绍了UPHELD,这是一个带有大量人工标注的基准,用于评估对话型LLM,以及Mixture-of-Judges框架,可将评估准确性提高30%。
面向LLM-as-a-Judge的动态评估准则生成与优化
本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。