@zihengh1: LLM-as-a-judge 现在在自动评估中无处不在。但它可能缓慢、昂贵且不透明。如果我们问...

X AI KOLs Timeline 论文

摘要

介绍 PAJAMA,一种混合评估系统,通过提取评分标准并以编程方式执行,改进了 LLM-as-a-judge 方法,推动了速度、成本和透明度的帕累托前沿。

LLM-as-a-judge 现在在自动评估中无处不在。但它可能缓慢、昂贵且不透明。如果我们向法官索取一次评分标准,然后以程序的形式执行该逻辑呢?介绍 PAJAMA——一种新的混合评估系统,推动了 LLM-judge 的帕累托前沿!🚀 https://t.co/wz8j8JaZ0m
查看原文
查看缓存全文

缓存时间: 2026/07/03 02:28

LLM作为裁判现在无处不在,用于自动化评估。但它可能速度慢、成本高且不透明。如果我们让裁判一次性提供它的评分标准,然后将该逻辑作为程序执行会怎样?隆重介绍 PAJAMA——一种全新的混合评估系统,将LLM裁判的帕累托边界推向新高度!🚀 https://t.co/wz8j8JaZ0m

相似文章

法官代码化:通过程序蒸馏实现可扩展评估

arXiv cs.AI

本文介绍了PAJAMA,这是一个将大语言模型作为评判者的决策逻辑蒸馏到程序化评判者中的系统,消除了每次样本的API成本,同时匹配了13B大语言模型评判者的性能,并为可扩展评估提供了透明度和效率改进。

JudgeArena:可复现的LLM裁判评估统一框架

arXiv cs.CL

JudgeArena是一个开源框架,将主要的LLM裁判基准统一在单一接口下,支持对裁判选择的系统研究,并提供与闭源模型相当或更优的开源模型裁判,同时能够模拟LMArena Elo分数。

面向LLM-as-a-Judge的动态评估准则生成与优化

arXiv cs.CL

本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。