标签
Omar强调了构建用于代理编码的LLM验证器和评判器的日益增长的价值,同时Mira Murati分享说Bridgewater与TinkerAPI合作,微调了一个模型用于财务分析。
本文系统比较了微调的编码器分类器(ModernBERT系列)与基于解码器的安全评判器在LLM对抗评估中的表现,发现编码器可以在不显著损失性能的情况下,提供一种成本和延迟更低的替代方案。
本文介绍了一种名为Metric Match的方法,通过选择样本子集进行人工标注,以更高效地估计LLM裁判的可靠性,将标注成本降低32.5%,并相对于随机选择实现了0.838的胜率。
本文研究了用于安全评估的LLM-as-judge适应情境信息及不同安全定义的能力,发现它们基本是刚性的,当情境与其内部先验相矛盾时无法调整。
来自 dspy 的 GEPA 优化的 LLM 判断器用于微软 MAI-Thinking-1 模型预训练流程中的数据过滤。
介绍了PReMISE,一个用于发现和审计LLM评估者策略级规则的框架,涵盖四个维度:结构充分性、可靠性、偏好匹配度和对抗鲁棒性。
Agent Judge 是一种智能体评估工具,通过处理长轨迹、对照事实源系统验证状态化动作以及适应行为变化,克服了简单 LLM 评判器在长周期智能体评估中的局限性。
本文提出了一个因果框架,用于量化LLM评审中的合理化偏见,即判决和解释受非证据性线索而非底层文本的影响。该框架提出了线索干预、锚定度量以及Proof-Before-Preference缓解协议,展示了改进的线索不变性。
本文识别了在使用文本梯度进行LLM裁判的多目标提示优化中的两种失败模式:优化过程中的梯度稀释和推理过程中的指令干扰,表明联合梯度处理会丢失特定于标准的信息。
本文介绍了 REFLECT,这是一个用于评估 LLM 评判者在深度研究代理评估中可靠性的元评估基准。实验表明,当前的 LLM 评判者仍然不可靠,在推理、工具使用和报告质量失败方面的整体准确率低于 55%。