标签
本文提出一个诊断框架,用于评估LLM-judge能否在无参考验证器的情况下有效评估优化任务中的候选技能,重点在于能力和可区分性指标。
本文介绍了一种固定契约诊断工具,用于分析KV缓存压缩方法在长上下文LLM推理中成功或失败的原因。文章确定了三种故障模式——遗漏证据、对无关token进行评分以及破坏相关证据——并在LongBench和NeedleBench上对这些模式进行了评估。