标签
介绍了DecoEvo,一种用于文本空间中LLM优化的分数解耦协同进化方法,无需黄金评分标准即可同时提升求解器和评分器生成技能,在五个基准测试中相比基线实现了2.8%–5.0%的相对提升。
本文首次系统性地对LLM生成的用于复现研究论文实验的评分标准进行元评估。它将评分标准重新表述为检查表格式,并从内在(语义相似性)和外在(分数对齐)两方面评估生成设置,发现增强设置改善了下游评估对齐,但生成的评分标准往往过于细粒度,且偏向高分。
介绍了FinResearchBench II,这是一个用于评估深度研究智能体财务报告质量的基准,它采用可扩展的流程,通过LLM共识自动生成并筛选评分准则,从而在没有人类专家的情况下实现系统差异化。
本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。
SCOPE是一个用于开放式任务的自我对弈框架,它共同进化挑战者(Challenger)和求解器(Solver)策略,在没有外部监督的情况下,在基准测试上取得了高达+10.4分的提升。