rubric-generation

标签

Cards List
#rubric-generation

DecoEvo: 文本空间中求解器与评分器生成技能的分数解耦协同进化

Hugging Face Daily Papers · 2026-07-28 缓存

介绍了DecoEvo,一种用于文本空间中LLM优化的分数解耦协同进化方法,无需黄金评分标准即可同时提升求解器和评分器生成技能,在五个基准测试中相比基线实现了2.8%–5.0%的相对提升。

0 人收藏 0 人点赞
#rubric-generation

LLM能否生成可靠的评分标准?实验复现的元评估

arXiv cs.CL · 2026-07-15 缓存

本文首次系统性地对LLM生成的用于复现研究论文实验的评分标准进行元评估。它将评分标准重新表述为检查表格式,并从内在(语义相似性)和外在(分数对齐)两方面评估生成设置,发现增强设置改善了下游评估对齐,但生成的评分标准往往过于细粒度,且偏向高分。

0 人收藏 0 人点赞
#rubric-generation

FinResearchBench II:一项采用共识派生黄金评分准则以区分财务报告质量的深度研究基准

arXiv cs.CL · 2026-07-15 缓存

介绍了FinResearchBench II,这是一个用于评估深度研究智能体财务报告质量的基准,它采用可扩展的流程,通过LLM共识自动生成并筛选评分准则,从而在没有人类专家的情况下实现系统差异化。

0 人收藏 0 人点赞
#rubric-generation

面向LLM-as-a-Judge的动态评估准则生成与优化

arXiv cs.CL · 2026-06-01 缓存

本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。

0 人收藏 0 人点赞
#rubric-generation

SCOPE:通过共同进化策略进行开放式任务的自我对弈

Hugging Face Daily Papers · 2026-05-29 缓存

SCOPE是一个用于开放式任务的自我对弈框架,它共同进化挑战者(Challenger)和求解器(Solver)策略,在没有外部监督的情况下,在基准测试上取得了高达+10.4分的提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈