标签
A Scale AI research paper proposes Rubric Dropout, a dropout-style regularization for rubric criteria in rubric-as-reward RL, showing it mitigates reward hacking and improves out-of-distribution gold judge scores on medical and science benchmarks.
本文介绍了ConRub-Med,一种利用多个语言模型生成的共识评分标准来对开放医学问答进行奖励的强化学习方法,在包括HealthBench-Hard在内的多个基准上取得了最先进的结果。
本文介绍了评分标准作为特权信息(RuPI),通过以评分标准作为软特权信息来条件化教师模型,将同策略自蒸馏扩展到开放式生成。该方法在多个大语言模型和HealthBench等基准上优于评分标准即奖励的强化学习和参考补全蒸馏。
CRAFT将基于评分标准的评估转化为LLM的分层能力诊断,识别特定弱点并生成有针对性的微调数据,在四个开源模型的金融和法律基准上取得了更强结果。
这个开发管道通过先制作粗糙原型引发用户反馈,将每次“不对”的反应转化为可检查的规则,然后由AI代理独立开发并验收,以尽早发现问题并避免自欺欺人。
RubricsTree 提出了一种可扩展且与专家对齐的个人健康智能体评估框架,使用超过100个原子布尔规则,在Gemini、GPT和Qwen模型系列的HealthBench上实现了高达66%的相对提升。
DailyReport 是一个开放式基准,用于评估搜索代理在日常生活搜索任务中的表现,包含150个任务和3,546条评分标准,可实现可解释的、以用户为中心的评估。
Cognition 宣布推出 FrontierCode,这是一个新的代码评估基准,超越了单元测试,衡量代码质量、范围、测试正确性和人类审查者认可度,解决了代理编写通过测试但不可维护的草率代码的问题。
Sydney Runkle announced support for rubrics in deepagents, allowing agents to define a clear definition of done and loop until the goal is complete.
介绍了PReMISE,一个用于发现和审计LLM评估者策略级规则的框架,涵盖四个维度:结构充分性、可靠性、偏好匹配度和对抗鲁棒性。