rubrics

标签

Cards List
#rubrics

Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL

arXiv cs.LG · 2026-08-13 缓存

A Scale AI research paper proposes Rubric Dropout, a dropout-style regularization for rubric criteria in rubric-as-reward RL, showing it mitigates reward hacking and improves out-of-distribution gold judge scores on medical and science benchmarks.

0 人收藏 0 人点赞
#rubrics

ConRub-Med:基于共识评分标准的开放医学问答强化学习

arXiv cs.CL · 2026-08-12 缓存

本文介绍了ConRub-Med,一种利用多个语言模型生成的共识评分标准来对开放医学问答进行奖励的强化学习方法,在包括HealthBench-Hard在内的多个基准上取得了最先进的结果。

0 人收藏 0 人点赞
#rubrics

评分标准作为开放式生成中的特权信息

arXiv cs.LG · 2026-08-05 缓存

本文介绍了评分标准作为特权信息(RuPI),通过以评分标准作为软特权信息来条件化教师模型,将同策略自蒸馏扩展到开放式生成。该方法在多个大语言模型和HealthBench等基准上优于评分标准即奖励的强化学习和参考补全蒸馏。

0 人收藏 0 人点赞
#rubrics

CRAFT:聚类评分标准以诊断弱项LLM能力并生成有针对性的微调数据

arXiv cs.AI · 2026-07-20 缓存

CRAFT将基于评分标准的评估转化为LLM的分层能力诊断,识别特定弱点并生成有针对性的微调数据,在四个开源模型的金融和法律基准上取得了更强结果。

0 人收藏 0 人点赞
#rubrics

@ThisisHan1_: 最近做了一条开发 pipeline,想分享一下背后的想法。 我是被 loop / goal engineering、还有 auto-goal(让 agent 自己写 goal、自己 spawn 子任务)那一串东西启发的。但真正让我想通的,…

X AI KOLs Timeline · 2026-06-17 缓存

这个开发管道通过先制作粗糙原型引发用户反馈,将每次“不对”的反应转化为可检查的规则,然后由AI代理独立开发并验收,以尽早发现问题并避免自欺欺人。

0 人收藏 0 人点赞
#rubrics

RubricsTree:跨健康记忆与医疗技能的个人健康智能体可扩展且不断演进的开放式评估

arXiv cs.CL · 2026-06-17 缓存

RubricsTree 提出了一种可扩展且与专家对齐的个人健康智能体评估框架,使用超过100个原子布尔规则,在Gemini、GPT和Qwen模型系列的HealthBench上实现了高达66%的相对提升。

0 人收藏 0 人点赞
#rubrics

DailyReport:一个用于评估日常搜索任务中搜索代理的开放式基准

arXiv cs.AI · 2026-06-12 缓存

DailyReport 是一个开放式基准,用于评估搜索代理在日常生活搜索任务中的表现,包含150个任务和3,546条评分标准,可实现可解释的、以用户为中心的评估。

0 人收藏 0 人点赞
#rubrics

@denizbirlikci: 要理解我们为什么构建 FrontierCode,请阅读 @METR_Evals 的博客文章,了解为什么"许多通过 SWE-bench 的 PR 不会被合并到主分支……"

X AI KOLs Following · 2026-06-08 缓存

Cognition 宣布推出 FrontierCode,这是一个新的代码评估基准,超越了单元测试,衡量代码质量、范围、测试正确性和人类审查者认可度,解决了代理编写通过测试但不可维护的草率代码的问题。

0 人收藏 0 人点赞
#rubrics

@sydneyrunkle: we just shipped support for rubrics in deepagents give your agent a clear definition of what "done" looks like, and for…

X AI KOLs Following · 2026-06-08 缓存

Sydney Runkle announced support for rubrics in deepagents, allowing agents to define a clear definition of done and loop until the goal is complete.

0 人收藏 0 人点赞
#rubrics

PReMISE:将策略规则作为LLM评估者的度量规范

arXiv cs.AI · 2026-06-01 缓存

介绍了PReMISE,一个用于发现和审计LLM评估者策略级规则的框架,涵盖四个维度:结构充分性、可靠性、偏好匹配度和对抗鲁棒性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈