supervision

标签

Cards List
#supervision

DAIS:面向复杂推理的依赖感知中间问答监督

arXiv cs.CL · 10小时前 缓存

介绍DAIS,一种训练时框架,将思维链推理转化为依赖条件化的中间问答记录,为复杂推理提供更好的监督。在政策合规基准测试上,相比基线实现了高达5.6%的准确率提升。

0 人收藏 0 人点赞
#supervision

整天运行智能体,我发现瓶颈始终在于我如何定义“好”,而非模型本身

Reddit r/AI_Agents · 2026-06-10

作者反思,运行AI智能体的主要瓶颈并非模型能力,而是人类精确定义“好”或“完成”的能力,并将其与管理人员的类比相联系。

0 人收藏 0 人点赞
#supervision

从采样结果到能力分布:重新思考LLM路由的监督

arXiv cs.LG · 2026-06-08 缓存

本文提出DARS,一个从模型行为的分布视角构建路由监督的框架,旨在解决LLM路由中单次标签不可靠的问题。

0 人收藏 0 人点赞
#supervision

信任函数:通过学会何时信任弱教师实现近乎无损的弱到强泛化

Hugging Face Daily Papers · 2026-05-31 缓存

信任函数通过识别可靠的弱标签进行训练,实现近乎无损的弱到强泛化,在多个领域中达到与真实标签监督相当的性能。

0 人收藏 0 人点赞
#supervision

@_akhaliq: GEM 生成式监督助力具身智能

X AI KOLs Following · 2026-05-28 缓存

GEM 引入了一种生成式监督方法,通过利用生成模型进行训练来提升具身智能。

0 人收藏 0 人点赞
#supervision

有没有人也觉得AI代理在事情变得复杂之前都表现得很惊艳?

Reddit r/AI_Agents · 2026-05-20

对AI代理令人印象深刻的演示和可靠的实际执行之间差距的反思,认为当前代理擅长结构化任务但在不可预测条件下会失败,并指出近期AI角色将主要集中于带人类监督的窄范围自动化。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈