verifier

标签

Cards List
#verifier

先前审计-修复上下文使LLM验证器阈值趋向宽大

Hugging Face Daily Papers · 2026-08-17 缓存

本文发现,上下文中的先前审计和修复事件通过转移决策阈值来减少LLM验证器的误报,其中修复内容和审计结果对不同的模型家族产生互补影响。

0 人收藏 0 人点赞
#verifier

同策略优化中验证器诱导的支持重塑

arXiv cs.LG · 2026-08-04 缓存

本文介绍了验证器诱导的支持重塑,表明具有可验证奖励的同策略强化学习能够在优化当前目标的同时,使后续目标的成功行为变得过于稀少而难以采样。跨数学推理和指令跟随的实验表明,端点改进并不能保证未来的可训练性。

0 人收藏 0 人点赞
#verifier

@feltanimalworld: 高人,你这个帖子让我整整琢磨了两天!本来想写个长文,但是太多头绪也不知道从何写起。总的来说是我这段时间上推的原因,总感觉自己的开发缺了很重要的认知;也是我这段时间除了自己硬件修复工作之外,还必须要去看text-to-CAD 的原因。 我为…

X AI KOLs Timeline · 2026-07-12 缓存

作者讨论AI在严肃行业落地中缺乏中间表示(IR)和验证器(Verifier)的问题,以text-to-CAD为例说明统一IR和验证对AI方案可行性的关键作用。

0 人收藏 0 人点赞
#verifier

新采样器+验证器*显著*提升小型0.5B模型编码性能

Reddit r/LocalLLaMA · 2026-06-25 缓存

本文介绍了VGB,一种带有概率回溯的过程引导采样算法,通过鲁棒地处理验证器错误,显著提升了小型0.5B模型的编码性能。

0 人收藏 0 人点赞
#verifier

SG-OPD:通过符号一致性门控和分阶段教师采样的符号门控在线策略蒸馏

Hugging Face Daily Papers · 2026-06-08 缓存

符号门控在线策略蒸馏(SG-OPD)通过使用二元验证器作为教师监督的信任信号,增强了标准在线策略蒸馏,在竞赛级数学推理基准上提升了性能。

0 人收藏 0 人点赞
#verifier

作为弱推理模型助推器的智能体系统

arXiv cs.AI · 2026-05-15 缓存

本文研究了以验证器为后盾的委员会搜索作为推理语言模型的推理时增强方法,表明在像 SWE-bench Verified 这样的代码修复任务上,弱推理模型委员会可以匹配强得多的模型的性能。

0 人收藏 0 人点赞
#verifier

逻辑正则化验证器激发大语言模型的推理能力

arXiv cs.CL · 2026-05-08 缓存

介绍了 LoVer,一种使用逻辑规则(否定一致性、组内一致性和组间一致性)来在无标签数据下提升大语言模型推理能力的无监督验证器,在推理基准测试中达到了接近监督验证器的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈