LLM-as-a-Verifier (GitHub 仓库)

TLDR AI 工具

摘要

LLM-as-a-Verifier 是一个通用的验证框架,为AI代理提供细粒度反馈,在Terminal-Bench和SWE-Bench等基准测试上实现了最先进的性能。

LLM-as-a-Verifier 是一个通用框架,为任何代理提供细粒度反馈,无需额外训练。它在编码、机器人技术和医疗代理基准测试中实现了最先进的性能。该框架生成的反馈可用于测试时缩放、进度跟踪和强化学习。
查看原文
查看缓存全文

缓存时间: 2026/09/07 23:51

任意模态,多种应用,统一验证框架

| 文档 | 官网 | 论文 | Claude Code 插件 | Twitter/X | Slack |

相似文章

LLM-as-a-Verifier:通用验证框架

Hugging Face Daily Papers

LLM-as-a-Verifier引入了一种概率验证框架,该框架从LLM的对数几率计算连续分数,并在粒度、重复评估和标准分解方面进行缩放。它在多个智能体基准测试上取得了最先进的结果,并为强化学习提供了密集反馈。