标签
这篇来自斯坦福大学、英伟达和加州大学伯克利分校的论文介绍了LLM-as-a-Verifier,一种无需训练的验证框架,利用LLM logits的连续评分来提高编码、机器人和医疗领域的准确性,在多个基准上取得了最先进的结果。
FrontierCode是一个面向编码智能体的全新基准测试,通过人工验证并采用持续评分模型,旨在评估真实世界的性能。