agent-as-a-judge

标签

Cards List
#agent-as-a-judge

在线Agent-as-a-Judge:交互式智能体的情境生成评估

arXiv cs.AI · 2026-06-09 缓存

提出在线Agent-as-a-Judge评估框架,该框架利用世界内评估智能体主动生成情境来测试交互式社交智能体,在覆盖率和可靠性上优于被动方法。

0 人收藏 0 人点赞
#agent-as-a-judge

WebCompass:面向代码语言模型的多模态网页编程评估

Hugging Face Daily Papers · 2026-04-20 缓存

# 论文页面 - WebCompass:面向代码语言模型的多模态网页编程评估 来源:[https://huggingface.co/papers/2604.18224](https://huggingface.co/papers/2604.18224) 作者:, , , , , , , , , , , , , , , , , ## 摘要 WebCompass 通过多样化的输入模态和任务类型评估网页开发能力,采用模拟真实世界编码工作流的自动化评估方法。[大语言模型](https://huggingface.co/papers?q=Large%20language%20model

0 人收藏 0 人点赞
← 返回首页

提交意见反馈