标签
介绍了FinProBench,一个基于真实专业交付物衍生角色锚定评分标准来评估金融AI智能体的基准,并提出了RGRC流水线,该流水线改善了对角色专业化任务的评估。
介绍了RubricReviewer,一个用于基于大语言模型(LLM)的同行评审的评分标准驱动框架,它显式生成论文自适应的评分标准,并将无训练的证据收集智能体(Scout)与经过训练的人类对齐模型(Aligner)相结合,以产生更全面、更具区分性和更鲁棒的评审意见。
作者创建了一个开源评估工具,用于评估自主AI供应商在工具调用正确性、循环终止和多步状态一致性方面的文档,对五家供应商(Anthropic、OpenAI、LangGraph、Sierra、Salesforce)进行了评分,并请求就评估方法及对公开文档深度的潜在偏差提供反馈。
本文描述了基于LLM的工具的开发,该工具使用OpenAI的GPT模型评估普渡大学SURF项目约1,200份目的陈述,处理时间约4.6小时,相比传统人工评分加速了审阅流程。
本文提出了一种基于学习者模型的评价标准,用于评估视觉语言模型(VLM)在数学教育中的自适应性。实验表明,不同模型在自适应性上存在可测量的差异,并揭示了当前的VLM难以生成一致且适应学习者的教学回应。