标签
一篇论文描述了将JEV用于推理任务的门控,作为成本效益高的初审法官,在置信度较低时升级到大语言模型或人类。
文章讨论了评估匿名AI模型Space Bunny在代理工作流中的方法,重点是状态测试、错误恢复和一致性以确保可靠性。
介绍了IndicBankBench,一个包含799个案例的基准测试,用于评估印度零售银行语言模型助手的安全性和可靠性,采用多阶段评估,并公开发布代码和数据。
本研究使用美国区域数据评估了 Wavelet Diffusion 模型在降水降尺度中的跨区域和跨事件泛化能力,表明在有限区域训练的模型在未见区域也能表现出竞争力。
PFArena 提出了一个用于评估语言模型在蛋白质修饰任务上表现的基准测试,通过比较蛋白质语言模型和大型语言模型,评估它们在生物应用中的能力。
RECLAIM 是一个针对人工智能智能体的基准测试,用于复现机器学习论文中的主张,其难度层级基于可用的代码、数据和权重。研究表明智能体在复现结果时面临困难,在最简单的层级中,最佳成功率为41%。
StepCOPS是一种统计框架,用于选择语言模型策略,采用闭式测试和下限证书,以高概率确保安全保障,提高了效率,优于保守方法。
本文通过生成顺序干预评估了视觉-语言推理中解释与模型预测之间的因果联系,发现需要更大的模型进行理由优先推理,而答案优先生成能减少格式相关的错误。
本文识别了一种故障模式,其中语言模型被CRM记录中激励不一致的证人的断言所说服,导致错误决策,并提出了一种诊断方法来分析此问题。
由Surge AI推出的名为DAYJOB的财务基准测试评估AI代理在完成财务预测任务时的表现,其详细的通过/失败标准重点关注净销售额计算和收入增长预测中的错误。
本文解释了如何将Jev AI模型集成到代理编排框架中,以实现智能模型路由、自动模式下的风险拦截和自动化评估,详情可参考LangChain视频。
这场在 Interrupt NYC 举办的炉边对话中,RogoAI 首席执行官与 LinkedIn 讨论了大规模评估代理式AI的问题。
LangSmith 推出了自定义应用,现已全面可用,允许用户在平台上为他们的代理数据构建和发布自定义界面,以增强标注和实验比较等工作流程。
Anthropic 报告称,使用约 950 个 Claude 代理在 21 小时内识别出酶研究中的潜在生物先导物,但该结果是初步的,并引发了关于在科学中验证 AI 代理工作流程的问题。
作者分享了长时间运行的Django基准测试中学到的教训,强调了在评估工作流程稳定性方面的修复,以及更新后的结果,显示Flash Next是表现最佳的模型,现在推理努力级别得到了正确评估。
FWBench 引入了一个基准,用于评估语言模型如何选择和使用时间序列预测来做出成本约束决策,并在电力和共享单车租赁数据集上比较托管与本地配置,同时由 GPT-6 Astra 实现高效的预算使用。
本文介绍了NAF-Bench,用于研究大型语言模型对指定否定语义的遵守情况。研究发现,像o4-mini这样的前沿模型表现良好,而开源模型则滞后。建议通过求解器委托或微调来改进。
本文通过分离图导航能力,对KGQA中的小型语言模型进行超越答案准确率的评估,结果显示路径保真度存在显著差异,并强调需要更广泛的评估指标。
MolDesignBench是一个新的基准测试,用于评估基于场景的分子设计中的LLM智能体,包含2000个具有隐式和显式约束的实例,揭示了当前前沿的LLMs成功率较低,尤其是在推理隐式约束和检测不可行性方面。