标签
这篇文章宣布了Autoresearch Bench,一个用于编码代理自主解决研究问题的开源基准测试,指出模型在自主研究循环中存在显著差异。
SWE-Interact已更新,以支持软件工程任务的动态、用户驱动的评估会话,在Harbor中提供原生支持,用于模拟多轮用户-代理交互。
Roboflow Playground 是一款新的开发者工具,能够对超过30种计算机视觉模型进行并排比较,涵盖目标检测和分类等任务,从而简化评估流程。
作者正在为Behave寻找5-10名beta测试者。Behave是一个AI代理测试/评估工具,它不只是简单检查答案,还能发现幻觉、过早下结论、提供不安全建议以及未能自我纠正等问题。