evaluation-tool

标签

Cards List
#evaluation-tool

@seclink: 另一个开源样本... 通常,你得为此付费,但既然它是开源的,它绝对是那些在手中不那么有价值的东西之一,所以他们将其作为开源发布。

X AI KOLs Following · 5天前 缓存

这篇文章宣布了Autoresearch Bench,一个用于编码代理自主解决研究问题的开源基准测试,指出模型在自主研究循环中存在显著差异。

0 人收藏 0 人点赞
#evaluation-tool

@mohit_r9a: 当我们构建SWE-Interact时,目标是将任何SWE评估任务从点估计(所有信息……

X AI KOLs Timeline · 2026-08-25 缓存

SWE-Interact已更新,以支持软件工程任务的动态、用户驱动的评估会话,在Harbor中提供原生支持,用于模拟多轮用户-代理交互。

0 人收藏 0 人点赞
#evaluation-tool

Roboflow Playground:尝试并比较30种计算机视觉模型

Hacker News Top · 2026-08-17 缓存

Roboflow Playground 是一款新的开发者工具,能够对超过30种计算机视觉模型进行并排比较,涵盖目标检测和分类等任务,从而简化评估流程。

0 人收藏 0 人点赞
#evaluation-tool

AgentR 3.0

Product Hunt · 2026-08-16

AgentR 3.0 是一款针对AI作弊时代挑战设计的招聘评估工具,在ProductHunt上发布。

0 人收藏 0 人点赞
#evaluation-tool

找几个人来折腾我的AI测试工具

Reddit r/ArtificialInteligence · 2026-08-14

作者正在为Behave寻找5-10名beta测试者。Behave是一个AI代理测试/评估工具,它不只是简单检查答案,还能发现幻觉、过早下结论、提供不安全建议以及未能自我纠正等问题。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈