我测试了6款AI面试助手,并将结果整理成公开数据集

Reddit r/ArtificialInteligence 工具

摘要

一位开发者测试了六款AI面试助手产品,发现所有产品均未通过数项行为检查,并发布了一个包含6款产品、11项标准、共66项评估的公开数据集,可在GitHub和Zenodo上获取。

我开发了CTRLpotato,所以首先明确声明:我测试的六款产品都是竞争对手。CTRLpotato不在结果中,我也不是要用这个来宣布谁胜出。在六月和七月期间,我在Mac和/或Windows上测试了Cluely、Interview Coder、LockedIn AI、ULTRACODE、Parakeet AI和Final Round AI。我最初这样做是因为我经常看到诸如“隐形”、“不可检测”、“实时”之类的宣传,想看看这些桌面应用实际表现如何。我最终积累了大量的截图、录屏和笔记,把它们分散在六篇独立评测里变得毫无意义,于是我将其标准化为一个数据集。现在它包含6款产品、11项标准、共66项评估。有几个结果让我意外:在我测试的设置中,所有6款都未通过焦点行为检查。所有6款都未通过光标行为检查。在我测试的所有5款产品中,快捷键隔离均失败。第六款未测试。我对4款产品测试了接收端屏幕共享,2款失败,2款结果混合。还有一些相当奇怪的上下文失败,比如助手会回答一个旧的编码任务,或者失去对应该回答什么的追踪。我不想夸大这些数字。这不是一个每款产品都在完全相同设置下进行的实验室实验。其中涉及不同版本、平台和测试流程,这就是为什么每一行都包含应用版本、平台、日期、实际发生的情况、局限性以及我掌握的证据。五个结果标签分别是:通过、混合、失败、未找到和未测试。失败意味着在文档记录的设置中失败了,而不是该功能永远无法工作。完整内容公开在这里:https://www.ctrlpotato.com/compare 我还将实际数据集放到了GitHub上,包含CSV/JSON/JSONL、模式、代码手册和校验和:https://github.com/ae0j/ctrlpotato-ai-interview-assistant-benchmark 还有一个带版本的Zenodo DOI,方便任何人引用或存档:https://doi.org/10.5281/zenodo.21915738 该数据集可自由使用,包括商业用途,只需注明出处。还有一件事我仍然不确定:passed/mixed/failed这一列是否真的让数据集变得更好。我越深入研究,就越觉得原始观察加上局限性比试图把发生的事压缩成一个标签更有用。很好奇做评估数据集的人怎么看。
查看原文

相似文章

AICompanionBench:评测 LLM 作为裁判在 AI 伴侣安全领域的表现

arXiv cs.AI

AICompanionBench 推出了首个公开可用的基准数据集,包含 2,123 条真实 AI 伴侣对话,并按九个安全风险类别进行标注,用于评估 20 个 LLM 作为安全裁判的表现。结果显示,强模型能较好地处理显性有害内容,但在操控等细微风险的识别以及对无害对话的误判问题上仍存在明显不足。