我测试了6款AI面试助手,并将结果整理成公开数据集
摘要
一位开发者测试了六款AI面试助手产品,发现所有产品均未通过数项行为检查,并发布了一个包含6款产品、11项标准、共66项评估的公开数据集,可在GitHub和Zenodo上获取。
我开发了CTRLpotato,所以首先明确声明:我测试的六款产品都是竞争对手。CTRLpotato不在结果中,我也不是要用这个来宣布谁胜出。在六月和七月期间,我在Mac和/或Windows上测试了Cluely、Interview Coder、LockedIn AI、ULTRACODE、Parakeet AI和Final Round AI。我最初这样做是因为我经常看到诸如“隐形”、“不可检测”、“实时”之类的宣传,想看看这些桌面应用实际表现如何。我最终积累了大量的截图、录屏和笔记,把它们分散在六篇独立评测里变得毫无意义,于是我将其标准化为一个数据集。现在它包含6款产品、11项标准、共66项评估。有几个结果让我意外:在我测试的设置中,所有6款都未通过焦点行为检查。所有6款都未通过光标行为检查。在我测试的所有5款产品中,快捷键隔离均失败。第六款未测试。我对4款产品测试了接收端屏幕共享,2款失败,2款结果混合。还有一些相当奇怪的上下文失败,比如助手会回答一个旧的编码任务,或者失去对应该回答什么的追踪。我不想夸大这些数字。这不是一个每款产品都在完全相同设置下进行的实验室实验。其中涉及不同版本、平台和测试流程,这就是为什么每一行都包含应用版本、平台、日期、实际发生的情况、局限性以及我掌握的证据。五个结果标签分别是:通过、混合、失败、未找到和未测试。失败意味着在文档记录的设置中失败了,而不是该功能永远无法工作。完整内容公开在这里:https://www.ctrlpotato.com/compare 我还将实际数据集放到了GitHub上,包含CSV/JSON/JSONL、模式、代码手册和校验和:https://github.com/ae0j/ctrlpotato-ai-interview-assistant-benchmark 还有一个带版本的Zenodo DOI,方便任何人引用或存档:https://doi.org/10.5281/zenodo.21915738 该数据集可自由使用,包括商业用途,只需注明出处。还有一件事我仍然不确定:passed/mixed/failed这一列是否真的让数据集变得更好。我越深入研究,就越觉得原始观察加上局限性比试图把发生的事压缩成一个标签更有用。很好奇做评估数据集的人怎么看。
相似文章
AICompanionBench:评测 LLM 作为裁判在 AI 伴侣安全领域的表现
AICompanionBench 推出了首个公开可用的基准数据集,包含 2,123 条真实 AI 伴侣对话,并按九个安全风险类别进行标注,用于评估 20 个 LLM 作为安全裁判的表现。结果显示,强模型能较好地处理显性有害内容,但在操控等细微风险的识别以及对无害对话的误判问题上仍存在明显不足。
针对自主AI供应商的开源采购评估标准,我对其中5家进行了评分,希望能获得关于评估方法的反馈
作者创建了一个开源评估工具,用于评估自主AI供应商在工具调用正确性、循环终止和多步状态一致性方面的文档,对五家供应商(Anthropic、OpenAI、LangGraph、Sierra、Salesforce)进行了评分,并请求就评估方法及对公开文档深度的潜在偏差提供反馈。
我在2026年真实通话中测试了5个AI语音代理平台——这是我的诚实排名
基于60多小时测试,对五个AI语音代理平台(LuMay、Vapi、Retell AI、Pipecat、LiveKit Agents)在生产可靠性、延迟、语音质量和可扩展性方面的个人排名。
2026年最佳AI工具并非总是最热门的。以下是我实际会使用的工具
基于作者测试的2026年多类别最佳AI工具详细概览。涵盖AI助手、编码IDE、编码代理、应用构建器、图像与视频生成以及音频工具的评估。
我构建了一个赛博朋克风格的智能体匹配工具,受够了克隆那些有问题的仓库
作者开发了一个免费的基于问答的工具,帮助开发者在50多个选项中寻找合适且维护良好的AI智能体仓库,避免那些出现故障或过时的仓库,并正在寻求社区反馈。