我使用Jev来确定在Git差异后哪些测试实际需要运行

Reddit r/AI_Agents 工具

摘要

作者构建了jev-test-impact,这是一个工具,利用Git差异和静态依赖分析与Jev来评分并仅运行相关测试,旨在提高测试工作流中的回归召回率。

我最近一直在尝试Jev,并想测试一个相当简单的想法:大多数编码代理现在可以非常快速地修改仓库,但之后我们仍然在每次更改后运行整个测试套件。所以我构建了jev-test-impact。它的工作流程是:Git差异 👉 静态依赖分析 👉 候选测试文件 👉 Jev为候选评分 👉 仅运行选定的Vitest/Jest文件。重要的是,Jev从不生成命令或任意测试路径。它只能从本地发现的测试中选择。还有一个完全本地化的--static模式,这样我可以进行基准测试:完整套件 vs 静态分析 vs 静态 + Jev。我特别感兴趣的是测量回归召回率,而不是仅仅发布一些荒谬的'减少99%测试'的数字,同时默默地错过错误。我希望能针对更大的现实世界TypeScript仓库测试这个。我也很好奇,什么会让你足够信任这样的工具,以便在CI中使用?
查看原文

相似文章

基于 Jev 的代码审查

Hacker News Top

Jev-Code-Reviewer 是一款 GitHub 扩展和命令行工具,它通过将更改分类为优先级级别并提供代码差异的自然语言解释,来帮助开发者审查来自 AI 代理的拉取请求。

Jev 的一些有趣颠覆性用例,欢迎补充。

Reddit r/AI_Agents

本文介绍了 Jev 的几个颠覆性用例,这个工具可应用于 AI 评估、语音 AI、工作流、合成角色等,为各种 AI 任务提供快速且可量化的解决方案。

Jev 应用场景的数百个示例

Reddit r/singularity

本文介绍了由开发者在 jevable.com 和 Twitter 上分享的、使用 Jev 构建的数百个应用场景和项目。

DIY Jev

Reddit r/LocalLLaMA

作者分享了一个类似DIY Jev的推理设置,使用开源权重大语言模型,展示了通过简单的提示和基于logit的验证,在没有微调的情况下实现了良好的准确性,并提供了一个用于本地部署的Rust Web服务器。