我在5090上实现了代码审查功能,在Martian基准上F1得分为22.7
摘要
一位开发者使用开源权重模型在消费级RTX 5090 GPU上创建了一个代码审查工具,在Martian代码审查基准上取得了F1 22.7的成绩,目前正在考虑将其商业化或开源。
大家好。我一直在尝试各种消费级解决方案,几乎突然之间就创建了一个能与商业产品竞争的代码审查工具。它在Martian代码审查基准上取得了P 19.2、R 27.7和F1 22.7的成绩。它完全运行在消费级5090上,没有使用任何付费API,只用了开源权重模型。我反复检查了基准测试几次。现在我很困惑。我该把它做成产品吗?还是应该开源?这算是一个真正的成就吗?或者根本不值得花时间?肯定还有改进空间,也许我能达到F1 30左右。如果我把开源权重换成付费API,可能就能接近领先者了。你们怎么看?
相似文章
Open Code Review – 一款由 AI 驱动的代码审查 CLI 工具
阿里巴巴已将 Open Code Review 开源,这是一款由 AI 驱动的代码审查 CLI 工具,将确定性工程方法与 LLM 智能体能力相结合。该工具最初作为内部工具使用,服务于数万名开发者,已识别出数百万处缺陷。它通过读取 Git diff 输出,利用可配置的模型端点生成结构化的行级审查意见。
使用 o3、o4-mini 和 GPT-4.1 更快地交付代码
CodeRabbit 推出了基于 OpenAI 的 o3、o4-mini 和 GPT-4.1 模型的增强代码审查功能,使开发者能够提升 4 倍交付速度并减少 50% 的生产 bug。该工具现已包含 VS Code 集成,并使用多步推理来捕捉代码库中的 bug、重构问题和架构缺陷。
我构建了一个自主开发流水线,并对同一个项目进行了对比测试:在改装版RTX 4090上运行的27B本地模型,与廉价云端大语言模型
作者构建了一个自主开发流水线,并通过在改装版RTX 4090上运行27B本地模型与使用廉价云端大语言模型API对同一个项目进行基准测试。
实测 OpenCode 与自托管 LLM 的协作:Qwen 3.5、3.6、Gemma 4、Nemotron 3、GLM-4.7 Flash - v2
一位开发者在 RTX 4080 上用 OpenCode 对多款自托管 LLM(Qwen 3.5/3.6、Gemma 4、Nemotron 3、GLM-4.7)进行两项编码任务基准测试,揭示了速度与质量的权衡。
4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s
一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。