PromptDeck v1.1.0 – 开源桌面应用,用于并排基准测试本地和云端LLM(Ollama, LM Studio + OpenRouter, Groq, DeepSeek…)
摘要
PromptDeck v1.1.0 是一个开源桌面应用程序,用于并排基准测试和比较本地和云端大语言模型,支持多个提供商,并提供测试套件和排行榜等功能。
嘿,r/LocalLLaMA社区!我刚刚发布了PromptDeck v1.1.0,想在这里分享一下,因为基本上是这个社区促使了它的诞生。它是什么:一个开源桌面工作室(基于Tauri + React),用于并排提示和基准测试大语言模型。一切都在本地运行——没有遥测,除非你明确添加云密钥,否则没有云调用。你能用它做什么:- ⚡ 一次针对多达4个模型运行一个提示(Ollama, LM Studio, llama.cpp)并实时查看流式输出 - 📊 通过图表比较TPS / TTFT(`~`表示服务器未报告使用率时的估算TPS) - 🧪 测试套件——向多个模型发送1-10个提示,并获得每个模型获胜次数的记分板 - ☁️ v1.1新增功能:云提供商——OpenRouter, Groq, DeepSeek, Together, OpenAI, xAI, Kimi, NVIDIA NIM, Ollama Cloud, Gemini + 自定义端点。每个提供商可选模型,同一运行中混合本地和云端 - 🏆 获胜者投票 + 持久化排行榜,差异视图,历史记录在本地SQLite中,支持PDF/Markdown/CSV导出 - 🌑 浅色/深色/AMOLED主题,支持EN/DE/FA语言环境 链接:- GitHub: https://github.com/Cadman021/prompt-deck - 从Releases下载二进制文件(Windows / macOS / Linux)——或 `npm run tauri dev` 从源码运行 诚实提醒:云API密钥当前存储在本地存储中(OS钥匙串迁移已在路线图上),云运行的成本跟踪功能尚未实现。欢迎提交Issues和PR——我为新用户准备了一些 `good first issue`。乐意回答问题——如果你基准测试了什么有趣的东西,我很想看看记分板!
相似文章
Homebench – 基准测试本地LLM的速度、内存和质量
Homebench 是一款零配置终端工具,可对本地运行的LLM进行速度、内存和质量的基准测试,并提供实时排行榜。它支持 Ollama、LM Studio、llama.cpp、vLLM 以及兼容 OpenAI 的服务器。
relaydeck agent orchestrator 现已公开测试(v0.1.0)
Relaydeck,一款面向 CLI 编码智能体的本地优先集群操作系统,现已进入公开测试阶段(v0.1.0)。它封装了 Claude Code、Codex 等供应商 CLI,可无人值守运行,并提供集中监控与自动化功能。
为本地LLM提供大量答案的新旧基准测试
本文介绍了一个用于评估本地LLM配置的基准测试工具,重点关注显存使用情况、性能指标和硬件优化,以协助开发者优化配置。
来了:Benchmark-Yourself 应用——与开源 LLM 竞争并获得分数——提供5个基准测试——将结果添加到简历或 LinkedIn(如果你敢的话)...或者直接粘贴到下面接受社区吐槽。
一个网络应用,允许用户将自己的表现与开源 LLM 在五个基准测试上进行对比,并可以选择将结果添加到简历或 LinkedIn。
实测 OpenCode 与自托管 LLM 的协作:Qwen 3.5、3.6、Gemma 4、Nemotron 3、GLM-4.7 Flash - v2
一位开发者在 RTX 4080 上用 OpenCode 对多款自托管 LLM(Qwen 3.5/3.6、Gemma 4、Nemotron 3、GLM-4.7)进行两项编码任务基准测试,揭示了速度与质量的权衡。