eTPS 网站计划 – 简单排行榜 + 您将实际看到的内容
摘要
作者介绍了effectiveTPS的网站计划,这是一款使用新的'eTPS'指标(有效TPS)以及原始速度和延迟来比较本地AI模型的工具。其目标是提供一个简单的排行榜,突出展示有用的输出质量,而非原始营销数字。
继上一篇文章之后,这是effectiveTPS第一个版本的样子。**核心显示(v1):**
- 清晰的表格,比较流行的本地模型
- Raw TPS(每个人展示的营销数字)
- eTPS(新指标,实际衡量真实对话中的有用输出)
- 首次令牌输出时间(等待开始回复的时长)
- 效率指数 = (eTPS ÷ Raw TPS) × 100 — 数值越高越好
**示例排行榜(早期测试数据):**
| 模型 | Raw TPS | eTPS | 首次令牌输出时间 | 效率指数 |
|--------------------|---------|--------|---------------------|---------------------|
| Llama 3.1 70B | 45.2 | 38.7 | 1.4s | **86** |
| Qwen2.5-32B | 68.4 | 52.1 | 0.8s | **76** |
| Gemma 2 27B | 71.3 | 44.6 | 0.6s | **63** |
我通过自己构建的结构化多轮分析框架运行这些测试,以评估复杂的工作流程。这就是eTPS压力测试的方式——不仅仅是单轮基准测试,而是真正的往返对话。高级模式(切换)稍后将添加延迟百分位数、每质量成本和一致性评分。对于v1,目标是保持非常简单且立即可用,即使您对AI不深入了解。整个要点是穿透噪音,展示哪些模型实际上提供了有用的工作,而不仅仅是原始速度。您认为第一版应该添加(或删除)什么?您希望哪些指标放在显眼位置?**总结:** 简单的排行榜,包含Raw TPS、eTPS、首次令牌输出时间和清晰的效率指数。高级功能在您需要之前保持隐藏。欢迎反馈。
相似文章
我们将3个公开的TTS排行榜合并为一个包含110个模型的综合排名
一个新的综合排名将三个公开的TTS排行榜合并为一个统一的排名,涵盖110个模型和46个提供商,每周更新并采用固定方法。
@vivekgalatage: 了解TPU的系统架构非常有趣。 https://henryhmko.github.io/posts/tpu/tpu.html…
深入探讨谷歌TPU架构,解释脉动阵列、流水线和提前编译的设计理念,这些设计带来了高吞吐量和能效。
SGTP:基于采样的博弈论规划用于实时多车自动驾驶竞速
SGTP是一个面向多车自动驾驶赛车的实时基于采样的博弈论规划框架,以较低的计算时间实现了95.24%的胜率和99.35%的任务完成率。作者发布了代码和一个开源基准。
前端缺失的指标:TBT 窗口
本文介绍了 TBT 窗口这一缺失的前端性能指标概念,它突出显示了从首次内容绘制到可交互时间之间的总阻塞时间,并通过一个案例研究说明,某客户端的 TBT 从 495 毫秒飙升至 5,789 毫秒。
我们的 TPU 如何驱动日益复杂的 AI 工作负载。
Google 介绍了其定制张量处理单元 (TPU) 如何设计以处理庞大的 AI 工作负载,并强调了最新一代 TPU 具备处理 121 exaflops 计算能力的特点。