eTPS 网站计划 – 简单排行榜 + 您将实际看到的内容

Reddit r/artificial 产品

摘要

作者介绍了effectiveTPS的网站计划,这是一款使用新的'eTPS'指标(有效TPS)以及原始速度和延迟来比较本地AI模型的工具。其目标是提供一个简单的排行榜,突出展示有用的输出质量,而非原始营销数字。

继上一篇文章之后,这是effectiveTPS第一个版本的样子。**核心显示(v1):** - 清晰的表格,比较流行的本地模型 - Raw TPS(每个人展示的营销数字) - eTPS(新指标,实际衡量真实对话中的有用输出) - 首次令牌输出时间(等待开始回复的时长) - 效率指数 = (eTPS ÷ Raw TPS) × 100 — 数值越高越好 **示例排行榜(早期测试数据):** | 模型 | Raw TPS | eTPS | 首次令牌输出时间 | 效率指数 | |--------------------|---------|--------|---------------------|---------------------| | Llama 3.1 70B | 45.2 | 38.7 | 1.4s | **86** | | Qwen2.5-32B | 68.4 | 52.1 | 0.8s | **76** | | Gemma 2 27B | 71.3 | 44.6 | 0.6s | **63** | 我通过自己构建的结构化多轮分析框架运行这些测试,以评估复杂的工作流程。这就是eTPS压力测试的方式——不仅仅是单轮基准测试,而是真正的往返对话。高级模式(切换)稍后将添加延迟百分位数、每质量成本和一致性评分。对于v1,目标是保持非常简单且立即可用,即使您对AI不深入了解。整个要点是穿透噪音,展示哪些模型实际上提供了有用的工作,而不仅仅是原始速度。您认为第一版应该添加(或删除)什么?您希望哪些指标放在显眼位置?**总结:** 简单的排行榜,包含Raw TPS、eTPS、首次令牌输出时间和清晰的效率指数。高级功能在您需要之前保持隐藏。欢迎反馈。
查看原文

相似文章

前端缺失的指标:TBT 窗口

Lobsters Hottest

本文介绍了 TBT 窗口这一缺失的前端性能指标概念,它突出显示了从首次内容绘制到可交互时间之间的总阻塞时间,并通过一个案例研究说明,某客户端的 TBT 从 495 毫秒飙升至 5,789 毫秒。