请求速率的国际单位制 (2024)
摘要
一篇讨论如何在分布式系统中正确使用国际单位制测量请求速率的文章,提议使用赫兹 (Hz) 表示周期性/规则流量,使用贝克勒尔 (Bq) 表示随机/有机流量模式,以标准化请求速率的通信方式。
<p><a href="https://lobste.rs/s/x5hnnp/si_units_for_request_rate_2024">Comments</a></p>
查看缓存全文
缓存时间: 2026/04/20 14:55
# 请求速率的SI单位
来源:https://entropicthoughts.com/si-units-for-request-rate
**请求速率**是指在某个时间段内到达、被处理或离开的请求数量。
令人惊讶的是,许多人在讨论请求速率时往往不会指定时间段的长度。我甚至见过一些仪表板的指标查询没有固定的时间段 – 请求速率会根据仪表板在当时认为适合窗口大小的任何聚合间隔来测量。如果你缩小视图,请求速率会上升。如果你将窗口移到高分辨率屏幕上,请求速率会下降。
我们应该在发送到指标数据库的查询中指定时间段长度,这样无论用户的仪表板占用多少像素,每个人看到的请求速率都是一样的。
合适的时间段长度是秒。请求速率应该以每秒请求数来衡量。1注1:我见过一些人用每分钟请求数来衡量。别学他们那样。这听起来应该有一个 SI 单位,即我们应该能够说"我们的请求速率是57瓦"之类的话。除非显然不是瓦特。
---
结果表明有**两个** SI 单位都可以适用:
- **赫兹**(Hz)是 SI **频率**单位。它被定义为每秒一个事件。
- **贝克勒尔**(Bq)是 SI **(放射性)活度**单位。它也被定义为每秒一个事件。
为什么会有两个单位表示同一个概念?物理学家听到事件以 4 Hz 发生时,会认为恰好每 250 毫秒发生一个事件。赫兹单位与周期性行为密切相关。而放射性衰变的行为并不那么规则,只会平均以给定的频率发生。一个以 4 Bq 衰变的样本可能在某一秒内衰变零次,然后在下一秒衰变 9 次。2注2:假设泊松分布,这些是稀有事件,但如果你观察样本一小时,有超过 50% 的概率观察到衰变序列的确切发生。
因此,当我们讨论高度规则的负载测试时,每 2 毫秒稳定地发出一个请求,我们可以说请求速率是 500 Hz。但如果谈论的是碰巧平均每秒到达 500 次的有机流量,那么说 500 Bq 可能更合适。
当我们接近静态网络服务器或缓存能处理的请求速率时,这也很方便。说"90千贝克勒尔"和写"90 kBq"比说"每秒9万个请求"和写"90,000 requests/s"方便得多。3注3:一位读者建议改为发明单位"rips",我既喜欢这个想法也喜欢它的发音,但我就是喜欢按照自己的意愿弯曲标准。
---
**不过**!似乎 – 与作为通用单位的赫兹相反 – 贝克勒尔专门用于放射性衰变。对于平均以某个频率发生的任意事件,并没有 SI 单位。我会继续对请求速率使用贝克勒尔,我希望 50 年后,我们会忘记认为它仅关乎核衰变这个愚蠢的错误。
相似文章
RateQuant:基于率失真理论的优化混合精度KV Cache量化
本文介绍了 RateQuant,一种用于优化混合精度 KV Cache 量化的方法。该方法利用率失真理论解决失真模型不匹配问题,与 KIVI 和 QuaRot 等现有方法相比,在极低的校准开销下显著降低了困惑度。
UniSVQ: 2-bit统一标量-向量量化
UniSVQ提出了一种统一的2位量化框架,通过将码字参数化为整数格点的仿射变换,桥接了标量量化与向量量化,在标量方法中达到了最先进水平,并与向量方法性能相当且具有更高的吞吐量。
Qwen3.6-27B 量化基准测试
本文使用 KLD 和 Same Top P 指标,对多种 Qwen3.6-27B 量化版本(Q8 至 Q2)进行基准测试,对比了 Unsloth 和 mradermacher 等提供者的量化结果,并给出了质量与大小权衡的建议。
CubicQuant:面向1-8位权重高吞吐量LLM推理的参数化非均匀码本
CubicQuant提出了一种用于LLM权重的参数化非均匀标量量化格式,利用单调三次曲线在1-8位宽度下自适应重建水平,同时保留密集整数码流以提升GPU执行效率。实验表明,与均匀基线和浮点基线相比,RMSE有所降低,并给出了初步的H200内核测量结果。
Qwen 3.6 27B 在 llama.cpp 中的标志/设置
一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。