Vidai Community 现已推出:一个 Rust 二进制文件,用于每次 LLM 调用的成本归属、护栏和多提供商路由
摘要
Vidai Community 是一个免费、可自托管的 Rust 二进制文件,通过一行集成和极低开销,为 LLM 调用提供成本归属、护栏和多提供商路由。
LLM 流量的成本控制并非未解决的问题。我见过的大多数团队已经自行搭建了某种方案——一个用于 SDK 转换的库、一个自定义的 OpenTelemetry 导出器、用于支出上限的 Python 中间件、对提示词的正则防护、以及一份每周二有人更新的提供商价格 JSON。它能工作。但没人主动选择这种技术栈。它是自然生长出来的。
**Vidai Community 现已推出。**
一个 Rust 二进制文件,在您自己的基础设施内一次性完成这七项工作。
* **一行集成。** 更改现有 OpenAI / Anthropic / Google GenAI SDK 的 `base_url`。保留您的代码、工具调用格式和流式语义。双向原生转换处理其余部分——使用 Anthropic SDK 调用,路由到 OpenAI,响应以 Anthropic 格式返回。
* **返回时的路径内成本归属。** 按用户、密钥、团队、应用和模型。严格的团队级预算,在超出限额时停止下一次调用,而不是发出关于已运行调用的警报。
* **免费的公开价格表服务。** 每个主要提供商的价格数据,按标准节奏刷新。无需再维护您自己的 JSON。
* **25 MB。1.95 毫秒中位开销。单节点验证达到 21,803 RPS。** 免费、无过期,自助访问 [vidai.uk/community](https://vidai.uk/community) · [文档](https://docs.vidai.uk/)
如果您启动它并发现了粗糙之处、不喜欢某个默认设置,或者希望某个标志有不同的行为:请在[快速入门仓库中提交问题](https://github.com/vidaiUK/vidai-quickstart/issues)或在此回复。每当有人在非我们自己的硬件上运行它,产品就会变得更完善,而这是我们无法从自身内部技术栈获得的反馈。
相似文章
@svpino: 如何为基于LLM的应用实现全面可观测性和自动分析。只需一个库加一行代码…
这条推文推广了一个库,只需一行代码即可为基于LLM的应用提供全面可观测性和自动分析,声称可以免费获取大量有价值的信息。
我们构建了一个源码可用的LLM可靠性库(对研究/个人/内部评估免费),可在保持同等质量的前提下将推理成本降低一半,只需更改一个import语句即可采用 [P] [R]
AgentCodec 是一个源代码可用的库,它将 28 种 LLM 可靠性技术(如重试、集成、生成器/判别器优化等)统一到单一兼容 OpenAI 的 API 下,并配备自适应路由器,在匹配质量的情况下可降低约 56% 的推理成本。该库采用通信理论框架,支持即插即用替代 OpenAI、Anthropic 和 Ollama 客户端。
@Mayhem4Markets: https://x.com/Mayhem4Markets/status/2069090022117019928
两大主流LLM服务框架SGLang和vLLM的详细技术对比,涵盖KV缓存管理(RadixAttention vs PagedAttention)的架构差异、吞吐量、延迟以及自托管环境的部署考量。
用 Rust/WASM 构建 LLM 的开源边缘语义缓存——对架构的合理性检查?[D]
提议使用 Rust/WASM 在 CDN 边缘构建一个轻量级的开源 LLM 语义缓存,以降低延迟和 API 成本,并寻求社区对架构和用例有效性的反馈。
@vllm_project: Rust 前端现已正式合并至 vLLM!随着 GPU 性能不断提升,前端已占据相当比例的 CPU 时间。…
vLLM 的 Rust 前端现已正式合并,可作为 Python API 服务器的直接替代方案,在预处理密集型工作负载上吞吐量提升高达 5 倍。