Baseten 现已上线 Hugging Face 推理提供方 🔥
摘要
Hugging Face 宣布将 Baseten 作为受支持的推理提供方,使用户能够直接从模型页面和 SDK 以无服务器方式访问 Kimi K3、DeepSeek V4 Flash 和 GLM-5.2 等热门开源权重大语言模型。
查看缓存全文
缓存时间: 2026/08/06 19:46
Baseten 现已加入 Hugging Face 推理提供商 🔥
来源:https://huggingface.co/blog/baseten 返回文章列表 (https://huggingface.co/blog)
- 工作原理 (https://huggingface.co/blog/baseten#how-it-works)- 在网站界面中 (https://huggingface.co/blog/baseten#in-the-website-ui) - 通过客户端 SDK (https://huggingface.co/blog/baseten#from-the-client-sdks)
- 计费 (https://huggingface.co/blog/baseten#billing)
- 反馈与后续步骤 (https://huggingface.co/blog/baseten#feedback-and-next-steps)
横幅图片 (https://huggingface.co/blog/assets/inference-providers/welcome-baseten.png)
我们非常高兴地宣布,Baseten 现在已成为 Hugging Face Hub 上受支持的推理提供商!
Baseten 加入了我们不断壮大的生态系统,直接在 Hub 的模型页面上增强了无服务器推理的广度和能力。推理提供商也已无缝集成到我们的客户端 SDK(适用于 JS 和 Python)中,让您可以极其轻松地使用首选提供商运行各种模型。
Baseten (https://baseten.com/) 是一个 AI 基础设施平台,涵盖无服务器 AI、训练等能力。凭借丰富的领先模型目录,Baseten 让开发者无需繁琐设置即可轻松将各种 AI 功能集成到他们的应用程序中。
Baseten 支持广泛的模型类型——从 LLM 到文本转语音等等。作为此次初始集成的一部分,Baseten 在 Hugging Face 上发布了对对话和文本生成任务的支持,让用户可以访问流行的开放权重 LLM,例如 Kimi K3 (https://huggingface.co/moonshotai/Kimi-K3?inference_provider=baseten)、最新的 DeepSeek V4 Flash (https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731?inference_provider=baseten)、GLM-5.2 (https://huggingface.co/zai-org/GLM-5.2?inference_provider=baseten) 等等。对其他任务的支持即将推出!
点击此处 (https://huggingface.co/models?inference_provider=baseten&sort=trending) 查看 Baseten 支持的完整模型列表。
在 Hugging Face 上关注 Baseten:https://huggingface.co/baseten。
工作原理
在网站界面中
- 在您的用户账户设置中,您可以:
- 为您注册的提供商设置自己的 API 密钥。如果未设置自定义密钥,您的请求将通过 HF 路由。
- 按偏好对提供商进行排序。这适用于模型页面中的小部件和代码片段。
推理提供商
- 如前所述,调用推理提供商时有两种模式:
- 自定义密钥(调用直接前往推理提供商,使用您对应推理提供商自己的 API 密钥)
- 由 HF 路由(在这种情况下,您不需要提供商的令牌,费用直接计入您的 HF 账户,而不是提供商的账户)
推理提供商
- 模型页面会展示第三方推理提供商(与当前模型兼容的提供商,按用户偏好排序)
推理提供商
通过客户端 SDK
Baseten 可通过 Hugging Face SDK 使用——Python 的 huggingface_hub(>= 1.26.1)和 JavaScript 的 @huggingface/inference。
以下示例展示了如何通过 Baseten 使用最新的 DeepSeek V4 Flash (https://huggingface.co/blog/deepseek-ai/DeepSeek-V4-Flash-0731)。使用 Hugging Face 令牌 (https://huggingface.co/settings/tokens) 进行身份验证——请求将自动路由到 Baseten。
从您最常用的 Agent Harness
Hugging Face 推理提供商已集成到大多数 Agent Harness 中——包括 Pi、OpenCode、Hermes Agents、OpenClaw 等。这意味着您可以将 Baseten 托管的模型直接接入您最常用的工具,无需任何额外的胶水代码。点击此处 (https://huggingface.co/docs/inference-providers/en/integrations/index) 浏览完整的集成列表。
使用 Python
`` import os from openai import OpenAI
client = OpenAI( base_url=“https://router.huggingface.co/v1”, api_key=os.environ[“HF_TOKEN”], )
completion = client.chat.completions.create( model=“deepseek-ai/DeepSeek-V4-Flash-0731:baseten”, messages=[ { “role”: “user”, “content”: “Write a Python function that returns the nth Fibonacci number using memoization.” } ], )
print(completion.choices[0].message) ``
使用 JS
`` import { OpenAI } from “openai”;
const client = new OpenAI({ baseURL: “https://router.huggingface.co/v1”, apiKey: process.env.HF_TOKEN, });
const chatCompletion = await client.chat.completions.create({ model: “deepseek-ai/DeepSeek-V4-Flash-0731:baseten”, messages: [ { role: “user”, content: “Write a Python function that returns the nth Fibonacci number using memoization.”, }, ], });
console.log(chatCompletion.choices[0].message); ``
计费
对于直接请求,即当您使用推理提供商的密钥时,费用由相应的提供商收取。例如,如果您使用 Baseten API 密钥,费用将计入您的 Baseten 账户。
对于路由请求,即当您通过 Hugging Face Hub 进行身份验证时,您只需支付提供商的标准 API 费率。我们不收取额外加价,只是直接传递提供商的成本。(未来,我们可能会与提供商合作伙伴建立收入分成协议。)
重要提示!!️ PRO 用户每月可获得价值 2 美元的推理额度。您可以在不同提供商之间使用这些额度。🔥
订阅 Hugging Face PRO 计划 (https://hf.co/subscribe/pro),即可获得推理额度、ZeroGPU、Spaces 开发者模式、20 倍更高的限额等权益。
我们也会为已登录的免费用户提供少量配额的免费推理,但如果可能,请升级到 PRO!
反馈与后续步骤
我们非常期待您的反馈!在这里分享您的想法和/或评论:https://huggingface.co/spaces/huggingface/HuggingDiscussions/discussions/49
相似文章
DeepInfra 正式加入 Hugging Face Inference Providers 🔥
DeepInfra 已作为官方推理提供商加入 Hugging Face Hub,用户现在可以直接通过 HF 界面和 SDK 对 DeepSeek V4、Kimi-K2.6 等模型进行无服务器推理。
Hugging Face 上带视觉能力的 GLM 5.2
Baseten 在 Hugging Face 上发布了 GLM 5.2 Vision,将 Kimi k2.6 的视觉编码器集成到 GLM 5.2 模型中,解决了缺乏视觉能力的问题。
@DJLougen:这是一个巨大的承诺,一如既往地感谢@huggingface及其团队对本地机会的承诺
GLM-5.2现在可在接下来的6小时内通过Hugging Face Inference Providers免费使用,支持开源AI。
@philipkiely: https://x.com/philipkiely/status/2069212319746506968
Baseten 宣布推出针对 GLM-5.2 开源模型的世界最快 API,通过 NVFP4 量化、分离式推理等优化,实现每秒超过 280 个 token 的处理速度。
Kimi K3 已上线 HF Viewer!
Kimi K3 是一款新的人工智能模型,现已在 Hugging Face Viewer 上提供,方便访问和探索。