核心观点
- Baseten 成为 Hugging Face Hub 的官方 Inference Provider,在模型页面上直接提供无服务器推理,并同步接入 Python 与 JS 客户端 SDK。
- 首发支持对话与文本生成任务,覆盖 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等热门开源权重模型,更多任务类型将陆续上线。
- 两种计费模式可选:自定义 key 直连供应商(按供应商账号计费),或由 HF 路由(用 HF token 认证,直接走 HF 账户计费,无加价)。
- 与主流 Agent Harness(OpenClaw、Hermes Agent、Pi、OpenCode 等)直接集成,模型可即插即用,无需额外胶水代码。
内容精讲
Hugging Face Hub 的 Inference Providers 生态再添一员。Baseten 是一家 AI 基础设施平台,覆盖无服务器推理、训练等能力,拥有大量前沿模型目录。它的入驻意味着:开发者可以在 HF 模型页面上直接调用 Baseten 托管的模型,省去自己搭建推理栈的步骤。
**入口无处不在。** 集成分三个层面:网页 UI 层面,用户在账户设置里可为各供应商配置自己的 API key,也可以调整供应商偏好顺序(影响模型页面上组件和代码片段的默认排序);SDK 层面,Python 的 huggingface_hub(≥1.26.1)与 JS 的 @huggingface/inference 均已支持;Agent 生态层面,Pi、OpenCode、Hermes Agents、OpenClaw 等主流 Agent Harness 都已集成 Inference Providers,意味着把 Baseten 托管的模型插进常用工具,不需要任何额外粘合代码。
**两种调用模式,分清账从谁走。** 自定义 key 模式:调用直达推理供应商,使用你为该供应商申请的 API key,账单记在供应商账号(如 Baseten)名下。HF 路由模式:用 Hugging Face token 认证即可,请求自动路由到对应供应商,费用直接从 HF 账户扣除——不需要供应商侧的 token,且官方明确不收取额外加价,只原样传递供应商成本。对开发者来说,路由模式大幅降低了试用门槛:注册 HF 账号就能跑 DeepSeek V4 Flash 这类模型。
**一行代码切换模型。** 示例展示了用 OpenAI 兼容协议调 DeepSeek-V4-Flash-0731 的完整代码:把 base_url 指向 `https://router.huggingface.co/v1`,API key 用 `HF_TOKEN`,模型名写成 `deepseek-ai/DeepSeek-V4-Flash-0731:baseten`——后缀 `:baseten` 指定供应商。同样的调用范式适用于 Python 和 JavaScript,这也是 Agent 编程工作流里最常见的接入方式。
**首发阵容与福利。** Baseten 首批支持 conversational 与 text-generation 两类任务,可用的开源权重模型包括 Kimi K3(2.8T 多模态)、DeepSeek V4 Flash(304B 文本生成)、GLM-5.2(753B)等;其余任务类型将陆续开放。对于 HF PRO 用户,每月有 2 美元 Inference 额度可用于各供应商,配合零 GPU 配额、20 倍速率上限等权益;免费登录用户也有小额免费推理配额。
**为什么这值得关注。** Inference Providers 正在把「模型市场」变成「算力市场」:同一个模型,多家供应商托管、用户按偏好与价格自选,市场机制自然优化价格与服务。对开源模型生态而言,这是让模型在真实生产负载里被持续验证与消费的基础设施——Baseten 的加入丰富了选择,也让 DeepSeek、Kimi、GLM 这些国内开源模型的全球调用路径更通畅。
阅读价值
对 AI 应用开发者,这是一份即用型接入指南:SDK、模式选择、计费差异一步到位,Agent 工作流里接模型的成本被压到最低;对关注开源模型商业化的读者,它展示了「多供应商托管」如何重塑开源模型的分发与消费方式。

内容与图片版权归原作者所有 · 原文: https://huggingface.co/blog/baseten