中文精炼导读
核心观点
- Hugging Face 宣布 Baseten 正式成为其 Inference Providers(推理提供商)生态的一员:开发者可以直接在 Hub 的模型页面、SDK 和各类 Agent Harness 里,通过 Baseten 无服务器调用开源模型。
- 首批集成聚焦对话与文本生成任务,覆盖 Kimi K3、最新 DeepSeek V4 Flash、GLM-5.2 等主流开源权重 LLM,更多任务类型将陆续开放。
- 两种调用模式并存:使用自定义 key 时请求直达提供商(按提供商账户计费);由 HF 路由时无需提供商 token、费用直接记在 HF 账户上,且无任何加价——HF 只是原价转付提供商成本。
- 接入成本极低:Python(huggingface_hub ≥1.26.1)与 JavaScript(@huggingface/inference)SDK 开箱即用,把 base_url 指向 router.huggingface.co/v1 并用 HF token 认证即可自动路由到 Baseten;Pi、OpenCode、Hermes Agents、OpenClaw 等大多数 Agent Harness 也已原生集成。
- 福利说明:PRO 用户每月可获得价值 2 美元的推理额度,可在各提供商间通用;登录的免费用户也有小额免费配额。

内容精讲
这篇文章是 Hugging Face 官方向社区介绍 Baseten 入驻 Inference Providers 生态的公告。Baseten 是一个覆盖无服务器 AI、训练等能力的 AI 基础设施平台,拥有丰富的前沿模型目录,让开发者能以最少配置把多种 AI 能力集成进应用,模型类型从 LLM 到文本转语音等非常广泛。此次初始集成中,Baseten 在 Hugging Face 上先支持"对话(conversational)"与"文本生成(text-generation)"两类任务,让用户能直接访问 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等热门开源权重 LLM,后续会逐步支持更多任务类型。
接入方式从三个层面展开。在网站 UI 里,用户可以在账户设置中为已注册的提供商设置自己的 API key(不设自定义 key 时请求会由 HF 路由),还可以按偏好给提供商排序——这个偏好顺序会应用到模型页面的 widget 和代码片段上;模型页面会展示与当前模型兼容的第三方推理提供商,并按用户偏好排序。在客户端 SDK 层面,Baseten 可通过 Python 的 huggingface_hub(≥1.26.1)和 JavaScript 的 @huggingface/inference 直接使用:用 Hugging Face token 认证,请求会自动路由到 Baseten。文章给出了具体示例——用 OpenAI 兼容的客户端把 base_url 指向 `https://router.huggingface.co/v1`、用 HF_TOKEN 作为 api_key,然后以 `deepseek-ai/DeepSeek-V4-Flash-0731:baseten` 这样的模型标识("模型名:提供商名")发起 chat completion 调用。第三层是 Agent Harness 集成:Hugging Face Inference Providers 已集成进 Pi、OpenCode、Hermes Agents、OpenClaw 等大多数 Agent 框架,意味着你可以把 Baseten 托管的模型直接插进自己惯用的工具,无需任何胶水代码。
计费方面文章讲得很清楚。直连模式:使用推理提供商自己的 key(如 Baseten key)时,由对应提供商账户计费。路由模式:通过 Hugging Face Hub 认证时,只付标准的提供商 API 费率——HF 不加任何加成,只是把提供商成本原样转付(未来可能会与提供商伙伴建立分成协议,但目前没有)。对 PRO 用户还有一项福利:每月获得 2 美元价值的 Inference credits,可在各提供商间通用;HF 也向登录的免费用户提供带小额配额的自由推理,同时建议有条件的用户升级 PRO(可解锁 Inference credits、ZeroGPU、Spaces Dev Mode、20 倍更高的限额等)。
文章结尾邀请社区反馈(讨论区链接),并列出了更多相关文章——DeepInfra 与 Scaleway 加入 Inference Providers 的公告,说明这一生态正在持续扩展。对开发者而言,这篇公告的实际意义是:又多了一个"零胶水、零额外成本"调用开源模型的渠道,且与现有 HF 工具链完全打通。
阅读价值
适合正在用 Hugging Face 生态做推理、或想低成本切换开源 LLM 提供商的后端与 AI 应用开发者:文章清楚说明了 Baseten 接入后的两种调用模式、计费规则与 SDK/Harness 用法,你可以用几行代码在 router.huggingface.co 上直接切换或组合多个提供商,无需各自注册和适配;对"如何统一管理多提供商推理"有直接参考价值。
本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://huggingface.co/blog/baseten