Hugging Face 又给自己的推理路由市场添了一个新供应商:Baseten 正式上线为 Inference Provider,首批开放对话和文本生成任务,模型清单里挂着 Kimi K3、DeepSeek V4 Flash、GLM-5.2 这些名字。官方通稿写得挺热闹,说 Baseten 覆盖"从 LLM 到语音合成的广谱模型类型",但翻一下官方文档就会发现,这次真正接进来的只有聊天和文本生成——语音、视觉这类能力压根还没上线。这不是文字游戏,是两份材料对不上号的落差。
这也不是 HF 第一次干这种事。这两年 HF 一直在把 Hub 从单纯的模型托管,改造成一个能随时切换供应商的推理市场,DeepInfra、Scaleway 早前都是这么被接进来的。Baseten 是新面孔,玩法却不新。
怎么用、花谁的钱
在模型页面选 Baseten,有两条路。一条是自己去 Baseten 官网注册、拿自己的 API Key,调用直接算在 Baseten 账户上;另一条是用 HF Token 走"路由计费",不用管 Baseten 怎么收费,账单直接记在 HF 账户,HF 自己说不加价,原价转发。
走路由计费得先申请一个带"Make calls to Inference Providers"权限的细粒度 Token,不是随手拿个默认 key 就能用。免费用户每月能领 0.10 美元推理额度,PRO 用户是 2 美元,企业/团队按座位算也是 2 美元一份——这笔钱在所有接入的供应商之间通用,不是 Baseten 专属。
0.10 美元一个月,对着动辄按 token 计费的大模型,基本就是让免费用户尝一口鲜的量,谈不上日常使用。真要常态化调用,还是得升级 PRO,或者自己去 Baseten 开账号。
广谱能力,兑现了一半
官方通稿的措辞是 Baseten "supports a broad spectrum of model types - from LLMs to text-to-speech and more"。听着像是这次接入把 Baseten 的全部能力都搬上了 HF。翻开 HF 自己的 provider 文档,目前 Baseten 在 Hub 上能调用的,只限对话补全和文本生成两类任务,覆盖 LLM 和视觉语言模型,通稿里提到的语音、图像能力还没影子。
想用哪个模型,也别照抄通稿里列的那几个名字。官方自己都提醒,可用模型清单会随时变化,得去实时的模型筛选页面查,不是看一篇发布通稿就能定死的。这是很典型的一种节奏:先把故事讲圆,能力再慢慢补上。
Baseten的算盘和HF的算盘不是一个算盘
Baseten本身不是靠token计费起家的公司。它过去的主业是专属部署——按加速器时长收费,服务的是需要定制化推理、训练管线的企业客户,跟 Together AI、Fireworks AI 这类原生"按token卖调用"的serverless供应商,商业模式底层不一样。这次进 HF,是 Baseten 第一次以"serverless、按token"的身份,站进一个完全按token计价、且明确"零markup"的市场里。
HF 在博客里自己写了一句容易被忽略的话:目前对路由计费不抽成,但"未来可能会跟供应商建立收入分成协议"。翻译过来就是,现在这个阶段,HF拿免流量费换用户习惯,Baseten拿零利润换分发入口。谁都没在这笔生意里挣到钱,挣到的是位置。
现在挣的不是钱,是位置。
这套打法眼熟。铁路公司早年抢线路,常常先亏本铺轨,等运量起来再谈运价和分成。眼下 HF 和 Baseten 的关系,更像是这套逻辑的推理服务版本:先把 Baseten 的模型摆上 Hub 货架,让开发者习惯"选Baseten"这个选项,分成协议是以后的事,现阶段是纯引流。
- 风险.Baseten原有的专属部署业务利润率更高,如果serverless按token这条线长期不挣钱,等于拿更贵的企业业务补贴HF渠道的流量,能撑多久取决于HF什么时候把分成协议落地。
对开发者来说,这次接入确实省心——一个 HF Token 就能试 Kimi K3、DeepSeek V4 Flash 这些开源模型,不用单独开 Baseten 账号。但省心的另一面,是免费额度小得基本等于试用装,真要常态化调用,迟早得直接跟供应商结算。HF 这一层路由更像入口,不是终点。
