工程团队每到月底核算账单,最刺眼的往往不是服务器算力,而是编码智能体调用的顶级闭源模型费用。改动一行缩进与推翻重构整个模块,走的是同一套昂贵的旗舰通道,月度开销动辄奔向数万乃至数百万美元。Together AI 选在此时推出免费开源命令行工具 Together Link,目标直截了当:保留成熟的智能体外壳,把底层心脏换成自家的开源推理阵列,号称能直接压下 50% 到 80% 的模型开支。

这种借壳生蛋的打法看似精准击中了工程预算的痛点,但在轻巧的单行安装背后,无论是官方自相矛盾的技术口径,还是实际任务里的隐性重试成本,都让这次算力替换远没有宣传中那般无痛。

一键换心背后的算力战法

Together Link 的安装极度精炼。开发者在 macOS 或 Linux 终端敲下一行 curl 命令,脚本就会在 ~/.local/bin 完成部署,底层依赖 Bun 运行时。它不启动任何常驻本地守护进程,也不占用本地端口,而是为每次终端会话注入临时配置,退出即焚。

这套工具目前直接覆盖了主流终端与桌面客户端,包括 Claude Code、Claude Desktop(含 Cowork 与 Code 功能)、Codex CLI、ChatGPT Desktop、OpenCode 2,以及需要依赖 Node.js 22.19+ 的 Pi Code 0.80.8+。它切入的时机很讨巧:开发者早已习惯了 Claude Code 的操作手感与工具链路,但苦于闭源模型居高不下的调用单价。

三种代码网关路线对比:控制权与便利性的权衡 Together Link 架构:云端托管网关 配置:单行命令 / 无本地代理 费用:仅付推理费 / 零过路费 生态:绑定自家托管开源矩阵 定位:自营算力闭环管道 OpenRouter 架构:多供应商云聚合 配置:环境变量与手动脚本 费用:基础费 + 5.5% 充值抽成 限制:BYOK 月上限 $25,000 定位:多源分发聚合集市 LiteLLM / 本地网关 架构:自建本地 / 私有代理 配置:需维护服务与本地端口 费用:软件开源免费 / 运维自理 生态:任意支持 OpenAI 格式模型 定位:重度运维自建网关

相比于自建 LiteLLM 需要维护本地端口与服务进程,或是 OpenRouter 在基础调用之外还要加收 5.5% 的充值手续费,Together AI 索性将自身云网关封装成了免费的 MIT 协议客户端。这并非做慈善,而是要在开发者入口建立自己的收费站。

数据显示,截至 2026 年 9 月 30 日,Together 已经在 OpenRouter 平台上吃下了 DeepSeek V4.1 Flash 40.8% 的托管份额,GLM 5.3 Flash 占 28.2%,Kimi K3 也拿下了 23.1%。通过 Together Link,它试图跳过中间平台,把这些高频代码流量直接装进自家的推理集群。

托管模型输入单价 (每百万Token)缓存输入单价输出单价 (每百万Token)宣称上下文规格
GLM 5.3$1.40$0.26$4.401M
DeepSeek V4.1 Flash$0.30$0.006 (标为$0.01)$1.201M
Qwen 3.8-2.4T-A95B$2.00$0.25$6.001M
MiniMax M3$0.30$0.06$1.20落地页标注 512K

官方文档打架与参数缩水

但仔细翻阅其技术文档与落地页,会发现这款处于测试阶段的工具充斥着口径矛盾。

最致命的冲突发生在核心功能 Auto Router 上。官方发布博客与外宣通稿声称,自动路由根据每个会话的首个任务进行单次决策,以此确保长对话中的 Prompt Caching 能够持续命中并降低计费。然而在官方开发文档中,同一机制的描述却变成了按每次请求进行动态路由。如果每次请求都在不同参数量或供应商的模型之间横跳,开发者精心维护的上下文缓存机制就会直接失效,账单也将脱离预期。

宣传叙事与技术事实之间的三处认知断层 路由判定粒度 宣传口径:会话级 (Session) 首个任务定调,保留上下文缓存 文档事实:请求级 (Per-Request) 逐轮重新分流,缓存可能反复失效 上下文真实规格 宣传口径:全系 1M 上下文 统称百万级长窗口无损承接 落地页事实:MiniMax 实为 512K 规格缩水一半,超长代码库易截断 Kimi K3 定价标准 早期快照:$2.70 / $13.50 作为低价平替的核心宣传抓手 现行账单:$3.00 / $15.00 主定价页基准上调,节流预期收窄

第二处裂痕在模型规格的宣传掩饰。各路资讯通篇高调宣称所有模型均为 1M 统一上下文,但翻开其独立的落地页表格,MiniMax M3 的上下文窗口赫然写着 512K。当开发者将整个微服务工程或上万行测试套件灌入终端时,这种规格落差会直接引发上下文硬截断。

连核心主打的 Kimi K3,计费基准也出现过摇摆。早期宣传快照中输入标为 $2.70、输出 $13.50,而主定价页与最新模型页面则更新为输入 $3.00、输出 $15.00。在分厘必争的推理账单面前,口径的不统一暴露出产品仓促上线的痕迹。

  • 提醒.Auto Router 的判定粒度若在请求级摇摆,长代码任务的缓存命中率可能断崖式下跌,实际调用成本可能远超纸面测算。

隐性重试与数据留存暗雷

单看 Token 标价很容易让人陷入省钱的幻觉:GLM 5.3 的输入输出价格确实大幅低于闭源主力模型。但编码智能体不是普通的聊天窗口,它的本质是深度的多轮工具调用。

换心不等于换来了执行力,工具调用的重试代价足以吃空单价优势。

Claude Code 原生设计基于 Anthropic 模型对协议与环境反馈的精细控制。当把底层换成非原生模型时,开源模型在复杂文件定位、环境自省与 MCP 工具链交互中更容易出现解析偏差。一次原本两轮交互就能解决的重构任务,若因指令遵循偏差导致智能体连续重试三四次,输入与输出 Token 翻倍累加,原本的单价优势就会被消耗殆尽。

更现实的阻碍藏在合规条款里。工程团队的核心资产是私有代码。Together 平台默认开启 Prompt 与 Response 的数据存储机制以用于其产品改进,且仅允许企业管理员在后台手动开启零数据留存。这意味着开发者只要在终端一键启动,日常排查的业务逻辑、秘钥配置文件甚至专有算法都会直接流向云端存储库。

古人讲兵无常势,水无常形。在基础设施层借用巨头的交互壳子兜售自家算力,是技术扩张期常见的权术。然而,开源模型的工具链磨合需要周期,企业对代码隐私的底线更难容忍默认留存的暗门。

  • 建议.在生产环境中接入此类工具前,必须由管理员先行确认开启零数据留存,并在小型任务中充分评估工具调用的真实成功率。

眼下 Together Link 的 GitHub 代码库尚处于零 Issues 阶段,缺乏足够的第三方安全审计。Anthropic 与 OpenAI 是否会在后续客户端版本中升级鉴权协议来封堵这种借壳行为,同样是悬在头顶的变数。算力单价的降幅固然诱人,但真正决定工程效率的,从来不仅是单张发票上的折扣。