成立刚满一年,Fish Audio对外报出的数字是:800多万用户,年化经常性收入(ARR)2100万美元。周二,这家总部在Palo Alto的AI语音公司宣布完成5000万美元种子轮,由Coreline Ventures和今日资本领投。

这轮钱背后藏着一个转身:靠开源攒起来的公司,现在要拿真金白银去啃企业客户。它把最新最强的模型S2.1 Pro锁进了付费API,社区版本从没享受过这种待遇。声音像不像真人,已经不是这条赛道的分水岭;能不能把开源流量变成企业愿意长期付费的订单,同时把声音授权这块最容易翻船的地方补上,才是。

一年跑出的数字:融资、用户和产品线取舍

Fish Audio由前NVIDIA研究员Shijia Liao创立。他最初的动机很简单:市面上的语音合成"没有表情"。他在一张GPU上练出模型,随手开源,取名Fish Speech。

这个决定攒出了社区。GitHub上Fish Speech仓库现在有3.1万星标,被独立开发者和游戏工作室大量拿去用。

一年下来,公司交出的成绩单是这样:

Fish Audio 一年成绩单 800万+ 累计用户 $21M 年化经常性收入(ARR) $50M 种子轮融资 31,000+ GitHub 星标(Fish Speech)

这些数字都是公司自己披露的,没有第三方审计。用户活跃度、付费转化率,公司都没细分。

五个模型里,四个是语音生成,一个语音转文字。语音生成的三个开源,最新的S2.1 Pro只走付费API——这是公司第一次把最强的东西锁进收费墙。

模型类型数量开放策略
语音生成模型4个3个开源,最新S2.1 Pro仅付费API
语音转文字模型1个公司未详述开放策略

企业客户名单里有HeyGen、Sanas、Plaud。CEO Rissa Cao说的意思很直接:不同客户要的东西完全不一样。

客户/场景核心需求
HeyGen(AI数字人)真实感
游戏工作室表现力
LiveKit类语音代理低延迟、自然感

Sanas做实时语音转换,Plaud做AI硬件笔记本,两家的诉求更偏向可控性——细节能不能按需求调,比单纯"像不像真人"更重要。

Fish Audio打的差异化牌,是1.5万余种自然语言可控参数,加上投资人所说的更高训练效率。这套说法目前没有和ElevenLabs等对手做过统一测试,只能算公司自己的说法。

声音怎么来的:征集、下架和没补上的时间差

Fish Audio攒声音库的一种方式,是直接向用户征集,用了就给补偿——但具体分成比例,公司没有公开。几个月前,这套机制惹了麻烦:有创作者指控自己的声音被上传到平台,自己毫不知情。

公司当时的DMCA下架流程很慢。CEO Rissa Cao告诉TechCrunch,现在流程已经自动化:创作者提交语音样本或合同证明,3分钟内声音就能被下架。

3分钟解决的是"发现之后",没解决"发现之前"。任何人的声音都可能先被上传、先被使用,直到本人偶然撞见、提交申诉,才会被撤下。

把这套流程画出来,缺口在哪一眼就能看到:

声音授权流程:发现之前 vs 发现之后 未经同意 上传声音 平台持续 使用中 创作者 偶然发现 提交样本 或合同证明 3分钟内 下架 这段时间差,3分钟下架机制管不到

投资人Oskue Honda(Coreline Ventures)说得直白:社区驱动的模式要成为持久优势,前提是创作者信任平台——同意、透明和归属得写进产品设计,不能当事后补丁。这话像风险提示,其实是投资人给这轮钱设的及格线。

我的判断:护城河是授权秩序,不是模型效果

语音生成这条赛道,模型好不好听早就不是护城河。ElevenLabs、Cartesia、Speechify、Krisp全在拼参数和延迟,谁都能说自己更像真人。

Fish Audio真正要过的关,是能不能把开源攒下的800万用户,转成企业愿意持续付费的订单,同时把声音授权补上。这两件事是一个问题的两面:开源社区带来用户增长,也带来"谁的声音归谁管"这团乱账。企业客户越大,越在意合规,没人愿意用一段可能涉及侵权的声音去伺候自己的付费用户。

天下熙熙,皆为利来。创作者上传声音换补偿,平台开源换用户,企业付费换效率——这条链上每个人都在算自己的账。唯独授权和归属这一环,现在还是靠事后补救,不是靠事前约束。

对准备接入语音API的开发者和创业团队,实际动作很简单:先用开源模型本地跑一遍效果和成本,再决定要不要升级到S2.1 Pro的付费API。采购前问清楚声音来源和授权链条,拿不到书面授权凭证,就该把集成往后挪一挪,或者换一家能给出更完整版权凭证的供应商。

对关注创作者权益和平台治理的人,值得盯住的不是下架速度,而是审核有没有可能前置——比如上传前的声纹核验、公开的收益分成比例。3分钟下架再快,也只是善后。

5000万美元能买来更好的模型,买不来创作者的信任度自动生成。
  • 风险.未经同意上传的声音,只要没人发现,就可能一直被使用——3分钟下架解决不了这个时间差。

接下来最该盯的,是Fish Audio会不会公开收益分成比例、会不会把声纹核验做到上传之前,还有企业客户数量能不能撑住这2100万美元ARR的说法。

【锐评】开源换来的是流量,不是信任;这轮钱先买模型,账真正难还的是授权那一笔。