格蕾丝·李(Grace Li)团队2025年临近毕业时,在捣鼓一个AI游戏引擎。模型能把游戏做出来,能跑、能操作,但没人觉得好玩。问题随之而来:AI怎么判断自己做的东西好不好玩?这个具体的困惑,后来长成了一门自称年化营收6000万美元的生意——DesignArena。8月3日,母公司Intelligence宣布完成790万美元种子轮,由Index Ventures领投,Conviction(Sarah Guo、Mike Vernal)、A*、Valkyrie等跟投。

速读:这轮融资在赌什么

  • 融资主体.Intelligence(DesignArena母公司),790万美元种子轮
  • 运作机制.用户在网站发起需求(网站、图片等十几种视觉格式),平台把不同模型的产出做成"A vs B"盲选,让用户排出好坏
  • 官方口径.5.3M用户,ARR达6000万美元
  • 收入来源.真正付费方是前沿AI实验室,买的是实时人类偏好数据;平台还能按地区、时间追踪审美变化——李提到,亚洲用户的网页仪表盘设计偏好明显更"满"
DesignArena 怎么赚钱 用户发需求 网站/图片 十余种格式 A/B盲选 多模型对比 只挑最好看的 卖给实验室 追踪地区差异 自称ARR6000万

为什么审美成了模型的新瓶颈

自动化基准能测代码跑不跑得通、图片符不符合提示词,却很难回答"好不好看""好不好用"这种主观问题。上周Hugging Face遭遇的入侵事件提了个醒:自动评测机制一旦被摸透规则,就有被刷分的空间。人类反馈被寄希望于补上这个缺口。

"天下熙熙,皆为利来,天下攘攘,皆为利往",司马迁这句话放在DesignArena的商业逻辑里意外贴切——用户不在乎自己在给哪个模型投票,只想拿到最好的输出;实验室愿意为这份"诚实"付费。各取所需,交易成立。

但多数票不等于客观真理。这一批用户、这套界面、这些提示词下投出的偏好,换一批样本、换一个地区,结果可能完全不同。人类评测同样能被摸清规律去优化讨好,和自动基准被刷分,本质上是同一种风险,只是换了个作弊对象。


我的判断:护城河不是投票量

Yupp是最直接的参照。它融过3300万美元(来自a16z crypto的Chris Dixon),也拿下过前沿模型客户,声称有130万用户,今年初照样关了门。同一条赛道里,LM Arena今年1月刚拿到1.5亿美元A轮,活得很好。

融资规模不等于活下来 Yupp 3300万美元 已关停 Intelligence 790万美元 运营中 LM Arena 1.5亿美元 运营中 数据来源:公司公告与公开融资信息

三家公司证明的是同一件事:人类反馈是真需求,前沿实验室愿意为此付钱;但用户规模、投票总量从来不是护城河。真正决定生死的,是数据质量能不能持续帮模型改进、实验室会不会续费、公司能不能把偶发的付费意向变成稳定收入。

  • 风险.5.3M用户、6000万美元ARR都是Intelligence自己的说法,目前没有第三方数据佐证,也不能据此推算公司已经盈利。

DesignArena讲的故事很讨喜:让普通人的审美偏好,变成AI模型进化的燃料。但故事讲得好不好听,和这门生意能不能长久续费,是两件事。

审美这门生意,赢在用户投票,输也在用户投票。

Yupp的墓碑立在那儿,提醒的正是这一点。