一家未直接开发AI的公司,年收入已达1亿美元。

这项商业成就的背后是Arena,一个正吸引着硅谷各大AI巨头激烈竞争的平台。

Arena的前身是Chatbot Arena,最初由加州大学伯克利分校的团队于2023年发起的一项开放研究项目。

令人意想不到的是,该平台在极短的时间内,已成为掌握大模型关键评估地位的核心场所。

就在近期,Arena商业化服务推出仅8个月,年化营收便突破1亿美元,标志着一个新的里程碑。

ChatGPT、Claude等模型在此“刷榜”,Arena成为大模型评测舞台

Arena对许多人而言并不陌生。

它最受关注的特点是,通过用户真实的匿名测试,构建了一个大模型排行榜。

其玩法极其简单,却又充满竞争性:用户输入指令,系统会随机选择两个匿名模型同时生成回应;随后,用户选择认为表现更优的模型。

平台收集海量此类投票,形成类似Elo的排名系统。

这种“擂台赛”的机制,使其成为全球AI爱好者和开发者聚集的热门地点。

迄今为止,该平台已积累超过1000万次用户评测、7亿次对话、8200万张投票,每月吸引超过1000万访客,遍布全球150多个国家。

更重要的是,平台上约80%的用户提问每天都是全新的,任何模型都无法提前“背诵”答案。

其评测的含金量有多高?

OpenAI、谷歌、Anthropic、Meta等竞争激烈的顶尖科技公司,都将自家旗舰模型提交至Arena接受社区的检验。

甚至有报道称,OpenAI在GPT-5正式发布前,曾以代号“summit”在此平台上进行秘密测试。

这意味着,硅谷最先进的模型,都在等待一个来自伯克利学生项目的“盖章认证”。

1亿美元营收是如何实现的?

那么,一个免费的排行榜是如何转化为1亿美元的营收来源的呢?

去年9月,Arena推出了名为“AI Evaluations”的商业服务。

模型开发商及大型企业可以付费,利用Arena庞大的用户社区对自家模型进行深度评估,从而获得仅通过基准测试无法获得的“真实世界”性能分析。

这套服务被描述为“面向真实世界的CI/CD系统”。

一旦模型准备公开发布,Arena会免费为社区进行评测;

而企业如果希望了解其模型在实际用户手中的优势、劣势以及可能出现的“胡说八道”情况,则需要付费。

这是一种典型的“卖水人”商业模式——在淘金热中,卖水或工具的往往比挖金子的更赚钱。

大模型厂商之间的竞争越发激烈,对模型性能的极致追求也随之增长,这使得对这类“上线后调优”服务的需求日益旺盛。

Arena恰好处于所有参与者都必须经过的关键节点。

三位伯克利人,打造最赚钱的AI生意

Arena的前身是Chatbot Arena。

更早之前,它隶属于伯克利大学著名的LMSYS研究小组。

两位伯克利大学的室友,最初只是想创建一个中立平台,让大语言模型能够进行公平的比较。

谁也没想到,这个学生项目会迅速发展成为一家独角兽公司。

项目进展迅速:2025年春季,该项目从大学独立出来,正式成立公司,并在几周内获得了1亿美元的种子轮融资,估值达6亿美元。

几个月后,商业产品上线,仅用四个月时间,年化营收就飙升至3000万美元。

随后,今年1月,由Felicis和UC Investments领投的1.5亿美元A轮融资到位,投后估值定格在17亿美元。

项目的核心团队由三位杰出人士组成。

CEO Anastasios Angelopoulos,拥有深厚的数学背景。

他在斯坦福大学攻读电子工程本科期间,师从凸优化领域的知名学者Stephen Boyd。

在伯克利大学攻读博士学位时,他的导师是机器学习领域的泰斗Michael I. Jordan和计算机视觉领域的权威Jitendra Malik。

他多年来一直专注于如何对“黑箱”模型进行在数学上严谨且可靠的评估。

CTO Wei-Lin Chiang是开源社区的知名人士,他曾开发出广受欢迎的开源聊天机器人Vicuna。

他在伯克利大学师从Ion Stoica,专注于分布式系统研究,并曾在谷歌、亚马逊、微软等公司有过工作经历。

2022年底ChatGPT公测之际,他暂停了此前的研究,全身心投入到Arena项目中。

他的搭档Angelopoulos形容他对这个项目的投入是“一份用爱发电的事业”。

为了这个项目,两人投入了大量时间,甚至选择住在一起。这两位室友共同构建了一家估值17亿美元的公司。

第三位联合创始人是著名的伯克利教授、Databricks联合创始人Ion Stoica,他在项目于2025年4月公司化之前一直担任顾问。

“裁判”比“选手”更重要

Arena最新的举措是推出了“Agent Mode”(智能体模式)。

该模式的评测内容已不再局限于“哪个聊天机器人表现更好”,而是涵盖了数百万用户正在使用智能体完成的真实任务,例如编写代码、调试错误、进行研究、分析文档等,这些任务通常涉及大量的工具调用和多轮交互。

Arena开始采用任务完成率、幻觉率等客观指标进行评分,这已经远远超出了最初“人类偏好投票”的范畴。

AI正从“聊天机器人”演变为能够独立执行任务的“智能体”,其任务的复杂性和重要性都在不断提升。

评测,成为了人类深入了解AI内部机制的关键手段。

Arena这项业务能够达到1亿美元的收入和17亿美元的估值,其核心逻辑在于押注于评测的重要性将日益增加,并且其价值也将随之提升。

然而,最终所有人都将面临一个共同的问题:当机器开始自主出题时,谁才有资格进行评判?