一家未直接开发AI的公司,年收入已达1亿美元。
这项商业成就的背后是Arena,一个正吸引着硅谷各大AI巨头激烈竞争的平台。
Arena的前身是Chatbot Arena,最初由加州大学伯克利分校的团队于2023年发起的一项开放研究项目。
令人意想不到的是,该平台在极短的时间内,已成为掌握大模型关键评估地位的核心场所。
就在近期,Arena商业化服务推出仅8个月,年化营收便突破1亿美元,标志着一个新的里程碑。
ChatGPT、Claude等模型在此“刷榜”,Arena成为大模型评测舞台
Arena对许多人而言并不陌生。
它最受关注的特点是,通过用户真实的匿名测试,构建了一个大模型排行榜。
其玩法极其简单,却又充满竞争性:用户输入指令,系统会随机选择两个匿名模型同时生成回应;随后,用户选择认为表现更优的模型。
平台收集海量此类投票,形成类似Elo的排名系统。
这种“擂台赛”的机制,使其成为全球AI爱好者和开发者聚集的热门地点。
迄今为止,该平台已积累超过1000万次用户评测、7亿次对话、8200万张投票,每月吸引超过1000万访客,遍布全球150多个国家。
更重要的是,平台上约80%的用户提问每天都是全新的,任何模型都无法提前“背诵”答案。
其评测的含金量有多高?
OpenAI、谷歌、Anthropic、Meta等竞争激烈的顶尖科技公司,都将自家旗舰模型提交至Arena接受社区的检验。
甚至有报道称,OpenAI在GPT-5正式发布前,曾以代号“summit”在此平台上进行秘密测试。
这意味着,硅谷最先进的模型,都在等待一个来自伯克利学生项目的“盖章认证”。
1亿美元营收是如何实现的?
那么,一个免费的排行榜是如何转化为1亿美元的营收来源的呢?
去年9月,Arena推出了名为“AI Evaluations”的商业服务。
模型开发商及大型企业可以付费,利用Arena庞大的用户社区对自家模型进行深度评估,从而获得仅通过基准测试无法获得的“真实世界”性能分析。
这套服务被描述为“面向真实世界的CI/CD系统”。
一旦模型准备公开发布,Arena会免费为社区进行评测;
而企业如果希望了解其模型在实际用户手中的优势、劣势以及可能出现的“胡说八道”情况,则需要付费。
这是一种典型的“卖水人”商业模式——在淘金热中,卖水或工具的往往比挖金子的更赚钱。
大模型厂商之间的竞争越发激烈,对模型性能的极致追求也随之增长,这使得对这类“上线后调优”服务的需求日益旺盛。
Arena恰好处于所有参与者都必须经过的关键节点。
三位伯克利人,打造最赚钱的AI生意
Arena的前身是Chatbot Arena。
更早之前,它隶属于伯克利大学著名的LMSYS研究小组。
两位伯克利大学的室友,最初只是想创建一个中立平台,让大语言模型能够进行公平的比较。
谁也没想到,这个学生项目会迅速发展成为一家独角兽公司。
项目进展迅速:2025年春季,该项目从大学独立出来,正式成立公司,并在几周内获得了1亿美元的种子轮融资,估值达6亿美元。
几个月后,商业产品上线,仅用四个月时间,年化营收就飙升至3000万美元。
随后,今年1月,由Felicis和UC Investments领投的1.5亿美元A轮融资到位,投后估值定格在17亿美元。
项目的核心团队由三位杰出人士组成。
CEO Anastasios Angelopoulos,拥有深厚的数学背景。
他在斯坦福大学攻读电子工程本科期间,师从凸优化领域的知名学者Stephen Boyd。
在伯克利大学攻读博士学位时,他的导师是机器学习领域的泰斗Michael I. Jordan和计算机视觉领域的权威Jitendra Malik。
他多年来一直专注于如何对“黑箱”模型进行在数学上严谨且可靠的评估。
CTO Wei-Lin Chiang是开源社区的知名人士,他曾开发出广受欢迎的开源聊天机器人Vicuna。
他在伯克利大学师从Ion Stoica,专注于分布式系统研究,并曾在谷歌、亚马逊、微软等公司有过工作经历。
2022年底ChatGPT公测之际,他暂停了此前的研究,全身心投入到Arena项目中。
他的搭档Angelopoulos形容他对这个项目的投入是“一份用爱发电的事业”。
为了这个项目,两人投入了大量时间,甚至选择住在一起。这两位室友共同构建了一家估值17亿美元的公司。
第三位联合创始人是著名的伯克利教授、Databricks联合创始人Ion Stoica,他在项目于2025年4月公司化之前一直担任顾问。
“裁判”比“选手”更重要
Arena最新的举措是推出了“Agent Mode”(智能体模式)。
该模式的评测内容已不再局限于“哪个聊天机器人表现更好”,而是涵盖了数百万用户正在使用智能体完成的真实任务,例如编写代码、调试错误、进行研究、分析文档等,这些任务通常涉及大量的工具调用和多轮交互。
Arena开始采用任务完成率、幻觉率等客观指标进行评分,这已经远远超出了最初“人类偏好投票”的范畴。
AI正从“聊天机器人”演变为能够独立执行任务的“智能体”,其任务的复杂性和重要性都在不断提升。
评测,成为了人类深入了解AI内部机制的关键手段。
Arena这项业务能够达到1亿美元的收入和17亿美元的估值,其核心逻辑在于押注于评测的重要性将日益增加,并且其价值也将随之提升。
然而,最终所有人都将面临一个共同的问题:当机器开始自主出题时,谁才有资格进行评判?