SemiAnalysis,一家专注于半导体研究的硅谷机构,公布了其内部大模型Token的实际使用成本,每百万Token仅需0.99美元。然而,更令人震惊的是,这部分Token支出已占据了员工总薪资的三成。

尽管这一比例看似不小,但其带来的产出效率远超过去所需的人力成本。平均每位员工每月消耗近50亿个Token,是Meta员工人均消耗量的五倍以上,核心贡献者的月消耗量甚至能达到1000亿。过去需要初级分析师花费数小时完成的Excel模型转换和财报图表制作,现在仅需几分钟和几美元即可搞定。

SemiAnalysis认为,这并非简单的10%效率提升,而是正在重塑专业服务业的经济模型。研究公司、对冲基金、律所等依赖脑力劳动的行业,Token支出占薪资的两到三成似乎只是时间问题。

英伟达CEO黄仁勋对此深感紧迫。他在GTC大会上表示,如果一位年薪50万美元的工程师,年底Token消费不到25万美元,他将“彻底抓狂”。为此,他计划为每位英伟达工程师提供相当于半年工资的Token预算,并让7.5万名员工与750万个AI智能体协同工作。黄仁勋强调,不使用AI就像芯片设计师坚持使用纸笔一样落伍,Token已不再是工具,而是新时代的“生产资料”。

与此同时,硅谷的一些大型科技公司却为AI账单而烦恼。Uber就是一个典型例子。去年底,该公司向5000名工程师推广Claude Code,并设立了使用排行榜。结果,2月份32%的工程师使用率迅速攀升至4月份的95%,其中70%的代码提交由AI生成,而全年预算却在4月份就已耗尽。Uber的CTO不得不重新制定预算,随后公司更是设置了每位员工每月1500美元的Token使用上限,超出部分需特批。然而,Uber的COO Andrew Macdonald坦承,AI使用量的增长与消费者功能创新之间的关联尚未明确。

微软也面临类似困境。据报道,该公司正取消大部分Claude Code许可证,转而使用自家的GitHub Copilot CLI,原因在于AI的支出速度超过了其带来的产出。英伟达应用深度学习副总裁Bryan Catanzaro指出,对其团队而言,计算成本已远超员工成本。

MIT2024年的一项研究显示,在以视觉工作为主的岗位中,只有23%的情况下AI自动化在经济上是划算的,其余77%的情况下雇佣人类员工更具成本效益。甚至有工程师抱怨AI智能体在使用过程中“毁掉了他的数据库和网络”,认为这是“过度使用”的代价。

当前,硅谷正经历AI经济学的分裂期:一方面是技术带来的生产力飞跃,另一方面是账单的同步飙升。

然而,SemiAnalysis的核心观点是,当前的价格只是暂时的,成本的下降趋势才刚刚开始。

从软件层面看,通过DeepSeek R1在B300上的优化,如wideEP、disagg与MTP等纯软件技术的应用,单GPU的吞吐量能够从基线的1000 tokens/秒提升至14000 tokens/秒,实现了14倍的增长,这完全是通过代码优化实现的。

在硬件层面,优化配置的GB300 NVL72的吞吐量是H100的17倍,若切换至FP4精度,甚至可达32倍。

虽然Opus 4.7的标价为输入5美元/百万Token,输出25美元/百万Token,但由于智能体工作负载的输入输出比高达300:1,并结合超过90%的缓存命中率,实际混合成本被控制在0.99美元,远低于标价的五分之一。

综合软件和硬件的进展,可以得出结论:大模型的利润率提升并非偶然的定价策略,而是结构性的趋势。Anthropic今年的ARR从90亿美元飙升至440亿美元以上,毛利率也从38%跃升至70%以上,这表明Token价格的下降并未影响卖家的盈利能力。Gartner在3月份的报告预测,到2030年,万亿参数大模型的推理成本将比2025年下降超过90%。SemiAnalysis明确预测,2027年的Token价格将继续走低。

尽管全球科技公司今年在AI方面的资本开支已宣布达到7400亿美元,比去年增长69%,但科技行业的裁员速度已超过去年全年。Goldman Sachs的首席经济学家指出,AI对经济的实际影响迄今为止基本为零。这并非AI的不足,而是基础设施革命的必经阶段:先投资建设,再等待效益显现。电力、互联网的发展历程皆是如此,AI也不例外,只是此次管道铺设和水流到来的速度是前所未有的。

SemiAnalysis已站在效益显现的一方,其30%的薪资投入换来了数倍的产出杠杆,且成本曲线仍在快速下降。对于其他公司而言,是现在就积极参与,还是等待成熟后再追赶,将是关键的抉择。