算力卡更贵,为什么中国模型的 API 反而便宜到十分之一?

我一直有一个问题没搞太明白:中国当下头部的 AI 公司,训练模型用到的算力卡,因为政策原因(被卡脖子)成本比美国贵很多。按道理,成本高价格就该高。可现实是反过来的——中国模型的 API 价格,反而只有美国头部模型的十分之一,甚至更低。

这看起来自相矛盾。仔细想了想,可能有这么几层原因。

一、定价逻辑根本不一样

美国头部模型不是按成本定价,而是按市场定价,而且是全球垄断的价格。逻辑很简单:我的模型是最好的,你别无选择,所以我敢定高价。这是垄断性带来的底气。

中国模型的定价则是充分竞争价。大模型公司都在抢市场,谁先降价谁先抢到客户。这场价格战从去年打到现在,API 价格已经卷到国外头部模型的几十分之一,甚至更低。

所以换个角度看:不是中国模型的成本低,而是美国模型的利润更厚。同样的能力,一个在赚垄断的钱,一个在打价格战。

二、算力成本高,不等于推理成本高

这是最容易混淆的一点。买卡贵,指的是训练阶段——初期训练要买大量卡,这确实贵,因为被卡脖子。但用户调用 API 花的钱,对应的是推理阶段的成本,跟买卡是两码事。

训练是一次性投入,推理才是每次调用都要花钱。而推理成本不只看卡的价格,还有几个关键因素:

第一,模型的大小。中国很多主力模型参数可能更小,推理成本自然就低。

第二,量化技术。用 4 bit、8 bit 这类量化,可能牺牲一点效果,但能换来几倍的成本下降。

第三,工程优化。比如命中缓存的价格更低,还有批处理、调度等一系列优化。中国工程师在工程这块卷得很厉害。

这几项叠加下来,推理这一头的成本被压得很低——而这才是用户实际付费的部分。

三、用补贴换市场

还有一个角度:国内很多大模型的定价,本质上可能是低于成本的,甚至免费的。

这是一种战略性亏损。先把用户规模、调用量做上去,把生态绑住,等规模起来以后再降成本、再赚钱。这是中国互联网的经典打法——烧钱换市场。美国公司可能既没这个压力,也没这个习惯。

四、场景需求不一样

最后一层,是需求端的差别。

中国有大量「够用就行」的场景:客服、文案、生成代码、生成图这类小应用。这些场景不需要 100 分,不需要最强的模型。

而美国大模型的很多大客户偏企业级、科研级,对效果要求极高,甚至要突破科学边界,这样的客户愿意为最顶尖的能力付费。

所以是需求决定了供给。中国不是做不出贵的模型,而是市场不需要——低价满足的正是那些够用就行的需求。

把这四层放在一起看,那个「成本更高、价格更低」的矛盾其实就化解了:贵的是训练买卡,便宜的是推理调用;美国吃的是垄断利润,中国打的是补贴价格战;而两边服务的,本来就是要求不同的市场。

这是我目前对这个问题的理解。