深度拆解
当DeepSeek V4 Flash单日8万亿Token:一场不靠算力堆出来的全球登顶
先说个反常识的事实:一款中国大模型,单日消耗的Token量,比全球接入400多个模型的OpenRouter全平台日均总量还高。8万亿对6.6万亿,这不是局部领先,是数量级的碾压。更反常识的是,做到这件事的DeepSeek V4 Flash,每百万输出Token定价2元人民币——比Claude Opus 4.8便宜约85倍。便宜到近乎“白菜价”的模型,反而成了全球调用量第一。价格战打到极致,赢家不是烧钱最多的,而是把成本结构彻底重构的那一个。
第一个齿轮:架构创新吃掉推理成本。DeepSeek V4 Flash之所以敢定2元/百万输出Token的价,核心不是补贴,而是推理效率的物理提升。MoE(混合专家)架构让每次推理只激活一小部分参数,配合MLA(多头潜在注意力)压缩KV Cache,单位Token的算力消耗被大幅压低。这不是营销话术,是可量化的成本结构差异——同样的算力,别人跑1万亿Token,它能跑5万亿。
第二个齿轮:免费额度做“钩子”,付费转化做“飞轮”。5万亿免费Token不是慈善,是获客成本。开发者用免费额度把应用跑起来、把数据沉淀下来,一旦依赖形成,3万亿付费Token就是自然转化。这个模式像极了SaaS行业的Freemium策略,但在AI推理侧,规模效应更陡峭——调用量越大,单位成本摊得越薄,定价空间越大,开发者越愿意迁入。
第三个齿轮:OpenRouter榜单的“马太效应”。周榜(7.27-8.2)显示,全球调用量前5全是中国大模型,DeepSeek V4 Flash以7.22万亿Token居首。榜单本身是开发者的选型指南,登顶意味着更多新项目默认接入,形成“越用越多、越多越强”的正循环。OpenAI的紧急降价,反而坐实了这个榜单的商业价值——它不再只是技术实力的展示,而是定价权的风向标。
单日8万亿Token(5万亿免费+3万亿付费)——这是DeepSeek V4 Flash在OpenCode上的消耗量,超过OpenRouter全平台日均6.6万亿。周榜7.22万亿Token——全球所有模型第一,前5名全是中国大模型。每百万输出Token 2元人民币——比Claude Opus 4.8便宜约85倍,这个价差不是“略便宜”,是直接换了一个竞争维度。GPT-5.6 Luna降价80%——OpenAI在7月31日的紧急动作,是对DeepSeek成本模型的应激反应。
Token消耗量是“用量”指标,不等于“收入”指标。DeepSeek的免费额度占比62.5%(5万亿/8万亿),意味着大量调用量不产生直接收入,商业模式依赖后续付费转化率——这个数字目前没有公开披露。另外,OpenRouter的榜单口径是“路由调用量”,包含免费模型的流量,与API直接付费收入的口径不完全一致。更关键的是,低价策略的可持续性取决于推理成本的下降速度能否跟上定价——如果算力价格反弹或架构优化见顶,2元/百万Token的定价可能面临压力。OpenAI降价80%后,Claude和GPT系列的价格带正在快速下移,DeepSeek的“便宜85倍”优势窗口不会永远存在。
理解这件事,别只盯着“谁家模型强”,要看三个维度:
第一,推理侧的需求弹性正在被重新定价。过去行业假设“模型调用量增长是线性的”,DeepSeek的数据证明,价格降低一个数量级,需求可以爆发两个数量级。这意味着AI应用的成本拐点可能比预期更早到来,开发者的试错门槛大幅降低。
第二,竞争焦点从“模型能力”转向“单位经济性”。当性能差距缩小到用户无感,成本就成了第一决策要素。DeepSeek的路径是“架构创新→成本重构→定价碾压”,OpenAI的降价是“跟随式防守”——前者是主动定义规则,后者是被动适应规则。这场竞赛的终局,不是谁的技术最强,而是谁的成本结构最健康。
第三,中国大模型的集体登顶,不是“价格战胜利”这么简单。前5名全是中国模型,说明在推理优化、工程落地、开源生态上,中国团队已经形成了一套可复制的打法。这不是单个模型的胜利,是产业协同的胜利——从芯片适配、框架优化到应用生态,整个链条都在为“低成本推理”这个目标服务。
这场“白菜价”登顶,表面是价格战,实质是成本结构的代际差。当DeepSeek用2元/百万Token证明“便宜也能做出好模型”,整个行业的定价锚点就被重置了。OpenAI的降价只是开始,接下来的问题是:谁能把成本优势转化为生态壁垒,而不是陷入无休止的价格互砍。