模型圈最近最反常识的一句话:DeepSeek 把推理基准打到 1,Kimi 降价 10 倍,OpenAI 也跟降 15–30 倍——模型正变得"免费"。但转头一看,企业 AI 账单不降反升。
这违反直觉?我先查一遍——这恰恰是 1848 年威廉·杰文斯(William Jevons)发现的悖论,在推理侧重演:资源越便宜,总消耗反而越大。
一、一句话结论
模型单价崩了 10–24 倍,但 Agent 单任务 token 消耗涨了 5–30 倍,企业推理预算占 AI 算力开支约 2/3、占企业 AI 预算约 85%。总账单没塌,是低价引爆了需求。而算力链(GPU / HBM / CoWoS)是"卖铲子"的,总池子因此更厚——这就是为什么模型免费、算力股却在涨。
二、反转:两种爽文都漏了"总量"
- 爽文 A(AI 太贵要崩):"企业用不起 AI,泡沫必破。"
- 爽文 B(模型免费党):"模型免费了,算力没人要了,芯片股到顶。"
实际数据:模型单价确实崩了,但调用量暴涨得更快。Jevons 在《煤炭问题》里写:蒸汽机效率提升让煤更便宜,结果英国煤消耗总量不降反升——因为便宜打开了无数新用途。推理模型降价,正在做一模一样的事。
偏差在哪:两派都盯着"单价",没人盯"总账单"。2026 年的事实是——单价塌了,总量炸了,算力总消耗不降反升。
三、机制:三个齿轮咬出"账单爆炸"
3.1 Jevons 在推理侧:便宜是需求引爆器
1848 年煤炭降价→用量暴涨→总消耗升。2026 年模型单价降 10–24 倍→调用量(token)暴涨→算力总消耗升。降价不消灭需求,它创造需求。企业从"偶尔调用"变成"全员 Agent 化",token 总池子被低价炸开。
3.2 Agent 的"Token 黑洞"
单任务多步推理、工具调用、重试、上下文累积,让一个 Agent 任务的 token 消耗是单次问答的 5–30 倍。Gartner 调研显示 88% 的企业 Agent 项目没有量化 ROI——大家都在烧 token,但"值不值"还没算清。这正是"账单爆炸"的微观机制。
3.3 利润池暗线:算力链是卖铲子的
推理预算占比上升,但钱最终流向算力链:GPU(英伟达 5.07 万亿美元市值、PE 31.7)、HBM(长鑫 3.28 万亿、PE 113.6;美光毛利率 84%)、光模块(中际旭创 1.17 万亿、PE 78)。模型层在打价格战、利润薄如纸;算力层卖铲子、利润池反而更厚。
3.4 三层对照
| 层级 | 现象 | 利润归属 | 数据 |
| 模型层 | 单价崩 10–24x | 利润薄 | DeepSeek / Kimi / OpenAI 降价 |
| Agent 层 | token 耗 5–30x | ROI 未量化 | 88% 无量化 ROI(Gartner) |
| 算力层 | 总消耗升 | 利润池厚 | 中际旭创 PE78 / 长鑫 PE113.6(C2) |
四、案例:把"免费"和"爆炸"摆一起
案例 A · 水电账单
4×
一人公司用 DeepSeek,表面月费 200 元,真实成本 842 元(上下文超限+重试+人工审核)
案例 B · 算力股不跌
1.17 万亿
中际旭创市值站上 1.17 万亿、长鑫 3.28 万亿——卖铲子逻辑被 token 总量扩张强化
案例 C · NVDA 从容
PE 31.7
英伟达 PE 低于国产 GPU,市场认定利润捕获已兑现;模型免费打不垮它
五、诚实 B 面
- 反方论点:若推理效率提升(小模型、蒸馏、KV-cache 优化)快于调用量增长,token 总消耗可能增速放缓,算力链利润池扩张节奏会低于"Jevons 必然爆发"叙事。
- 本结论边界:Jevons 悖论是"方向性"规律,不是"匀速"规律。总量一定扩张,但扩张速度取决于 Agent 落地率与效率优化的拉锯。
- 什么情况下会错:若 Agent 大规模证伪(88% 无 ROI 蔓延成"砍项目")、或推理效率跃迁式提升,则"算力利润池持续增厚"需要下修。
六、给读者的框架
自己验证的信号清单:
- 企业推理预算占比(看云厂财报 "inference vs training" 口径);
- token 单价走势(是否继续降,降幅是否收窄);
- Agent 落地率(Gartner 类调研的"取消率");
- 算力链资本开支(NVDA/博通/中际旭创的 supply commitment);
- 小模型/蒸馏采用率(效率侧的对冲信号)。
⚠️ 该避的坑:把"模型免费"等同于"算力无用"。2026 年推理侧的真故事是——便宜引爆需求,需求喂厚利润池,模型层打价格战,算力层卖铲子赚钱。这正是 Jevons 在推理侧,最该想通的事。
七、读者问答(FAQ)
Q1:模型都免费了,为什么企业账单反而更贵?
A:因为降价引爆了用量。模型单价崩 10–24 倍,但 Agent 单任务 token 消耗涨 5–30 倍,调用量暴涨得更快。这正是 Jevons 悖论——资源越便宜,总消耗越大。单价塌了,总量炸了,总账单没塌。
Q2:Jevons 悖论是什么?跟 AI 有什么关系?
A:1865 年经济学家杰文斯发现:蒸汽机效率提升让煤更便宜,结果英国煤总消耗不降反升——因为便宜打开了无数新用途。2026 年模型降价正在推理侧重演同一机制:便宜创造需求,需求喂厚算力总消耗。
Q3:为什么说算力链是"卖铲子"的?
A:模型层在打价格战、利润薄如纸;但钱最终流向算力链——GPU、HBM、光模块。无论哪家模型赢,都要买算力。所以"卖铲子"的算力层利润池反而更厚,这也是模型免费、算力股却在涨的原因。
Q4:Agent 的"Token 黑洞"怎么理解?
A:单次问答可能几百 token,但一个 Agent 任务有多步推理、工具调用、重试、上下文累积,token 消耗是单次问答的 5–30 倍。Gartner 说 88% 企业 Agent 项目没量化 ROI——大家都在烧 token,但"值不值"还没算清。
Q5:这个逻辑有没有可能错?
A:有。Jevons 是"方向性"规律不是"匀速"规律。若推理效率(小模型、蒸馏、KV-cache 优化)提升快于调用量增长,或 Agent 大规模证伪(砍项目),算力利润池持续增厚就需要下修。关键看 Agent 落地率与效率优化的拉锯。
Q6:普通人能从中得到什么启发?
A:别被"模型免费=算力没用"的爽文带偏。验证真实趋势要看五个信号:推理预算占比、token 单价走势、Agent 落地率、算力链资本开支、小模型采用率。便宜引爆需求、需求喂厚利润池,这才是推理侧最该想通的事。