当模型免费而账单爆炸:推理侧的 Jevons 悖论与算力链利润池
一、结论先行模型单价崩了 10–24 倍但 Agent 单任务 token 消耗涨了 5–30 倍企业推理预算占 AI 算力开支约 2/3、占企业 AI 预算约 85%。总账单没塌是低价引爆了需求。而算力链GPU / HBM / CoWoS是卖铲子的总池子因此更厚——这就是为什么模型免费、算力股却在涨。[综合本号 2026-08-01 话题地图 / WebSearch 聚合置信中]二、两种爽文都漏了总量爽文 AAI 太贵要崩“企业用不起 AI泡沫必破。”爽文 B模型免费党“模型免费了算力没人要了芯片股到顶。”实际模型单价确实崩了但调用量暴涨得更快。Jevons 在《煤炭问题》里写蒸汽机效率提升让煤更便宜结果英国煤消耗总量不降反升——因为便宜打开了无数新用途。推理模型降价正在做一模一样的事。[来源Jevons 1865 原著机理 / 本号推理经济学框架]偏差两派都盯着单价没人盯总账单。2026 年的事实是——单价塌了总量炸了算力总消耗不降反升。三、机制三个齿轮咬出账单爆炸3.1 Jevons 在推理侧便宜是需求引爆器1848 年煤炭降价→用量暴涨→总消耗升。2026 年模型单价降 10–24 倍→调用量token暴涨→算力总消耗升。降价不消灭需求它创造需求。企业从偶尔调用变成全员 Agent 化token 总池子被低价炸开。Jevons 总成本公式总成本 单价_per_token × 调用量 (单价↓ 10–24x) × (调用量↑ 5–30x) → 净方向总成本 ↑除非调用量增速 单价降幅但目前反向3.2 Agent 的Token 黑洞单任务多步推理、工具调用、重试、上下文累积让一个 Agent 任务的 token 消耗是单次问答的 5–30 倍。[来源行业实测/机构研报 consensus置信中] Gartner 调研显示 88% 的企业 Agent 项目没有量化 ROI——大家都在烧 token但值不值还没算清。这正是账单爆炸的微观机制。Agent 任务成本拆解单次问答成本 prompt_tokens × p_in completion_tokens × p_out Agent 任务成本 Σ(每步 promptcompletion) × 重试系数 × 工具调用步数 ≈ 单次问答 × (5–30) # 多步重试上下文累积3.3 利润池暗线算力链是卖铲子的推理预算占比上升但钱最终流向算力链GPU英伟达 5.07 万亿美元市值、PE 31.7、HBM长鑫 3.28 万亿、PE 113.6美光毛利率 84%、光模块中际旭创 1.17 万亿、PE 78。[来源C2 估值与投资跟踪数据库 2026-07 截面 / 美光财报] 模型层在打价格战、利润薄如纸算力层卖铲子、利润池反而更厚。接本号已完成的《Agent ROI》——Agent 落地的 171% 回报预期是靠算力链扩产支撑的。3.4 成本观测代码可直接复用defestimate_agent_cost(base_tokens:int,# 单次问答 token 数steps:int,# Agent 步数多步推理工具调用retry_factor:float,# 重试系数1.0 不重试price_per_1k_in:float,# 输入单价 $/1k tokensprice_per_1k_out:float,# 输出单价 $/1k tokens):Agent 任务相对单次问答的成本放大倍数。singlebase_tokens*(price_per_1k_inprice_per_1k_out)/1000agentsingle*steps*retry_factorreturn{单次问答成本:round(single,4),Agent任务成本:round(agent,4),放大倍数:round(steps*retry_factor,1),}# 示例base2000, steps12含工具调用, retry1.3print(estimate_agent_cost(2000,12,1.3,0.001,0.002))# → 放大倍数 ≈ 15.6x落在行业观测的 5–30x 区间3.5 三层对照层级现象利润归属数据模型层单价崩 10–24x利润薄DeepSeek/Kimi/OpenAI 降价 [本号 07-30]Agent 层token 耗 5–30xROI 未量化88% 无量化 ROIGartner算力层总消耗升利润池厚中际旭创 PE78 / 长鑫 PE113.6C2四、案例把免费和爆炸摆一起案例 A——价格战的水电账单一人公司用 DeepSeek表面月费 200 元但上下文超限 重试 人工审核回路真实月成本 842 元是表面 4 倍本号 2026-07-24《DeepSeek 自来水》。微观版账单爆炸。案例 B——算力股不跌反涨模型免费叙事最盛的 2026 上半年中际旭创市值站上 1.17 万亿、长鑫 3.28 万亿——卖铲子逻辑未被模型免费削弱反而被 token 总量扩张强化。[来源C2 2026-07 截面]案例 C——NVDA 的从容英伟达 PE 仅 31.7低于国产 GPU因为市场认定其利润捕获已兑现。模型免费不打垮 NVDA打垮的是以为免费算力无用的误判。[来源C2 / 美股财报]五、诚实 B 面反方若推理效率提升小模型、蒸馏、KV-cache 优化快于调用量增长token 总消耗可能增速放缓算力链利润池扩张节奏会低于Jevons 必然爆发叙事。[来源机构研报 consensus置信中]边界Jevons 悖论是方向性规律不是匀速规律。总量一定扩张但扩张速度取决于 Agent 落地率与效率优化的拉锯。什么情况下会错若 Agent 大规模证伪88% 无 ROI 蔓延成砍项目、或推理效率跃迁式提升则算力利润池持续增厚需要下修。六、给读者的框架自己验证的信号清单企业推理预算占比看云厂财报 “inference vs training” 口径token 单价走势是否继续降降幅是否收窄Agent 落地率Gartner 类调研的取消率算力链资本开支NVDA/博通/中际旭创的 supply commitment小模型/蒸馏采用率效率侧的对冲信号。该避的坑把模型免费等同于算力无用。2026 年推理侧的真故事是——便宜引爆需求需求喂厚利润池模型层打价格战算力层卖铲子赚钱。常见问题FAQQ1模型免费了为什么企业账单反而更贵A因为单价降了 10–24 倍但调用量token涨得更快——Agent 多步推理、工具调用、重试、上下文累积单任务 token 是单次问答的 5–30 倍。这是 Jevons 悖论资源越便宜总消耗越大。账单价降了总量炸了总账单没塌。Q2Jevons 悖论在 AI 推理侧真的成立吗A机理成立。1865 年 Jevons 观察煤炭效率提升→煤更便宜→用量暴涨→总消耗升。2026 年模型降价→调用量暴涨→算力总消耗升是同一机制。它是方向性规律不是匀速规律——扩张速度取决于 Agent 落地率与效率优化的拉锯。Q3既然模型免费为什么英伟达/中际旭创还在涨A因为钱最终流向算力链。模型层打价格战、利润薄算力层GPU/HBM/光模块卖铲子token 总量扩张反而喂厚了利润池。NVDA PE 仅 31.7低于国产 GPU因为市场认定其利润捕获已兑现。Q4怎么给企业算一笔 Agent 的账A用第三节的成本公式单次成本 × 步数 × 重试系数。示例 base2000 tokens、12 步、重试 1.3 倍放大约 15.6 倍落在行业观测的 5–30x 区间。关键是把步数和重试算进去否则会严重低估。Q5效率提升小模型/蒸馏会不会让算力需求掉下来A会减缓增速但不一定逆转总量。若效率优化快于调用量增长利润池扩张节奏会低于Jevons 必然爆发叙事。需同时盯调用量增速和单 token 效率两侧信号。*数据来源C2 估值与投资跟踪数据库2026-07 截面NVDA 5.07 万亿$/PE31.7、长鑫 3.28 万亿/PE113.6、中际旭创 1.17 万亿/PE78、美光毛利率 84%本号 2026-07-24《DeepSeek 自来水》842 元真实月成本、2026-07-30《模型层价格战》单价降 10–30x、2026-08-01 话题地图Gartner88% 无量化 ROIJevons《煤炭问题》1865。本文为信息聚合与框架分析不构成任何投资建议。涉及 A 股标的仅作产业机制说明不做个股方向判断。投资有风险决策需独立。