算力计费新物种:Token算力运营商如何重构AI推理经济?
我这两年一直在帮一些创业团队做AI算力方案最大感受就是算力的计量单位正在肉眼可见地发生变化。早几年谈算力大家问的是“你有几张A100”“机柜租金多少”现在越来越多的人开口就是“你这模型跑一个请求要消耗多少Token”。同样的业务以前按月租GPU实例现在按Token用量结算。这个变化背后不只是计费方式变了而是整个算力产业的生意逻辑在换底盘。硬蛋创新00400.HK近期对外提出向“Token算力运营商”进化公开信息里这句判断分量很重。要知道这家公司以前的主业是芯片供应链和智能硬件生态现在把战略方向锚定在Token与AI推理上说明算力账本被改写的速度比很多人想象中要快。这篇文章我想从商业模式、技术逻辑和实际操作三个维度把“Token算力运营商”这个新物种拆开讲清楚它到底做什么生意、成本怎么算、谁会受益、谁会被动以及一个普通AI应用团队该怎么用Token算清自己的账。想入局AI创业、在传统ICT行业找转型方向或者单纯想弄明白“Token为什么突然这么值钱”的朋友这篇应该能给你一个比较完整的坐标系。1. 算力账本为什么会被改写1.1 训练与推理两种完全不同的算力逻辑AI时代聊算力以前主要指训练算力。大模型要先把海量数据“读进去”通过反向传播把权重调到可用状态这个过程计算量巨大一次训练往往要跑几千张GPU卡一跑就是几个星期。圈内有个很糙但准确的说法训练是盖楼推理是住楼。盖楼阶段工程量集中周期短、强度高住楼阶段看起来不起眼但每天都有无数人在里面开灯、用水、上下楼积少成多总量反而惊人。推理Inference恰恰就是“住楼”这个阶段。用户把一句话发给模型模型在前向传播里生成回答这个过程每次只用一张卡甚至半张卡但调用次数可以做到每秒成千上万次。当AI应用从尝鲜走向生产力工具单次推理的价格乘以海量调用次数就会变成一个非常可怕的流水。很多机构在行业里统计过成熟期的AI业务推理算力占比会逐步超过训练算力甚至达到六成、七成以上。这不是谁拍脑袋得出的结论而是“训练一次、推理亿万次”的产业规律决定的。训练和推理在工程上也是两套打法。训练追求吞吐batch size尽量拉满让GPU一直在高负荷下跑矩阵乘法推理追求延迟用户发完消息不可能等你三分钟首Token延迟、生成速度、并发能力都是命门。训练可以用分布式框架慢慢磨推理要面对的是极度碎片化、随机到达的用户请求必须靠调度、排队、动态批处理来把算力一点点抠出来。所以当一个公司说要往AI推理转型本质上就是从一个“搞基建”的模式切到一个“搞运营”的模式技术栈、成本结构、团队基因全部要换。1.2 算力计费从按小时到按Token正因为训练和推理的形态完全不同产业链的计费逻辑也在分裂。训练算力到今天仍然以“卡月”“实例小时”为单位客户租一张卡按小时付钱用多用少自己扛。这种模式对需求稳定的大客户没问题但对中小AI应用方来说就很尴尬我可能一天只有几百个用户但为了应付晚高峰不得不租一台8卡机器大部分时候算力闲置账面上却一直在烧钱。推理算力按Token计费解决的就是这个错配。Token是模型处理文本、图片的基本计量单元用户调用一次模型消耗多少Token就付多少钱不用关心背后跑的是几台服务器、电费多少钱。用我们熟悉的话说以前是买车现在是打车以前是包月健身房现在是按次付费的私教课。对应用方来说算力从固定成本变成了可变成本用多少付多少对供应方来说只要能把资源池的总量做到足够大、调度足够聪明就能在碎片化的需求里攒出可观的利润。顺带说一句我在给团队做方案时经常被问到“Token到底怎么来的这么个计费单位”。严格讲Token不是模型世界里的字或词而是BPE这类分词算法切出来的最小片段。英文里一个常见单词可能是一个Token生僻词可能被切成两三个中文情况更复杂一些常用字可能一个Token复杂词组可能切出好几个。模型之所以按Token收费是因为它的计算量、显存占用都和Token数量高度正相关。Token等于把非常抽象的计算资源变成了一把能精确到千分之一的尺子。1.3 硬蛋创新为什么此时提出转型回到硬蛋创新。从公开资料看这家公司在芯片供应链和智能硬件领域深耕了很多年旗下硬蛋平台服务过大量中小硬件开发者。这类业务的逻辑是“卖水人”别人要造东西你提供芯片选型、供应链对接、上下游撮合赚的是服务费和差价。这个模式本身没什么问题但在AI浪潮下有一个绕不开的趋势——硬件的价值正在从“实体设备”往“设备里的智能”迁移。以前卖一个智能音箱利润来自硬件BOM现在大家买音箱买的是里面那个能聊天、能控制家居的模型。硬件厂商的注意力开始从“怎么把零件组装起来”转移到“怎么把智能能力做进产品里”。一旦看懂了这一点就明白硬蛋创新提出的“Token算力运营商”不是空穴来风。这家公司手里有大量中小硬件创业者的客户关系这些人现在恰恰是AI应用最积极的一批尝鲜者做AI玩具的、做智能客服的、做行业助手的都在急着接大模型能力。而接模型能力绕不开算力。与其让每个客户各自去云厂商那里买GPU、搞推理部署不如由硬蛋创新在中间做一层“算力批发转零售”上游对接各家算力资源下游把模型推理能力封装成Token化的API卖给这些硬件创业者。这个角色本质上就是智能时代的“水电燃气公司”——用户不关心电从哪里来只关心插上插头能不能亮。2. Token是怎么变成算力“通用语”的2.1 从自然语言到计量单位很多人第一次接触Token是因为OpenAI、DeepSeek这类模型厂商按Token计费甚至因为“输出Token上限被截断”这种报错而认识它。但在算力运营的语境下Token的意义远不止计费单位它是让算力变成可交易标的物的核心抽象层。为什么这么说因为算力本身是一个特别难以标准化的商品。一张H100在不同区域、不同电力成本下价格可能差出好几倍不同推理引擎对同一句请求的资源消耗也不同甚至同一个模型在早高峰和凌晨实际算力成本都不一样。如果直接按“算力”买卖买卖双方根本没法对账。Token提供了一个稳定的中间锚点模型确定的情况下一段输入输出消耗的Token数量基本确定资源消耗也随之确定。Token就和石油交易里的“桶”、电力交易里的“度”一样把复杂、异质的资源变成了一个统一、可计量的商品单位。这里要特别注意Token作为计量单位和模型强绑定。同一个问题换一个分词器不同的模型Token消耗可能差30%。所以Token算力运营商的报价单上一定会写着“基于某某模型、某某版本”Token价格不是普适的而是合约式的。这也是这个行业早期最容易踩坑的地方——拿一个模型的价格去套另一个模型的账单对账时一头雾水。2.2 四种算力购买方式对比现在市面上从底层到应用算力购买方式大概能分成四类我把它们的逻辑和适用场景放在一起方便对照着看。购买方式计量单位优点缺点典型场景自购服务器/显卡一次性固定资产投入完全掌控、长期摊薄成本低维护成本高、利用率难保证算力富余的头部公司云主机/GPU实例包时小时/卡时弹性扩容、部署快空闲时段也在扣钱训练任务、稳定流量业务模型API调用Token按量付费、零运维单位价格通常较高、数据要过第三方创业团队快速原型验证Token算力运营平台Token/混合兼顾可控性与弹性、可私有化市场刚起步、服务商良莠不齐有数据安全要求的中型客户从这张表能看出来前两种方式本质上是“按资源时间付费”后两种是“按结果消耗付费”。资源时间付费的问题是时间是不可压缩的机器没跑满你就亏了。结果消耗付费的好处是每一个Token都对应一次真实的智能生成动作钱花在了刀刃上。当然代价也有按Token算下来单位计算成本大概率比自建贵因为你买的不只是算力还有人家做好的推理优化、工程运维和容错方案。2.3 Token成本的影响变量既然Token是计费锚点那就有必要搞清楚一个请求到底会被多少个Token“吃掉”。我基于常见实践补充一下影响Token消耗的主要有这么几个变量。第一模型规格。同一条指令用70B模型和7B模型虽然输出Token数可能一样但背后消耗的算力完全不同所以报价会拉开好几个档次。第二上下文长度。很多AI应用为了“记忆”会把历史对话一次次拼进去结果每次请求的输入Token越滚越大。我见过一个客服机器人项目单次请求上下文堆到五千Token其中八成是重复的历史记录——这在计费上就是白花花的银子。第三输出长度。模型是逐Token生成答案的输出长度直接决定算力消耗和时间也因此大部分API会把输出Token的价格定得比输入Token贵。第四缓存命中率。现在主流推理平台都支持Prompt缓存系统提示词和公共知识如果命中缓存输入成本能砍掉一大截。前阵子我帮一个做垂直搜索的团队调过成本他们用的是某家大模型API月初账单出来比预期翻了一倍。我让研发拉了一下请求日志发现90%的请求都在重复发送同样一份两千多字的系统提示词而且都没开缓存。改完之后把系统提示词抽到缓存里成本直接降了40%。Token成本这件事很多时候不是模型贵而是你不会花。3. Token算力运营商这门生意怎么算账3.1 运营商到底卖什么理论上讲任何有GPU资源、装了开源推理引擎的公司都可以对外提供Token计费服务。但“Token算力运营商”这个定位我认为关键在于它做的不是一次性资源租赁而是一个持续运营的智能生产能力租赁服务。运营商的货架上有模型开源模型定制、第三方商用模型代理、有工具推理服务、KV Cache优化、模型路由、有服务负载均衡、多活容灾、监控报表最后统一用Token来标价。把它拆成三层来看最底层是异构算力池自有算力、云上弹性算力、合作用户的闲散算力只要能接入调度系统全部汇成资源池中间层是推理引擎层vLLM、TensorRT-LLM、SGLang这些框架负责把裸算力变成高效的模型服务能力最上层是运营层包括计量计费、客户控制台、配额管理、账单系统。前两层决定成本第三层决定毛利和客户粘性。房地产行业有一句话叫“地段地段地段”算力运营行业可以套用成“调度调度调度”。同样一张GPU卡调度得好利用率能到70%以上调度得稀烂可能30%都不到。运营商之间的毛利差异一半靠资源采购价另一半就靠这套运营能力。谁能把一个请求塞进最合适的GPU、在低峰期接更多离线任务、通过KV Cache复用挤出更多并发谁就能把单Token成本压到同行的六成。3.2 收入与成本结构拆解从财务模型看Token算力运营商的收入公式很简洁收入 Token用量 × 单价。但毛利率的推导就复杂得多成本端至少包括算力资产折旧或上游租金、电力、网络带宽、推理集群工程人员薪资、平台研发摊销、销售与客服成本。这里面算力成本和电力是大头占70%到80%很正常。用一个简化的例子跑一遍假设平台接入了一批GPU单卡每小时总成本含折旧电费机房折算下来是30块钱。一张卡跑主流开源模型通过动态批处理一小时实际能产出的Token量大概在300万到600万之间具体看模型大小和请求长度。按单Token售价约0.1元每万Token来算一小时产出收入就是30到60元。这么一看毛利不算高要想活得舒服必须把Token单价卖出溢价或者在资源利用率上做得比别人聪明得多。这也是为什么很多做算力运营的团队都会强调“帮你省Token”和“帮你提并发”是同一件事——把客户的单请求成本降下来客户才会放大用量总量利润才能做上去。这里还有一个经常被忽略的点Token算力运营商的经营杠杆。自建GPU的折旧是固定成本如果客户不用量成本也摆在那里如果客户突然爆发又得临时高价加机器。成熟运营商的解法是“自有算力保底公共云弹性扩容”把固定成本和可变成本的比例控制在三比七或者四比六这样无论在需求淡季还是旺季账本都能稳得住。3.3 为什么是硬蛋创新聊完通用模型再回到标题里这家公司。我个人的理解是硬蛋创新提出向“Token算力运营商”进化其实是在做一次顺理成章的产业链延伸而不是跨行。它过去在芯片供应链里积累的东西大概有三块可以直接迁移过来。第一块是上游资源连接能力。芯片供应链生意常年和原厂、代理商、下游整机厂打交道对芯片生态的理解和对硬件厂商触达是目前少数具备“算力硬件”双重基因的企业。第二块是硬件开发者生态。硬蛋平台沉淀了大量做智能硬件的团队这些人做AI玩具、AI眼镜、AI边缘设备个个都需要模型推理能力且对成本敏感按Token计费的低门槛接入对他们非常友好。第三块是服务中小客户的经验。给大客户做服务可以一对一定制给中小客户做服务必须产品化、标准化。Token计费本身就是标准化的最好载体不需要销售去解释什么是并行计算只需要告诉客户“充100块可以跑XX万Token”。当然从芯片供应链到算力运营商中间还隔着推理优化、运维体系、计费系统这几道坎。能不能跨过去取决于硬蛋创新接下来在技术和团队上的投入力度。但从大方向看这个转型路径比很多“纯故事型”蹭AI的行为扎实得多——它至少是在原有客户基本盘之上做增量生意。4. 实操中小团队如何用Token算清自己的算力账4.1 五步评估法从业务量到Token成本前阵子有个做AI心理咨询的团队找我看成本他们拿到的模型API账单已经连续三个月超预算但业务量没怎么涨。我让他们按下面这套逻辑重新过了一遍需求效果很明显。这套评估法适用于任何一个准备接入Token计费模型的团队。第一步摸清调用画像。不要只盯总账单要拉出每天多少个请求、每个请求平均输入Token多少、输出Token多少、有没有明显的波峰波谷。一般云控制台都有这类统计没有的话自己埋点统计方式见4.2。第二步选定模型规格。同样一个任务7B小模型未必不行70B大模型未必有必要。优先做小模型验证不满足效果再升级。第三步小流量实测单位成本。用一个固定测试集覆盖你的典型请求算一次推广后每个人工会话的Token成本。第四步折算业务成本。把Token成本除以这个AI功能带来的有效收入或节省的人力成本算出来就是“单次智能调用”的真实ROI。第五步预留增长系数。业务上线后调用量一定会涨按1.5到2倍做预算余量避免账单爆掉时手忙脚乱。拿那个心理咨询项目举例他们平均每次会话要跑大概30轮对话每轮输入1200 Token、输出400 Token。按某模型API价格折算单次会话的模型成本大约是六毛钱。如果这个产品做一单付费咨询收费几十块钱模型成本占比不超过3%这个生意完全成立如果模型成本长期超过收入的10%那就要么砍对话轮数要么换更便宜的模型。这套账算明白之后团队再也没拍脑袋定功能了。4.2 自己服务上怎么统计Token如果你用各家商业APIToken统计一般控制台都会给但如果你自建推理服务或者走了多模型网关就需要自己在日志里埋Token计量。我在这里给一个最直接的办法使用模型的tokenizer对输入的prompt和输出内容分别计算token数量落地到日志。如果你用的是OpenAI系的模型可以用tiktoken这个库来统计import tiktoken enc tiktoken.get_encoding(cl100k_base) prompt 这是一段系统提示词 completion 模型生成的结果 prompt_tokens len(enc.encode(prompt)) completion_tokens len(enc.encode(completion)) print(finput tokens: {prompt_tokens}, output tokens: {completion_tokens})如果你用的是vLLM这类自部署框架更简单。它的请求日志里会直接打出来prompt_tokens和completion_tokens两个字段在启动参数里加上日志相关配置再把这些字段采集到监控系统里就行。有了Token级别的日志你才能回答“哪个用户把我吃穷了”“哪个场景用量异常”这类问题。否则账单来了你连是哪条业务线烧的钱都说不清。4.3 成本优化三板斧Token成本的优化空间很多人低估了。我实测下来最有效的三板斧按见效速度排序如下。第一板斧Prompt缓存。很多模型服务商支持自动缓存开启后重复命中的系统提示词和公共上下文按极低价格甚至免费计算。把固定不变的System Prompt、企业知识库、常用工具说明抽出来缓存命中率能做到百分之七八十输入成本直接掉一个量级。第二板斧output长度锁死。很多业务场景根本不需要模型长篇大论给max_tokens设置上限、用结构化输出约束格式输出Token能砍掉一半。客服机器人只要回复“订单号当前状态下一步操作”就够了让它自由发挥写三百字小作文那都是钱。第三板斧模型路由。简单意图识别用小模型复杂推理才上大模型中间加一层路由。现在很多开源模型专做意图分类性能和准确率已经很能打把八成普通请求分流到小模型整体成本能降一半还不止。这三板斧在同一个项目里可以叠加。我见过最夸张的案例优化前单次请求平均消耗18000 Token优化后压到3000 Token成本降幅接近80%而且响应速度还更快了。5. 影响范围谁在这轮商业模式迁移中受益谁难受5.1 云厂商与IDC从资源贩子到服务贩子Token计费从API厂商蔓延到整个算力市场最先感受到压力的是传统云厂商和IDC。以前它们的生意是把服务器、带宽、电费打包成产品卖出去利润来源是资源差价。但当客户开始按Token付费客户就不再关心你机器背后是什么——只关心一个Token多少钱、服务稳不稳。这迫使云厂商必须从“资源贩子”往“服务贩子”迁移要么自建推理平台要么和运营商深度绑定。这件事对中小IDC来说尤其残忍。大云厂商好歹有自研推理引擎和庞大的SRE团队中小IDC如果还停留在“租机柜、卖带宽”的层面在Token商业模式里基本没有存在感。反过来看那些能快速部署推理服务、对外开放Token计费接口的IDC反而能把闲置算力变现。我认识一个做机房托管的朋友前两年愁机房空置率后来接入了一个算力运营平台把自己的一批二手卡租给平台跑推理机房反而热闹起来了。算力这台机器容不下旁观者。5.2 AI应用开发者可变成本的双刃剑对AI应用开发者来说Token计费是双刃剑。好的一面是启动门槛大幅降低。以前做个AI产品要么先花几十万买卡要么跑通云厂商复杂的申请流程现在充五百块钱就能做一轮功能验证成本试错极其便宜。坏的一面是成本变得“无感”——它每次只扣几分钱一个不小心就上万但钱是怎么花的用户比资本更清楚。很多团队做了两个月才发现模型成本能吃掉整个毛利功能却已经上线了。我经常提醒团队Token计费模式下你必须有“成本可视化”这个习惯。不只是看账单总额还要看每个功能、每个用户、每个会话的成本分布。没有这层数据你根本不知道什么功能该上、什么功能该下。换算成通俗的话以前你租机房房租多少是月初就定好的现在按Token计费相当于每月都在裸考你的产品能不能赚回Token钱每天都有答案。5.3 Token口径不统一带来的工程坑Token成为通用计量单位之后新的坑也随之出现不同模型的Token口径不统一。同一个问题在模型A里可能算了150个Token在模型B里只有110个因为分词器算法不同。如果业务里同时接了好几个模型这份账单就更难算清。怎么解决我的建议是“以模型为单位记账”。每个模型的Token消耗分开记录、分开对比不要强行折算成一个统一数字。要对比模型成本可以用“每千字符成本”做辅助指标把Token数除以字符数得到一个可横向比较的密度值。此外对外给客户报价时尽量锁定模型版本和Token口径把“按Token计费”会带来的歧义在合同里写清楚。这个细节看似小实际运营中能免掉九成的对账纠纷。顺带提一个容易搞混的点工程上常见的401认证报错“token_exchange_failed”这里的Token指的是OAuth访问令牌和AI推理计费的Token完全是两个概念。不少朋友刚开始对接开放平台时被这两个Token绕晕其实只要记住一点——计费Token标记的是“智能生成量”访问令牌标记的是“你是谁、有没有权限”两者只在名字上撞了车。6. 常见问题速查与避坑实录6.1 高频问题速查表我把在实际项目里反复遇到、以及各个社区高频讨论的问题整理成了一个速查表希望能帮你少走一些弯路。问题可能原因处理建议Token账单突然翻倍输出未设上限、上下文重复堆叠、缓存未命中检查单请求Token日志逐轮对比消耗输出Token上限被截断模型max_tokens设置过小调大max_tokens或分批生成再拼接同一个问题不同平台价格差异大Tokenizer不同、模型版本不同、是否含缓存以字符数折算对比锁定同等条件再比价并发稍高就报错推理端prefill/decode瓶颈、KV Cache不够升级推理引擎、调大max_concurrency、加副本多模型路由后成本对不上各模型Token口径不一致按模型拆分账单用单位字符成本横向比较中小团队要不要自建集群月Token量低时自建成本远高于API月消耗不足亿级Token时优先用API或运营平台这里多说一句自建集群的判断标准。我一般建议如果每个月的Token消耗量在两亿以下自建推理集群大概率比买API贵超过两亿且业务持续增长、对延迟和数据有更高要求再认真评估自建。很多人被“自建省钱”这句话忽悠结果一算折旧、电费、运维人力才发现月账单比API还贵。6.2 怎么挑一个靠谱的算力运营平台如果你所在的团队决定不自己折腾选择接入第三方Token算力运营平台那么选型时至少有四个细节值得认真看。第一看计费透明度。平台能不能提供Token级别的明细日志还是只给一个汇总账单能做到第一手的计费日志基本说明它内部计量系统是自研的拿不出日志的很可能只是倒腾API的二道贩子。第二看模型生态和调度能力。平台是只能接一家模型还是能帮你做多模型路由遇到单模型故障能不能自动切换这些功能平时用不上一用就是救命的。第三看延迟SLA。Token计费不只影响账本还影响体验。务必用真实业务场景做压力测试盯着首Token延迟和平均生成速度两个数。第四看私有化和合规选项。如果你的业务涉及敏感数据平台是否提供私有化部署或不落盘方案这个一定要在合同阶段确认清楚别等到业务上线才发现不让过审。还有一个小经验一开始不要一次性充大额套餐。先用小额充值跑一个完整的上线周期把账单结构和稳定性验证清楚了再谈长期合约。算力运营商还在群雄逐鹿阶段跑路的、缩水的不是没有小额测试是对自己的保护。写在最后的个人体会我自己的判断是算力账本从“卡数”到“Token数”的转变本质上是AI价值计量方式的一次升级。以前我们为“拥有计算设备”付费现在开始为“完成智能任务”付费这是一个产业走向成熟的标志。Token算力运营商能不能普遍成立最终看三件事单位Token成本能不能持续下降客户的Token用量能不能持续增长平台能不能在这两者之间做出足够大的剪刀差。硬蛋创新走这条路的胜算有多大现在下结论还太早但它至少选了一个值得下注的方向。如果你也是做应用、做平台的我现在最实在的建议是早点在自己的业务里建立Token计量能力不管你是用商业API还是自建推理都先把每一笔智能调用的成本看清楚。成本透明之后很多决策会变得简单很多。算力账本正在被改写别等账单把你打醒。