拓冰建站拓冰建站
首页 / 资讯中心 / 正文

AMD GPU算力变现新路径:推理服务平台的崛起与实操解析

近半年来我一直在观察一个现象整个算力租赁和AI推理服务的生意绕来绕去都绕不开NVIDIA。直到最近Embedded LLM团队放出消息说他们要做一个面向AMD AI GPU的Monetisation Platform而且自称是同类首创。这条新闻在朋友圈里讨论度不算高但我觉得它可能是一个值得记录的转折点——因为AMD的AI GPU终于有机会从机房吃灰变成可交易资产了。这篇文章我会从软件生态现状、变现模式设计、实际部署流程到市场格局变化完整拆一下这件事到底意味着什么以及不同角色的人该怎么接入。1. 一台AMD GPU凭什么难变现这个平台的切入点在哪1.1 算力市场的CUDA惯性与AMD的尴尬过去三年GPU租赁生意有多火不用我多说。但凡手上有一张能跑的卡挂到云平台或者自建集群做推理服务都能产生现金流。但这里面有个非常明显的结构性问题整个算力交易市场几乎是围绕NVIDIA生态搭起来的。从底层驱动、CUDA库、NCCL通信到上层的vLLM、TGI、Ray这些推理和调度框架默认支持的都是NVIDIA。AMD的Instinct系列虽然规格不差MI300X甚至有192GB HBM3显存、5.3TB/s带宽这种让NVIDIA都不得不降价的硬参数但放到租赁市场里就是不好卖。为什么不好卖这里有个CUDA惯性在作祟。租GPU的大部分客户手里已经有一套跑通的镜像和脚本人家不在乎你的卡是不是理论性能更強只关心我原来的代码能不能直接跑。CUDA生态这些年积累的库和工具链太厚了从cuBLAS、cuDNN到NCCL、TensorRT每一层都是AMD需要追赶的。所以AMD卡的实际处境是做内部训练、内部推理够用但想对外变现找不到像样的通道。没有分发渠道、没有成熟的计费体系、没有需求方信任背书这就是所谓的三无算力。1.2 Embedded LLM这套平台具体做了什么按照官方发布的信息这个平台的核心逻辑是让AMD AI GPU的持有者无论是一张卡的企业用户还是小型算力机房可以把自己的算力接入一个统一的LLM推理服务市场按实际使用量获取收益而不是像过去那样只能整机租赁或闲置。听起来简单但变现这两个字在AMD生态里要干的事远不止挂个网页。一是硬件抽象层。平台需要把不同厂商、不同代际的AMD GPU统一抽象成可调度的计算节点。AMD GPU的ROCm版本差异很大MI50这种老卡跟MI300X的驱动栈完全不是一回事你需要解决不同类型的卡能在同一个池子里跑不同的模型这种问题。二是推理服务封装。平台提供面向LLM的推理运行时内置模型部署、并发控制、自动扩缩容让算力提供方不需要自己研究vLLM参数就能把模型跑起来。这一步其实很关键因为大部分持卡用户根本没有能力自己部署一套生产级的推理服务。三是计费与结算系统。按Token数量计费、按小时计费、预留实例等多种模式牵扯到精确的Token计数、吞吐量监控、账单对账。四是信任与安全体系。算力提供方和需求方之间是陌生人关系需要做节点认证、网络隔离、数据面加密、用量证明防止双方互相耍赖。有趣的是这个平台选在AMD生态而不是NVIDIA生态做首发其实是刻意为之的差异化策略。NVIDIA那边的算力市场已经是红海各种GPU云、算力聚合平台已经把价格打到很低新玩家进去没有优势。AMD这边恰恰是空白市场竞争者少定价话语权高还能绑定AMD官方的扶持资源。1.3 First-of-its-Kind到底新在哪说实话现在科技圈凡是带首个首创的标题都要打个问号。但这件事我仔细看了之后觉得首次这个说法有它的道理。市面上的GPU变现平台不少但要么只支持CUDA要么就是纯粹的裸金属租赁不关心你租回去跑什么。Embedded LLM这个平台的三层差异化在于第一它只针对AMD AI GPU做深度适配不是顺便支持一下ROCm而是从底层驱动到上层推理做了一整套AMD原生的优化第二它直接内嵌了LLM场景的变现能力不是把算力卖给你就完事而是帮你把模型跑起来、把服务卖出去、把钱结算回来第三它把Embedded这个概念落地了平台SDK可以嵌入到需求方自己的产品里让原本只能本地使用的LLM能力对外输出成收费服务。说白了以前你想用AMD卡赚钱只有整机租出去这一条路现在有了一条新路把你的算力变成推理服务的产能直接面对最终用户。这也是我把这个平台定义为算力批发变服务零售的原因——整机出租是按资源计费平台化变现是按效果计费后者的天花板高得多。2. AMD GPU的AI软件栈到底行不行这几年发生了什么2.1 ROCm从劝退级到可用级的进化聊变现之前必须先把一个核心问题说清楚AMD AI GPU在软件层面到底能不能打。因为如果软件栈一塌糊涂那再好的变现平台也是空中楼阁。我大概三年前第一次尝试在AMD卡上跑PyTorch训练那体验真的劝退。ROCm安装依赖一大堆编译PyTorch需要手动指定HIP路径跑起来动不动就是hipErrorNoBinaryForGpu然后你去GitHub issue里搜发现有人跟你一样的问题但没解决方案。那个时期AMD的AI生态基本靠社区用爱发电。但过去一年半情况发生了实打实的变化。ROCm的版本迭代明显加快6.x系列把安装过程简化了不少官方也提供了Docker镜像省掉了本地编译的麻烦。PyTorch官方库直接支持ROCm构建虽然不能做到pip install torch就能拿到CUDA版一样的体验但至少能用官方预编译轮子了。更关键的是推理框架这边vLLM在0.6版本之后对ROCm的支持从实验性转成了稳定支持llama.cpp的HIP后端也一直在跟进新的AMD显卡架构。我用一个直观的类比来解释这轮变化以前的AMD AI软件栈像一套需要自己组装、还要自己修家具的毛坯房CUDA那边是拎包入住的精装房现在ROCm至少做到了家电齐全但有些需要手动校准的程度。对于愿意花半小时调配置的专业用户来说这个差距已经从天堑缩小到了门槛。2.2 在AMD卡上跑LLM的真实体验我自己在MI100和MI300X上都跑过一些开源模型用vLLM部署Llama 3.1 8B和Qwen2.5 72B说几个真实感受。首先是显存容量的红利非常明显。MI300X的192GB显存可以单卡跑很多70B级别的模型而NVIDIA要跑到这个规模得上H100 80G做张量并行成本差了不是一点半点。对推理场景来说显存就是王道因为LLM推理的瓶颈主要是显存带宽和容量不是算力峰值。MI300X的HBM3带宽5.3TB/s配合大显存实际跑起来首Token延迟和生成长Token吞吐都挺能打。我之前做过一个简单的对比同一个Qwen2.5-72B模型MI300X单卡做推理吞吐大概能到同参数规模下H100 80G双卡张量并行的七八成但算上硬件成本性价比是高出一截的。其次是软件层的坑仍然存在但只要肯花时间调基本都能绕过去。比如vLLM在ROCm上的某些算子是用Triton写的你要确保Triton版本跟ROCm版本匹配否则会出现kernel编译失败。还有一个经常踩的是FlashAttention的ROCm实现有些模型默认用FA2的CUDA kernel在AMD卡上根本不会触发需要显式指定用Triton的kernel或者回退到math实现性能会有一定下降但不至于不可用。2.3 迁移一个现有推理服务到AMD卡要付出多少成本很多人关心的是把我现在跑在NVIDIA上的推理服务搬到AMD上工作量有多大。我的答案取决于你用的框架抽象程度。如果你用的是vLLM或者TGI这种高层框架而且模型本身是社区常见的架构Llama、Qwen、Mistral那迁移成本很低可能只是改改环境变量、换一下tokenizer再重新下载模型权重就行。你的推理代码如果是OpenAI兼容接口那种客户端完全不用改。如果有用到自定义CUDA kernel那就麻烦了要么重写成ROCm/HIP要么找Triton替代实现这部分工作量很难估。另外数据并行和模型并行的通信库AMD这边用的是RCCLROCm的NCCL移植版多卡场景下性能调优比NCCL要费劲一些尤其是跨节点的通信。所以我的判断是面向LLM推理AMD的软件栈已经到了可商用的最低门槛面向训练还是NVIDIA的地盘因为训练对框架依赖太深AMP自动混合精度库、分布式训练的成熟度差距比较大。Embedded LLM这个平台瞄准的场景也确实是推理而不是训练这个定位跟AMD当前的技术现状是匹配的。3. 算力变现的商业模式拆解平台到底在赚什么钱3.1 算力供给方和需求方的双向撮合逻辑什么是好的算力变现平台站在供需两端看就清楚了。需求方比如一个做AI应用的小团队需要的是便宜、稳定、有模型结果返回的推理服务它不想管GPU、不想管驱动、甚至不想管模型部署。供给方比如持卡的企业、数据中心需要的是把闲置算力利用起来、在合规前提下产生现金流。过去的算力市场供需两端的匹配效率非常低。需求方要去各个云平台比价、测试、担心供应商跑路供给方要去自己找客户、搞计费、搞客服。Embedded LLM这类平台做的事情本质上是把算力批发变成服务零售不再按整卡月租出售而是按实际推理消耗量Token数零售。平台在中间的差价就是它的毛利。这个模式能不能跑通核心看两个指标一是算力利用率能否拉起来。闲置的AMD卡接入平台后如果一天能接到足够多的推理请求供给方赚到的钱会高于整机租赁收入二是平台是否真的能把NVIDIA的存量需求迁移到AMD上来。如果需求端只是因为AMD便宜而过来而不是因为AMD本身的技术优势那这个商业模式就有被价格战打穿的风险。3.2 计费模式设计按Token、按时长、还是按节点变现平台绕不开的环节是定价。我梳理了一下目前主流的算力计费模式有四种各自适用的场景完全不同计费模式原理适用场景AMD平台的优势按Token计费按模型生成的Token数量收费LLM API服务、应用集成显存大、可跑大模型单Token成本低按小时/按天计费按GPU占用时长收费开发者调试、微调、批量任务单价低于同档NVIDIA卡预留实例预付费锁定一段时间的专属算力对延迟敏感的生产业务价格弹性大适合长期包收益分成平台和算力方按比例分成推理收入双方共同运营模型服务平台承担获客和运维分成空间大按Token计费是最考验技术功底的。你需要精确计算每个请求的输入输出Token数、能准确统计服务端实际处理的Token总数最关键的是要防止占着算力不生产的情况——有的客户挂着长连接不发送请求你得有对应的超时回收机制。按小时计费相对简单但竞争更激烈因为客户会拿你和NVIDIA卡的价格做直接对比。在这个平台上我反而最看好预留实例和收益分成两种模式。AMD卡的价格优势不是微弱的5%、10%而是同显存容量下可能便宜40%以上。对于批量推理、离线生成这类对延迟不是极致敏感的业务来说用长期预留的AMD卡能把单位成本压得非常低。而收益分成模式适合那些有模型但没算力、有客户但没分发渠道的团队平台负责GPU侧你负责模型侧最后按收入分账两边风险共担。3.3 多租户隔离与安全陌生人之间怎么互相信任算力变现平台最容易被忽视但最致命的问题是安全。当供给方和需求方是陌生人时你必须回答三个问题。第一个问题是租户隔离。多个客户共享一张GPU跑推理时一个客户的显存刷爆了会不会影响隔壁一个客户提交的恶意prompt会不会导致进程崩溃进而影响其他人的服务解决方案不外乎三种进程级隔离每个租户独立进程、容器级隔离gVisor/Kata这类安全容器、以及GPU分区技术。目前大多数轻量化平台用的是进程加容器方案配合cgroup限制CPU和内存显存层面靠的是CUDA/HIP的进程隔离机制但说实话硬隔离程度有限。如果平台要做高价值客户的生产级业务这个坑迟早要补。第二个问题是数据安全。客户把业务数据发到别人的GPU上做推理数据在内存里、在显存里、在日志里都是明文。平台至少要提供端到端加密传输、显存释放时的数据擦除、日志脱敏。如果客户有更高级别的合规要求可能还需要TEE可信执行环境方案但AMD的SEV-SNP在AI推理场景还很不成熟所以目前大多数平台在数据安全上打的是合同约束传输加密的底子。第三个问题是用量证明。客户说你这个卡太慢了只生成了100个token供给方说我明明处理了1000个没有可信的计费凭证纠纷迟早会发生。所以平台一定要做可审计的日志链路每个请求的进入时间、排队时长、处理时长、输入输出Token数、GPU利用率都要记录在案而且要对需求方开放查询接口。这部分的工程投入会远超你的想象但也正是这类脏活累活构成了平台的护城河。4. 把AMD GPU接进变现平台从选卡到上线的完整实操4.1 硬件选型什么样的AMD卡适合接入不是所有AMD GPU都适合做LLM推理变现。我先给一个选卡建议表再解释为什么显卡型号显存适合场景是否推荐接入Instinct MI300X192GB HBM3大模型推理、70B级别单卡部署强烈推荐Instinct MI325X256GB HBM3E超大模型推理、长上下文强烈推荐Instinct MI210/MI25064GB/128GB HBM2E中小模型推理、微调可以接入Radeon RX 7900系列24GB GDDR6小模型实验、个人开发不建议商用Instinct MI10032GB HBM2老架构、ROCm支持有限不推荐选卡的核心原则是显存容量决定了你能跑多大的模型显存带宽决定了你能跑多快而能不能进入ROCm的官方支持列表决定了你会不会踩坑。MI100这种老卡虽然便宜但ROCm版本支持的天花板很低很多新框架版本直接放弃你贪便宜拿到手反而成了吞时间的黑洞。RX 7900这类消费级卡虽然便宜但24GB显存跑现在的开源大模型很吃力而且驱动栈、稳定性跟Instinct系列完全不是一个级别商用场景别碰。如果预算只够买消费卡我的建议是先去平台试试水别急着大规模投入。4.2 软件环境搭建从裸机到能跑推理服务拿到卡之后第一步是装系统。推荐Ubuntu 22.04 LTS内核直接选官方支持列表里的版本。ROCm安装现在有两条路一条是直接用官方的Docker镜像一条是宿主机装ROCm再加Python环境。我建议你要是只做推理服务直接用Docker镜像干净、可复现、版本可控要是还需要在宿主机上跑训练、调试算子那就老老实实装宿主机版本因为容器里的调试体验确实一般。宿主机安装大概是这么几步# 1. 添加AMD ROCm官方软件源 wget https://repo.radeon.com/amdgpu-install/latest/ubuntu/jammy/amdgpu-install_6.3.60302-1_all.deb sudo apt install ./amdgpu-install_6.3.60302-1_all.deb sudo amdgpu-install --usecaserocm # 2. 验证ROCm环境 rocminfo | grep -i Marketing Name hipconfig --full # 3. 安装PyTorch的ROCm版本关键镜像源要对 pip install torch2.4.0 --index-url https://download.pytorch.org/whl/rocm6.0 # 4. 安装vLLM的ROCm版本 pip install vllm0.6.3.post1rocm这三步看着简单实际的坑主要在版本匹配上。PyTorch、ROCm、vLLM三者的版本必须咬合在一起不是各装最新的就完事。我的经验是先确定ROCm版本再去找对应的PyTorch官方ROCm wheel最后选一个跟这个PyTorch版本匹配的vLLM。顺序反了就会遇到各种ABI不兼容的报错包括但不限于undefined symbol、hipErrorNoBinaryForGpu。还有一个容易被忽略的点某些主板的IOMMU设置会影响AMD GPU的DMA操作如果你发现推理服务偶尔卡死先去看看BIOS里的IOMMU和ACS设置这问题跟ROCm版本无关纯属硬件平台层面的玄学。4.3 用vLLM部署并接入变现平台的完整流程环境装好之后部署一个推理服务并接入平台核心流程分四步。第一步是把模型下载好整理成标准格式。比如我们部署Qwen2.5-72B-Instruct用Hugging Face的API拉权重要指定rocm兼容的tokenizer配置。第二步是启动vLLM服务python -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen2.5-72B-Instruct \ --tensor-parallel-size 1 \ --max-model-len 32768 \ --gpu-memory-utilization 0.92 \ --host 0.0.0.0 \ --port 8000第三步是验证服务连通性。用OpenAI SDK直接调这个端口from openai import OpenAI client OpenAI(base_urlhttp://localhost:8000/v1, api_keyEMPTY) resp client.chat.completions.create( modelQwen/Qwen2.5-72B-Instruct, messages[{role: user, content: 用一句话解释什么是算子}], temperature0.7 ) print(resp.choices[0].message.content)第四步是把服务注册到平台。平台一般会给一个节点注册脚本会跑一个健康检查和基准测试测一下你这张卡的实际吞吐量、首Token延迟然后根据测试结果给你一个算力评级决定你的服务能接多大的流量、按什么价格计费。这一步特别提醒别在平台跑基准测试的时候偷偷调低--max-model-len来刷高吞吐数据平台后续会按实际生产流量跟你对账作弊只会导致评级和实际承载能力不符最后吃亏的还是你自己。4.4 性能调优让AMD卡赚更多的钱同样是MI300X不同配置下的收入差距可以到一倍以上。因为变现平台按Token计费时单位时间的Token产出量直接决定了你每小时的收入。我实测了几个重要的调优参数分享给大家第一是--gpu-memory-utilization。默认值0.9但如果你要跑长上下文建议留一点余量我会调到0.92~0.95。这个参数决定KV Cache能占多大空间直接影响并发能力。但别贪设太高会导致显存碎片化反而触发OOM。第二是并发度--max-num-seqs。这个参数控制一个批次同时处理多少个请求。对AMD卡来说因为显存带宽大并发度可以适当调高我通常从默认的256调到512左右配合PagedAttention能明显提升吞吐。第三是--enable-prefix-caching。如果你的服务面向聊天机器人这类有固定system prompt的场景开启前缀缓存可以省掉大量重复的prefill计算实测在长system prompt场景下吞吐能提升30%以上。第四是编译优化。ROCm支持通过hipcc --offload-arch指定目标架构如果你能确认你的部署架构可以给vLLM配一个针对性编译的算子库减少JIT编译带来的启动延迟和kernel dispatch开销。这些调优看起来琐碎但真实影响是同一个模型调优前后的吞吐可以从每秒800 token提升到1500 token。在按Token计费的模式里这就意味着收入翻倍。我建议每个接入平台的持卡用户都建一个自己的benchmark脚本每次改配置都跑一遍留存数据方便跟平台的对账单比对。别嫌麻烦这钱省不了。5. 这张桌子怎么排生态影响、平台风险与普通人怎么上车5.1 对NVIDIA算力价格体系的潜在冲击稍微把视角拉远一点。如果AMD GPU变现平台真的跑起来了首当其冲被影响的是NVIDIA算力的价格体系。目前H100的价格那么坚挺供需紧张是一方面更关键的是没有足够强的替代品。MI300X的显存和带宽在推理场景完全不虚H100之前差距在软件和生态。如果Embedded LLM把AMD算力的分发做得足够顺滑让需求方能像租NVIDIA卡一样租AMD卡那对价格敏感的推理业务来说转向AMD的诱惑太大了。具体点说推理成本在大模型应用的总成本里占比很高尤其是长上下文和批量生成场景。同样是1000万Token的日处理量用H100和用MI300X的成本差距可能达到一半以上。这个成本优势一旦通过变现平台传导到需求端会有大量非延迟敏感业务从NVIDIA迁移过来。对广大开发者来说这是好事——价格战意味着更低的算力成本意味着AI应用的毛利空间变大。5.2 平台方的三座大山稳定性、信任与生态绑定但作为从业者我也要冷静说一句这类平台没那么容易做起来。三个风险点每一个都可能让项目翻车。第一是算力供给的稳定性。算力提供方不是专业云厂商没有SLA意识今天说好了7x24小时在线明天机房断电了、网络断了、GPU驱动崩了客户那边体验就会很差。平台需要在每个节点上部署实时健康检查、故障自动摘除、补偿机制这背后是大量的监控和运维工程。第二是信任建立。让客户把生产流量放到一个刚上线的平台上难度极大。客户会问你们跑路了怎么办我的数据安全吗你说故障了有补偿拿什么担保创业团队通常的回答是我们有第三方托管、有保险、有审计但最终能给出可信答案的平台少之又少。这个信任壁垒不是靠融资新闻能砸开的。第三是AMD生态的绑定风险。平台把整个商业逻辑押在AMD的ROCm生态上如果AMD某天改了策略、调整了驱动接口、或者官方下场自己做算力市场平台就会非常被动。所以聪明的平台一定会同时做技术中立化把对特定厂商的依赖降到最低让接入NVIDIA GPU也只是改个后端配置的事。如果你问我对这个平台的长期判断我会说看它六个月后是继续死磕AMD还是开始让平台支持异构GPU。前者说明它想做深后者说明它想做大。5.3 开发者、持卡用户、模型创业团队各自的机会窗口最后说说不同角色的人在这波机会里怎么卡位。如果你是持卡用户手里有一批AMD Instinct卡当前最重要的不是急着挂上去赚钱而是先把卡的调度、监控、安全基线做好。你可以先接入平台试运行选收益分成模式让平台帮你找客户跑一个月看看真实收益和故障率再决定是否加大投入。如果你自己有运维能力也可以同时把卡挂到两三个平台做对比毕竟市场需求方不会只在一个平台下单。如果你是AI应用开发者可以去研究一下这类平台的API提前把推理服务从不依赖特定GPU的框架上抽象好。我的建议是你的推理层只用OpenAI兼容接口底层不管是NVIDIA还是AMD都无所谓。这样当AMD算力的价格优势传导到你面前时你能第一个切换过去。别等到别人已经用上便宜算力把价格打下来了你还在纠结迁移成本。如果你是做模型服务、模型微调的创业团队这波机会的核心是把模型能力产品化。你有模型、有客户缺的是便宜算力。接入这类AMD变现平台相当于用更低的成本交付同样的服务直接体现在毛利率和报价竞争力上。你甚至可以把模型打包成私有API挂到平台上做收益分成让平台帮你导流。有一点要提醒别把全部业务押在一个算力平台上一定要保留一个NVIDIA的备用通道毕竟任何初创平台都有跑路或倒闭的可能你的客户交付承诺不能跟着一起倒。我个人觉得真正的机会不在于做平台的跟随者而在于围绕AMD算力变便宜了这件事重构自己的成本结构。当算力市场出现结构性价格变化时最先调整成本结构的人会在下一轮竞争中拿到最大的红利。这个逻辑在云计算时代验证过一次在今天的AI算力市场大概率会再验证一次。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门