拓冰建站拓冰建站
首页 / 资讯中心 / 正文

从GPT-5.6 Sol的Ultrafast模式看推理速度竞赛:750 token/秒背后,Cerebras的晶圆级生意

从GPT-5.6 Sol的Ultrafast模式看推理速度竞赛750 token/秒背后Cerebras的晶圆级生意同一颗大模型输出速度一夜之间变成原来的14倍——8月13日晚OpenAI与Cerebras联合宣布推出GPT-5.6 Sol的Ultrafast极速推理模式有限预览开放。速度数字本身已经够刺激最高750 token/秒约为标准处理速度的14倍。但比速度更值得拆解的是支撑这场提速的硬件故事——一家营收翻倍却亏损扩大的晶圆级芯片公司为什么正在成为大模型推理速度竞赛的主角。先把新闻锚点对齐。8月13日晚OpenAI与Cerebras联合推出GPT-5.6 Sol的Ultrafast模式并开放有限预览该模式由Cerebras晶圆级硬件驱动输出速度最高750 token/秒约为标准处理速度的14倍。与此同时Cerebras公布2026财年Q2财报核心营收2.098亿美元、同比增长103%其中云与服务收入1.277亿美元、同比增长287%硬件收入8210万美元、同比增长17%但每股净亏损2.98美元超出分析师预期1.31美元盘后股价一度跌逾16%公司在手RPO剩余履约义务订单254亿美元并上调全年指引。一、推理速度为什么突然成了硬通货两年前大模型竞赛的焦点是训练——谁能训出更强的模型现在焦点正在转向推理——谁能让模型在用户面前响应得更快。速度的含金量来自三个层面。第一是体验层750 token/秒意味着一个500字的段落几乎秒出对话不再有等待感用户对AI是否好用的体感会发生质变。第二是应用层实时语音、代码补全、Agent自主执行这些场景对延迟极其敏感——Agent每多等一秒多轮任务的完成时间就成倍放大速度直接决定Agent能不能跑起来像真人。第三是经济学层推理越快单位时间处理的任务越多同样的算力成本可以服务更多用户对按token收费的API生意而言速度就是单位成本的分母。层面速度的价值典型场景体验层消除等待感、体感质变对话、写作助手应用层支撑实时多轮任务语音、代码补全、Agent经济学层摊薄单token成本API服务、批量任务所以当OpenAI选择把Ultrafast模式与Cerebras绑定行业读出的信号很明确速度本身已经成为旗舰模型商业化的核心卖点之一而实现它的硬件路径正在从英伟达GPU的既定轨道上分叉。二、晶圆级引擎是什么一整片晶圆就是一颗芯片Ultrafast的底牌是Cerebras的晶圆级引擎WSE。理解它需要先理解传统芯片的切片逻辑。常规的GPU/加速芯片是把一整片硅晶圆切成几十上百颗小芯片每颗独立封装、再通过外部高速接口互联。问题在于芯片之间的数据传输速度远低于芯片内部大模型推理恰恰是数据搬运密集型的活——模型权重要在内存和计算单元之间反复流动跨芯片通信就成了瓶颈。晶圆级引擎的思路是反着来不做切片把一整片晶圆直接做成一颗巨大的芯片。好处是显而易见的——片上存储SRAM容量巨大且带宽极高模型权重可以整个放在芯片上不用反复访问外部内存推理速度因此大幅提升代价也同样明显整片晶圆只要有一个坏点整颗芯片就报废良率挑战巨大这也是晶圆级路线几十年无人真正商业化的原因。对比维度传统GPU方案晶圆级引擎方案芯片形态晶圆切成多颗小芯片整片晶圆做一颗芯片数据搬运跨芯片互联慢全在片上快内存瓶颈HBM带宽受限片上SRAM带宽极高良率与成本成熟可控挑战大、门槛高Cerebras的差异化在于它绕开了主流玩家围绕HBM高带宽内存展开的军备竞赛用超大芯片超大片上存储的路线在大模型推理这个场景上打出了别人短时间追不上的速度优势。三、营收翻倍、亏损扩大财报里的速度生意两面Ultrafast发布同日Cerebras的财报把这家公司的商业模式摊开了增长速度惊人但亏损同样惊人。核心营收同比增长103%其中云与服务收入同比大增287%——云服务已经成为绝对主力说明客户更多是在租算力而非买芯片。硬件收入只增长17%增速明显低于云印证了商业模式从卖硬件向卖服务的转型。另一边每股净亏损2.98美元、超分析师预期1.31美元盘后股价一度跌逾16%——市场对增长换亏损的定价依然很严厉。但财报里最值得注意的数字是RPO254亿美元的在手订单。这意味着未来数年的大额算力合同已经锁定市场对晶圆级算力的需求是真实存在的。用一句话概括这家公司的处境用当下的巨额亏损赌一个已经被订单部分验证的未来。指标2026财年Q2同比变化信号核心营收2.098亿美元103%高速增长云与服务收入1.277亿美元287%商业模式转向服务硬件收入8210万美元17%硬件销售放缓每股净亏损2.98美元超预期1.31美元亏损扩大在手RPO订单254亿美元—未来数年需求锁定四、推理速度竞赛的三条路线Ultrafast不是孤立事件。把视角拉高当前推理速度竞赛正沿着三条路线同时推进。第一条是英伟达主导的GPU集群路线继续堆大模型集群的算力密度与互联带宽靠规模与生态取胜。这是最成熟也最主流的路线但HBM供应紧张、集群功耗与成本高企让堆出来的边际收益在下降。第二条是专用推理芯片路线为推理场景定制架构在特定模型和任务上做到极致性价比典型代表是各家自研的推理加速器。第三条就是晶圆级路线用超大单芯片和片上存储直接改变数据搬运的游戏规则目前玩家稀少、门槛极高但速度优势显著。三条路线各有拥趸而OpenAI的这次合作相当于给晶圆级路线投下了一张重量级信任票当旗舰模型的供应商主动选择非英伟达的推理硬件说明速度竞争已经激烈到英伟达的默认选项不够用的地步。路线代表优势短板GPU集群英伟达生态成熟、生态全HBM紧张、功耗高专用推理芯片各家自研加速器性价比高通用性有限晶圆级引擎Cerebras速度极致、带宽大良率难、玩家少五、对从业者意味着什么三个判断推理速度竞赛加速对科技从业者至少有三个实质影响。其一选型逻辑要加上速度维度。过去选模型看能力、看价格现在还要看速度与延迟——同样能力的模型响应速度差一个数量级应用体验和成本结构就完全不同。Ultrafast这类模式的开放意味着速度正在成为可采购的差异化服务。其二推理成本结构将被重估。速度提升14倍如果单价不按同比例上涨单位任务的推理成本就大幅下降——这对Agent类、批处理类应用的商业模式是实质利好。反过来对按推理时长计费的云厂商这也是一个需要重新定价的信号。其三英伟达的默认选项地位首次被实质性挑战。OpenAI与Cerebras的绑定加上晶圆级硬件进入旗舰模型供应链标志着推理硬件市场从一家独大走向多路线竞争。对算力采购者而言这长期是好事多一个可选的供给路线就多一分议价空间。六、接下来盯什么Ultrafast模式目前只是有限预览未来几周有三个节点值得跟踪。一是正式放量与定价750 token/秒的速度能否规模化交付、价格如何设定将直接决定这条路线能不能从炫技变成生意。二是Cerebras的产能与良率爬坡254亿美元订单的履约进度是晶圆级路线最大的不确定性。三是英伟达的回应面对推理速度的正面竞争GPU阵营会降价、提速还是推出针对性产品——这轮攻防将决定未来两年推理算力市场的格局。750 token/秒是速度的起点不是终点。当推理速度成为旗舰模型的卖点算力市场的下一个十年恐怕已经从比谁算得快悄悄变成了比谁搬得快。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门