26年奇点智能大会谭颖然:沐曦光启国产GPU——从芯片设计到AI计算平台的自主可控之路
演讲嘉宾谭颖然沐曦股份光启研究院科学家所属大会2026 奇点智能技术大会 · 北京对奇点智能大会2026的完整技术议题感兴趣可前往奇点大会官方渠道免费获取PPT详细资料。一、引言国产 GPU 的破局之战在全球 AI 算力竞争日益激烈的背景下GPU 作为 AI 计算的核心芯片其自主可控已成为国家战略。沐曦股份MetaX作为国内领先的 GPU 芯片设计公司其光启研究院在国产 GPU 架构设计、软件生态建设和产业化落地方面取得了重要突破。光启研究院科学家谭颖然将出席本次大会分享国产 GPU 从芯片设计到 AI 计算平台的完整技术路线以及自主可控道路上的挑战与机遇。二、国产 GPU 的技术挑战2.1 与 NVIDIA/AMD 的差距国产 GPU 在多个维度仍面临挑战维度国际领先水平国产 GPU 现状差距制程工艺3nm/4nm7nm/12nm2-3 代算力密度1000 TFLOPS200-500 TFLOPS2-5x显存带宽5 TB/s1-2 TB/s2-3x软件生态CUDA 成熟生态自建生态巨大开发者社区数百万开发者起步阶段数量级差距工具链完善度全栈成熟基础可用显著差距2.2 自主可控的战略意义尽管存在差距国产 GPU 的发展具有不可替代的战略价值供应链安全 ├─ 避免卡脖子风险 ├─ 保障关键行业算力供应 └─ 建立自主技术体系 产业生态 ├─ 培育本土芯片设计人才 ├─ 带动上下游产业发展 └─ 形成完整产业链 技术创新 ├─ 探索差异化架构路线 ├─ 针对本土场景优化 └─ 实现技术自主迭代三、沐曦 GPU 架构设计3.1 架构设计理念沐曦 GPU 采用面向 AI 计算优化的架构设计classMetaXGPUArchitecture:def__init__(self):self.compute_unitsself.init_compute_units()self.memory_hierarchyself.init_memory()self.interconnectself.init_interconnect()definit_compute_units(self):初始化计算单元阵列return{tensor_cores:TensorCoreArray(count128),vector_cores:VectorCoreArray(count256),specialized_units:{matrix_multiply:MMAUnit(),activation:ActivationUnit(),normalization:NormUnit()}}definit_memory(self):初始化存储层次return{register_file:RegisterFile(size256 KB/SM),shared_memory:SharedMemory(size164 KB/SM),l1_cache:L1Cache(size128 KB/SM),l2_cache:L2Cache(size64 MB),hbm:HBM(capacity80 GB,bandwidth2 TB/s)}defexecute_kernel(self,kernel,grid_dim,block_dim):执行 GPU 内核forblockingrid_dim:forthreadinblock_dim:# 线程调度warpself.schedule_threads(thread)# 执行指令forinstructioninkernel.instructions:ifinstruction.typematrix_multiply:self.compute_units[specialized_units][matrix_multiply].execute(warp)elifinstruction.typeactivation:self.compute_units[specialized_units][activation].execute(warp)# ...3.2 关键技术创新沐曦 GPU 的核心技术创新创新点技术方案优势张量核心设计可变精度 MMA支持 INT8/FP16/FP32 混合精度存储架构多级缓存 HBM高带宽、低延迟互连技术高速片间互连支持多卡扩展能效优化动态电压频率调节降低功耗安全特性硬件级加密保障数据安全四、软件生态建设4.1 编程模型沐曦开发了自研的编程模型和运行时# 沐曦 GPU 编程示例importmetax_cudaasmxmx.kerneldefmatrix_multiply(A,B,C,M,N,K):矩阵乘法内核# 线程索引rowmx.blockIdx.y*mx.blockDim.ymx.threadIdx.y colmx.blockIdx.x*mx.blockDim.xmx.threadIdx.xifrowMandcolN:# 计算 C[row, col]sum0.0forkinrange(K):sumA[row,k]*B[k,col]C[row,col]sum# 主机端代码deflaunch_matmul(A,B,C):M,KA.shape K2,NB.shapeassertKK2# 配置网格和线程块block_size(16,16)grid_size((N15)//16,(M15)//16)# 启动内核matrix_multiply[grid_size,block_size](A,B,C,M,N,K)4.2 深度学习框架适配沐曦 GPU 适配了主流深度学习框架框架适配状态性能达成率PyTorch完整支持85-90%TensorFlow完整支持80-85%PaddlePaddle完整支持85-90%OneFlow合作适配80%自研框架开发中-4.3 算子库优化classMetaXOperatorLibrary:def__init__(self):self.operators{conv2d:OptimizedConv2D(),matmul:OptimizedMatMul(),attention:OptimizedAttention(),layernorm:OptimizedLayerNorm(),softmax:OptimizedSoftmax()}defoptimize_for_metax(self,model):针对沐曦 GPU 优化模型optimized_model[]foropinmodel.operations:ifop.typeinself.operators:# 使用沐曦优化算子optimized_opself.operators[op.type].optimize(op)optimized_model.append(optimized_op)else:# 回退到通用实现optimized_model.append(op)returnoptimized_model五、AI 计算平台5.1 平台架构沐曦的 AI 计算平台采用软硬件协同设计┌─────────────────────────────────────────┐ │ 应用层大模型训练、推理、微调 │ ├─────────────────────────────────────────┤ │ 框架层PyTorch/TensorFlow/Paddle │ ├─────────────────────────────────────────┤ │ 中间层沐曦运行时、算子库、通信库 │ ├─────────────────────────────────────────┤ │ 驱动层GPU 驱动、内存管理、任务调度 │ ├─────────────────────────────────────────┤ │ 硬件层沐曦 GPU 集群 │ └─────────────────────────────────────────┘5.2 大模型训练支持classMetaXLLMTraining:def__init__(self,model_config,hardware_config):self.modelbuild_model(model_config)self.hardwareMetaXCluster(hardware_config)self.distributed_strategyself.select_strategy(model_config)defselect_strategy(self,model_config):选择分布式训练策略model_sizemodel_config.num_paramsifmodel_size7e9:returnDataParallelStrategy()elifmodel_size70e9:returnTensorParallelStrategy(tp_size8)else:returnHybridParallelStrategy(tp_size8,pp_size8,dp_size4)deftrain(self,dataset,num_epochs):训练大模型forepochinrange(num_epochs):forbatchindataset:# 前向传播lossself.model(batch)# 反向传播loss.backward()# 梯度同步self.distributed_strategy.all_reduce_gradients()# 参数更新self.optimizer.step()self.optimizer.zero_grad()六、产业化挑战与对策6.1 主要挑战挑战表现对策生态建设开发者习惯 CUDA兼容层 原生优化性能优化与 NVIDIA 有差距场景针对性优化成本控制研发投入大政府支持 产业合作人才短缺GPU 设计人才稀缺产学研联合培养市场接受用户担心兼容性渐进式替代策略6.2 渐进式替代策略第一阶段新场景优先 ├─ 新建数据中心优先采用国产 GPU ├─ 不与现有 CUDA 生态冲突 └─ 积累实际运行经验 第二阶段混合部署 ├─ 国产 GPU 处理特定负载 ├─ NVIDIA GPU 处理通用负载 └─ 建立统一调度层 第三阶段逐步替代 ├─ 扩大国产 GPU 使用比例 ├─ 完善软件生态 └─ 实现主要场景自主可控七、未来展望7.1 技术路线图沐曦 GPU 的技术发展路线2024-2025完善现有架构提升软件生态成熟度2025-2027下一代架构追赶国际先进水平2027-2030实现与国际领先水平并跑2030在特定领域实现领跑7.2 产业生态建设开发者社区建立活跃的开发者社区和开源项目教育合作与高校合作培养 GPU 设计和优化人才行业标准参与制定国产 AI 芯片行业标准国际合作在合规前提下开展国际技术交流八、总结谭颖然的分享将展示国产 GPU 自主可控的完整图景。从芯片架构到软件生态从技术创新到产业化落地每一个环节都体现了中国芯片人的执着与智慧。2026 年 11 月奇点智能技术大会与谭颖然一起探索国产 GPU 的自主可控之路。大会信息2026 奇点智能技术大会 C 及系统软件技术大会时间2026 年 11 月 20-21 日地点中国·北京万达文华酒店参会报名https://boolan.com/enroll/c1051/event/1162?channelseo立即报名了解国产 GPU 的自主可控技术路线