26年奇点智能大会杨健:北航AI系统与编译优化——从体系结构到软件栈的系统级思考
演讲嘉宾杨健北京航空航天大学计算机学院副教授所属大会2026 奇点智能技术大会 · 北京对奇点智能大会2026的完整技术议题感兴趣可前往奇点大会官方渠道免费获取PPT详细资料。一、引言AI 系统的全栈视角大模型时代的到来对计算系统提出了前所未有的挑战。单一层次的优化——无论是芯片架构、编译器优化还是算法改进——都难以满足日益增长的算力需求。真正的突破来自系统级的协同优化——从晶体管到算法每一层都需要为 AI 计算重新设计。北京航空航天大学计算机学院副教授杨健是这一领域的资深研究者。他的研究横跨计算机体系结构、编译器优化和 AI 系统对软硬件协同设计有着深刻的理解。本次大会他将分享从体系结构到软件栈的系统级思考。二、AI 计算的特征与系统需求2.1 大模型计算的计算特征大模型训练与推理具有以下鲜明的计算特征特征具体表现系统影响计算密集矩阵乘占主导需要高算力硬件内存密集模型参数大需要高带宽存储通信密集分布式训练需要高速互连不规则访存Attention 模式需要灵活的数据流混合精度FP16/INT8/FP8需要灵活的数据类型支持动态性序列长度变化需要运行时优化2.2 系统级优化空间算法层 ├─ 模型架构优化Transformer 变体 ├─ 训练策略优化混合精度、梯度累积 └─ 推理优化量化、剪枝、蒸馏 软件层 ├─ 深度学习框架计算图优化、内存优化 ├─ 编译器算子融合、循环优化、自动并行 ├─ 运行时调度、内存管理、通信优化 └─ 库函数BLAS、DNN 库优化 硬件层 ├─ 处理器架构Tensor Core、脉动阵列 ├─ 存储层次HBM、缓存设计 ├─ 互连网络NVLink、RDMA └─ 系统架构多节点、多机柜三、AI 加速器架构设计3.1 主流 AI 加速器架构对比架构代表产品核心特点优势局限SIMD/GPUNVIDIA A100/H100通用并行生态成熟能效比有限脉动阵列Google TPU数据流驱动矩阵乘高效灵活性差稀疏架构各类稀疏加速器利用稀疏性稀疏场景高效通用性差存内计算各类 PIM减少数据搬运能效极高精度受限可重构架构FPGA/ CGRA硬件可编程灵活性高开发难度大3.2 面向 Transformer 的架构优化Transformer 的 Attention 机制对硬件提出了特殊要求classTransformerAccelerator:def__init__(self):self.matrix_unitsMatrixMultiplyArray()self.softmax_unitSoftmaxEngine()self.layer_norm_unitLayerNormEngine()self.activation_unitActivationEngine()defexecute_attention(self,Q,K,V):执行注意力计算# 1. Q K^Tscoresself.matrix_units.matmul(Q,K.transpose())# 2. Scalescoresscores/sqrt(d_k)# 3. Softmaxattn_weightsself.softmax_unit.compute(scores)# 4. Attn Voutputself.matrix_units.matmul(attn_weights,V)returnoutputdefexecute_ffn(self,x,W1,W2):执行前馈网络# 1. x W1hiddenself.matrix_units.matmul(x,W1)# 2. Activationactivatedself.activation_unit.gelu(hidden)# 3. hidden W2outputself.matrix_units.matmul(activated,W2)returnoutput关键架构优化优化方案效果矩阵乘优化脉动阵列 分块峰值算力利用率 80%Attention 优化在线 Softmax减少内存访问数据流优化权重驻留 数据流式减少 HBM 访问稀疏利用结构化稀疏支持2-4x 加速低精度支持FP8/INT4 原生支持2-4x 吞吐提升四、编译器优化4.1 AI 编译器架构classAICompiler:def__init__(self):self.frontendGraphFrontend()self.optimizerGraphOptimizer()self.backendCodeGenerator()defcompile(self,model):编译 AI 模型# 1. 前端解析计算图graphself.frontend.parse(model)# 2. 中间表示优化graphself.optimizer.optimize(graph)# 3. 后端生成目标代码codeself.backend.generate(graph)returncodeclassGraphOptimizer:def__init__(self):self.passes[ConstantFolding(),OperatorFusion(),MemoryPlanning(),LayoutOptimization(),Parallelization()]defoptimize(self,graph):执行优化 passforpass_inself.passes:graphpass_.run(graph)returngraph4.2 关键编译优化技术算子融合Operator FusionclassOperatorFusion:deffuse(self,graph):融合相邻算子fused_graph[]i0whileilen(graph.ops):opgraph.ops[i]# 检查是否可以与下一个算子融合ifi1len(graph.ops):next_opgraph.ops[i1]ifself.can_fuse(op,next_op):fused_opself.create_fused_op(op,next_op)fused_graph.append(fused_op)i2continuefused_graph.append(op)i1returnfused_graphdefcan_fuse(self,op1,op2):判断两个算子是否可以融合# 常见可融合模式fusion_patterns{(matmul,bias_add):True,(conv2d,batch_norm):True,(linear,relu):True,(layernorm,matmul):False,}returnfusion_patterns.get((op1.type,op2.type),False)内存规划Memory PlanningclassMemoryPlanner:defplan(self,graph,memory_budget):规划张量内存布局# 1. 分析张量生命周期lifetimesself.analyze_lifetimes(graph)# 2. 计算内存需求memory_requirements{}fortensoringraph.tensors:memory_requirements[tensor]tensor.size*tensor.dtype_size# 3. 内存分配基于生命周期的贪心分配allocations{}current_offset0fortensorinsorted(graph.tensors,keylambdat:lifetimes[t][0]):# 查找可复用的内存区域reusedself.find_reusable_memory(tensor,lifetimes,allocations,memory_budget)ifreused:allocations[tensor]reusedelse:allocations[tensor]current_offset current_offsetmemory_requirements[tensor]returnallocations五、软硬件协同设计5.1 协同设计方法论软硬件协同设计的核心思想软件需求和硬件能力相互反馈共同优化。软件需求分析 │ ├─→ 算法特征提取 │ ├─ 计算模式 │ ├─ 访存模式 │ └─ 通信模式 │ └─→ 硬件设计约束 ├─ 面积/功耗预算 ├─ 工艺节点 └─ 接口标准 │ └─→ 硬件架构设计 ├─ 计算单元设计 ├─ 存储层次设计 └─ 互连设计 │ └─→ 软件优化 ├─ 编译器优化 ├─ 运行时优化 └─ 算法适配 │ └─→ 反馈迭代5.2 案例Transformer 的软硬件协同优化层次优化效果算法FlashAttentionO(n²) → O(n) 内存软件算子融合减少 kernel 启动开销编译循环分块提升缓存命中率硬件专用 Softmax 单元降低延迟系统流水线并行隐藏通信延迟六、性能分析与调优6.1 性能分析工具链classPerformanceAnalyzer:def__init__(self):self.profilerGPUProfiler()self.memory_analyzerMemoryAnalyzer()self.communication_profilerCommunicationProfiler()defanalyze(self,model,input_shape):全面性能分析report{}# 1. 计算性能分析report[compute]self.profiler.profile(model,input_shape)# 2. 内存分析report[memory]self.memory_analyzer.analyze(model,input_shape)# 3. 通信分析分布式report[communication]self.communication_profiler.profile(model,input_shape)# 4. 瓶颈识别report[bottleneck]self.identify_bottleneck(report)returnreportdefidentify_bottleneck(self,report):识别性能瓶颈compute_utilreport[compute][utilization]memory_bw_utilreport[memory][bandwidth_utilization]comm_overheadreport[communication][overhead_ratio]ifcompute_util0.5:returnCompute underutilizationelifmemory_bw_util0.9:returnMemory bandwidth boundelifcomm_overhead0.3:returnCommunication boundelse:returnBalanced6.2 调优策略瓶颈诊断方法调优策略算力不足GPU 利用率 50%增大 batch size、算子融合内存带宽带宽利用率 90%数据复用、分块计算通信瓶颈通信占比 30%梯度压缩、通信隐藏内存不足OOM梯度检查点、模型并行延迟敏感TTFT 100msKV Cache 优化、投机解码七、未来方向7.1 技术趋势杨健教授对 AI 系统未来发展的判断专用化与通用化的平衡在专用加速器和通用处理器之间找到最优平衡近存计算减少数据搬运提升能效比光互连用光通信替代电互连突破带宽瓶颈Chiplet 架构模块化设计灵活组合自动编译优化ML 驱动的编译器优化7.2 教育与人才培养跨学科培养体系结构 编译器 AI 的复合型人才实践导向参与开源项目、竞赛、实际系统开发产学研合作与产业界合作解决真实问题八、总结杨健教授的分享将展示 AI 系统的全栈优化视角。从体系结构到编译器从硬件设计到软件优化系统级的思考是释放 AI 算力潜能的关键。2026 年 11 月奇点智能技术大会与杨健一起探索 AI 系统的优化极限。大会信息2026 奇点智能技术大会 C 及系统软件技术大会时间2026 年 11 月 20-21 日地点中国·北京万达文华酒店参会报名https://boolan.com/enroll/c1051/event/1162?channelseo立即报名了解 AI 系统的系统级优化方法