拓冰建站拓冰建站
首页 / 资讯中心 / 正文

CANN/GE ATC算子调试参数说明

--op_debug_level【免费下载链接】geGEGraph Engine是面向昇腾的图编译器和执行器提供了计算图优化、多流并行、内存复用和模型下沉等技术手段加速模型执行效率减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/ge产品支持情况全量芯片支持功能说明算子debug功能开关。关联参数如果要自行指定算子编译的过程文件存放路径需--op_debug_level取值为非0与--debug_dir配合使用。参数取值参数值0默认值不开启算子debug功能在当前执行路径不生成算子编译目录kernel_meta。1开启算子debug功能在当前执行路径生成kernel_meta文件夹并在该文件夹下生成*.o算子二进制文件、*.json文件算子描述文件和TBE指令映射文件算子cce文件*.cce和python-cce映射文件*_loc.json用于后续分析AICore Error问题。Ascend 950PR/Ascend 950DT不会生成TBE指令映射文件。2开启算子debug功能在当前执行路径生成kernel_meta文件夹并在该文件夹下生成*.o算子二进制文件、*.json文件算子描述文件和TBE指令映射文件算子cce文件*.cce和python-cce映射文件*_loc.json用于后续分析AICore Error问题同时设置为2还会关闭编译优化开关、开启ccec调试功能ccec编译器选项设置为-O0-g。Ascend 950PR/Ascend 950DT不会生成TBE指令映射文件。3不开启算子debug功能在当前执行路径生成kernel_meta文件夹并在该文件夹中生成*.o算子二进制文件和*.json文件算子描述文件分析算子问题时可参考。4不开启算子debug功能在当前执行路径生成kernel_meta文件夹并在该文件夹下生成*.o算子二进制文件、*.json文件算子描述文件、TBE指令映射文件算子cce文件*.cce和UB融合计算描述文件{$kernel_name}_compute.json可在分析算子问题时进行问题复现、精度比对时使用。Ascend 950PR/Ascend 950DT不会生成TBE指令映射文件和UB融合计算描述文件。参数值约束进行模型转换时建议配置为0、3或4。如果需要定位AICore Error问题则需要将参数值设置为1或2。设置为1或2后由于加入了调试功能会导致网络性能下降。若--op_debug_level配置为0同时配置了--op_debug_config参数该场景下在执行atc命令当前路径会保留算子编译目录kernel_meta。若--op_debug_level配置为0同时设置了NPU_COLLECT_PATH环境变量则会始终保留编译目录kernel_meta若设置了ASCEND_WORK_PATH环境变量则保留在该环境变量指定路径下若无ASCEND_WORK_PATH环境变量则保留在当前执行路径。配置为2即开启ccec编译选项时会导致算子Kernel*.o文件大小增大。动态Shape场景下由于算子编译时会遍历可能的Shape场景因此可能会导致算子Kernel文件过大而无法进行编译此种场景下建议不要配置ccec编译选项。由于算子Kernel文件过大而无法编译的报错日志示例如下message:link error ld.lld: error: InputSection too large for range extension thunk ./kernel_meta_xxxxx.odebug功能开关打开场景下若模型中含有如下通算融合算子算子编译目录kernel_meta中不会生成下述算子的*.o、*.json、*.cce文件。MatMulAllReduceMatMulAllReduceAddRmsNormAllGatherMatMulMatMulReduceScatterAlltoAllAllGatherBatchMatMulBatchMatMulReduceScatterAlltoAll推荐配置及收益无。示例atc --op_debug_level1 ...使用约束算子编译生成的调试文件存储路径除--debug_dir参数设置的方式外还可以配置环境变量ASCEND_WORK_PATH几种方式优先级为配置参数“--debug_dir”环境变量ASCEND_WORK_PATH 默认存储路径。关于ASCEND_WORK_PATH的详细说明请参见《环境变量参考》。该参数优先级高于算子编译接口TBE DSL的build接口或者TBE TIK的BuildCCE接口中的tbe_debug_level的值。【免费下载链接】geGEGraph Engine是面向昇腾的图编译器和执行器提供了计算图优化、多流并行、内存复用和模型下沉等技术手段加速模型执行效率减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/ge创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门