拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Spirula Studio 的 Radix Sort 与 Prefix Scan:跨厂商 GPU 排序原语完全指南

Spirula Studio 的 Radix Sort 与 Prefix Scan跨厂商 GPU 排序原语完全指南【免费下载链接】spirula-studioCross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA.项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studioSpirula Studio 是一款跨厂商的 3D 高斯泼溅3D Gaussian Splatting训练工具能从视频一路训练到 splat 再到网格同时支持 Vulkan 与 CUDA 两种后端。而让它在 NVIDIA、AMD、Intel、Apple 显卡上跑同一套训练逻辑的关键底座之一就是本文的主角——一套跨厂商的radix sort基数排序与prefix scan前缀扫描排序原语。这篇指南会用尽量通俗的方式讲清楚它们是干什么的、怎么设计的、为什么难。为什么排序原语对 3DGS 训练这么重要3D 高斯泼溅的训练和渲染几乎每一步都绕不开排序和求前缀和原语在 Spirula Studio 中的典型用途sort_pairs键值对排序把每个 tile屏幕小块里的高斯按深度排序再按序做透明度合成inclusive_sum/exclusive_sum前缀和统计 tile 内高斯数量、生成偏移表densify 阶段 MCMC 采样的累积和select_flagged流压缩根据标志位把存活的元素紧凑地拷到一起简单说GPU 上百万级的高斯要高效地按位置、按深度组织起来排序就是最基础的那把锤子。而问题在于——NVIDIA 的 CUDA 生态有成熟的 CUB 库可以直接用但 Vulkan 是跨厂商的开放接口没有现成的设备端排序库可用。一个接口两种实现后端接缝设计Spirula Studio 的做法很优雅在 src/backend/common/SortScan.h 里只声明一套接口然后在两个后端里各写一份实现Engine 训练代码 │ ▼ backend::sort_pairs / inclusive_sum / select_flagged ← 唯一接口 ├─ CUDA 后端 → 薄封装 CUBRadixSort / DeviceScan / DeviceSelect └─ Vulkan 后端 → 自己用 Slang 写的 radix sort 前缀扫描计算核CUDA 实现见 src/backend/cuda/SortScanCuda.cu本质是把 CUB 的调用包一层保证行为与原来完全一致Vulkan 实现见 src/backend/vulkan/SortScanVulkan.cpp主机侧调度和 src/backend/vulkan/shaders/sort_scan.slangGPU 侧计算核。这样一来上层训练代码只需要知道我要排序不需要知道底下是 CUB 还是 Slang——这就是所谓的后端接缝整体架构在 src/backend/README.md 和 docs/backends.md 中有更完整的描述。Radix Sort 三趟法直方图、脊柱扫描、排名散列Vulkan 端的 radix sort 是经典的低位优先LSD三趟流水线每趟处理 8 个比特直方图Histogram把数据切成 2048 个一组的分区每个工作区workgroup统计自己分区里 0~255 每个数字出现多少次脊柱扫描Spine Scan对各分区计数做前缀和算出每个数字的全局起始位置——这一步本身就是 prefix scan两个原语在这里相遇了排名并散列Rank and Scatter每个线程用 subgroup ballot 投票算出自己这个元素在同数字里的稳定排名然后把它写到输出缓冲的正确位置。几个值得新手记住的设计点begin_bit/end_bit参数如果键值的高位全是 0比如只用低位存 tile 编号 深度可以直接跳过不需要的趟数省掉无谓的排序开销64 位键是刻意决策tile 键的结构是(tile_id 32) | depth32 位打包在大型实景数据集上会溢出所以 Vulkan 端专门编译了 64 位键的变体ping-pong 双缓冲排序结果在两块缓冲区之间来回倒腾DoubleBuffer和 CUB 的行为完全对齐上层代码无感知。Prefix Scan 两级扫描块内 全局前缀和实现用的是标准的两级工作区扫描sort_scan.slang 中的scan_blocks/scan_spine/scan_add每个 256 线程的工作区负责 2048 个元素先做块内扫描顺手记下整块的总和再对所有块总和做一次脊柱扫描得到每个块的起始偏移最后把偏移加回块内结果完成全局前缀和。支持的类型包括int32、int64以及一个特别的float版包含式前缀和——它服务于 densify 阶段 MCMC 采样的累积概率计算。文档里也诚实地标注了浮点求和的结合顺序和 CUB 不同跨后端的结果只保证在舍入误差内一致这是数值计算的正常现象。select_flagged流压缩则是前缀和 散列 计数回读的组合拳先对标志位做排他前缀和得到每个存活元素的目标位置再一次性散列过去最后回读一个数告诉调用方选出了多少。跨厂商的隐形深坑这些细节才真正值钱在单一 GPU 上写排序不难难的是在每一家厂商的驱动上都对。Spirula Studio 的 Vulkan 实现处理了不少硬骨头详见 src/backend/vulkan/README.md 的 Sort / scan 一节不假设 subgroup 宽度NVIDIA 是 32 线程一组AMD 是 64Intel 甚至可变。所有 ballot 排名代码用uint4掩码写成宽度无关的形式主机侧还会主动钉住 subgroup 尺寸——Intel 驱动上不定尺寸排序会静默产出错误结果没有 64 位整数特性就自己模拟部分老设备不支持shaderInt64实现里用uint2字对模拟 64 位键与扫描累加器内存布局与原生版本一致同一套入口名通吃共享内存 bank 冲突排序散列阶段的排名暂存区一开始让 32 条 lane 挤在同两个 bank 上转置布局后直接收回了整个分箱阶段 12% 的时间。这些经验大多被写进了官方文档是踩坑记录级别的干货。怎么验证和 CPU 参考实现逐条对答案排序原语的正确性由 src/backend/vulkan/tests/vk_sortscan_test.cpp 把关。它的思路非常朴实——用 CPU 当裁判生成随机键值对用std::stable_sort算出参考顺序逐位比对 GPU 结果顺带验证了稳定性覆盖 32/64 位键、非 8 倍数的比特区间、重复键洪泛、空输入、以及超过 65535 网格折叠上限的超大尺寸等边界扫描与流压缩同样与 CPU 前缀和逐元素比对。测试在 NVIDIA 私有驱动、Mesa ANVIntel 开源驱动、llvmpipe软件渲染上全部跑通且验证层零警告——这正是跨厂商三个字最硬核的注脚 ✅延伸阅读与代码导航想读什么去哪里排序/扫描/压缩的统一接口src/backend/common/SortScan.hCUDA 端CUB 封装实现src/backend/cuda/SortScanCuda.cuVulkan 端主机侧调度src/backend/vulkan/SortScanVulkan.cppVulkan 端 GPU 计算核Slangsrc/backend/vulkan/shaders/sort_scan.slang正确性测试src/backend/vulkan/tests/vk_sortscan_test.cpp后端架构总览docs/backends.md移植风险与性能笔记src/backend/README.md小结Spirula Studio 的 radix sort 与 prefix scan 是一组教科书级的跨厂商 GPU 原语设计范例一套接口、两种实现、CPU 对答案、坑全部写进文档。它把 CUB 在 CUDA 生态中的地位用 Slang 计算核在 Vulkan 生态里重新搭了出来为上层的高斯泼溅训练换上了真正与厂商无关的双腿。如果你想给任何开源 GPU 项目添加跨厂商排序能力这套模式——接口先行、双后端实现、奇偶校验测试——都非常值得直接借鉴 【免费下载链接】spirula-studioCross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA.项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门