新闻详情

新闻详情

首页 / 资讯中心 / 详情

Spirula Studio 的 Radix Sort 与 Prefix Scan:跨厂商 GPU 排序原语完全指南

发布时间:2026/9/30 12:38:06来源:尧图网络
Spirula Studio 的 Radix Sort 与 Prefix Scan:跨厂商 GPU 排序原语完全指南
Spirula Studio 的 Radix Sort 与 Prefix Scan跨厂商 GPU 排序原语完全指南【免费下载链接】spirula-studioCross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA.项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studioSpirula Studio 是一款跨厂商的 3D 高斯泼溅3D Gaussian Splatting训练工具能从视频一路训练到 splat 再到网格同时支持 Vulkan 与 CUDA 两种后端。而让它在 NVIDIA、AMD、Intel、Apple 显卡上跑同一套训练逻辑的关键底座之一就是本文的主角——一套跨厂商的radix sort基数排序与prefix scan前缀扫描排序原语。这篇指南会用尽量通俗的方式讲清楚它们是干什么的、怎么设计的、为什么难。为什么排序原语对 3DGS 训练这么重要3D 高斯泼溅的训练和渲染几乎每一步都绕不开排序和求前缀和原语在 Spirula Studio 中的典型用途sort_pairs键值对排序把每个 tile屏幕小块里的高斯按深度排序再按序做透明度合成inclusive_sum/exclusive_sum前缀和统计 tile 内高斯数量、生成偏移表densify 阶段 MCMC 采样的累积和select_flagged流压缩根据标志位把存活的元素紧凑地拷到一起简单说GPU 上百万级的高斯要高效地按位置、按深度组织起来排序就是最基础的那把锤子。而问题在于——NVIDIA 的 CUDA 生态有成熟的 CUB 库可以直接用但 Vulkan 是跨厂商的开放接口没有现成的设备端排序库可用。一个接口两种实现后端接缝设计Spirula Studio 的做法很优雅在 src/backend/common/SortScan.h 里只声明一套接口然后在两个后端里各写一份实现Engine 训练代码 │ ▼ backend::sort_pairs / inclusive_sum / select_flagged ← 唯一接口 ├─ CUDA 后端 → 薄封装 CUBRadixSort / DeviceScan / DeviceSelect └─ Vulkan 后端 → 自己用 Slang 写的 radix sort 前缀扫描计算核CUDA 实现见 src/backend/cuda/SortScanCuda.cu本质是把 CUB 的调用包一层保证行为与原来完全一致Vulkan 实现见 src/backend/vulkan/SortScanVulkan.cpp主机侧调度和 src/backend/vulkan/shaders/sort_scan.slangGPU 侧计算核。这样一来上层训练代码只需要知道我要排序不需要知道底下是 CUB 还是 Slang——这就是所谓的后端接缝整体架构在 src/backend/README.md 和 docs/backends.md 中有更完整的描述。Radix Sort 三趟法直方图、脊柱扫描、排名散列Vulkan 端的 radix sort 是经典的低位优先LSD三趟流水线每趟处理 8 个比特直方图Histogram把数据切成 2048 个一组的分区每个工作区workgroup统计自己分区里 0~255 每个数字出现多少次脊柱扫描Spine Scan对各分区计数做前缀和算出每个数字的全局起始位置——这一步本身就是 prefix scan两个原语在这里相遇了排名并散列Rank and Scatter每个线程用 subgroup ballot 投票算出自己这个元素在同数字里的稳定排名然后把它写到输出缓冲的正确位置。几个值得新手记住的设计点begin_bit/end_bit参数如果键值的高位全是 0比如只用低位存 tile 编号 深度可以直接跳过不需要的趟数省掉无谓的排序开销64 位键是刻意决策tile 键的结构是(tile_id 32) | depth32 位打包在大型实景数据集上会溢出所以 Vulkan 端专门编译了 64 位键的变体ping-pong 双缓冲排序结果在两块缓冲区之间来回倒腾DoubleBuffer和 CUB 的行为完全对齐上层代码无感知。Prefix Scan 两级扫描块内 全局前缀和实现用的是标准的两级工作区扫描sort_scan.slang 中的scan_blocks/scan_spine/scan_add每个 256 线程的工作区负责 2048 个元素先做块内扫描顺手记下整块的总和再对所有块总和做一次脊柱扫描得到每个块的起始偏移最后把偏移加回块内结果完成全局前缀和。支持的类型包括int32、int64以及一个特别的float版包含式前缀和——它服务于 densify 阶段 MCMC 采样的累积概率计算。文档里也诚实地标注了浮点求和的结合顺序和 CUB 不同跨后端的结果只保证在舍入误差内一致这是数值计算的正常现象。select_flagged流压缩则是前缀和 散列 计数回读的组合拳先对标志位做排他前缀和得到每个存活元素的目标位置再一次性散列过去最后回读一个数告诉调用方选出了多少。跨厂商的隐形深坑这些细节才真正值钱在单一 GPU 上写排序不难难的是在每一家厂商的驱动上都对。Spirula Studio 的 Vulkan 实现处理了不少硬骨头详见 src/backend/vulkan/README.md 的 Sort / scan 一节不假设 subgroup 宽度NVIDIA 是 32 线程一组AMD 是 64Intel 甚至可变。所有 ballot 排名代码用uint4掩码写成宽度无关的形式主机侧还会主动钉住 subgroup 尺寸——Intel 驱动上不定尺寸排序会静默产出错误结果没有 64 位整数特性就自己模拟部分老设备不支持shaderInt64实现里用uint2字对模拟 64 位键与扫描累加器内存布局与原生版本一致同一套入口名通吃共享内存 bank 冲突排序散列阶段的排名暂存区一开始让 32 条 lane 挤在同两个 bank 上转置布局后直接收回了整个分箱阶段 12% 的时间。这些经验大多被写进了官方文档是踩坑记录级别的干货。怎么验证和 CPU 参考实现逐条对答案排序原语的正确性由 src/backend/vulkan/tests/vk_sortscan_test.cpp 把关。它的思路非常朴实——用 CPU 当裁判生成随机键值对用std::stable_sort算出参考顺序逐位比对 GPU 结果顺带验证了稳定性覆盖 32/64 位键、非 8 倍数的比特区间、重复键洪泛、空输入、以及超过 65535 网格折叠上限的超大尺寸等边界扫描与流压缩同样与 CPU 前缀和逐元素比对。测试在 NVIDIA 私有驱动、Mesa ANVIntel 开源驱动、llvmpipe软件渲染上全部跑通且验证层零警告——这正是跨厂商三个字最硬核的注脚 ✅延伸阅读与代码导航想读什么去哪里排序/扫描/压缩的统一接口src/backend/common/SortScan.hCUDA 端CUB 封装实现src/backend/cuda/SortScanCuda.cuVulkan 端主机侧调度src/backend/vulkan/SortScanVulkan.cppVulkan 端 GPU 计算核Slangsrc/backend/vulkan/shaders/sort_scan.slang正确性测试src/backend/vulkan/tests/vk_sortscan_test.cpp后端架构总览docs/backends.md移植风险与性能笔记src/backend/README.md小结Spirula Studio 的 radix sort 与 prefix scan 是一组教科书级的跨厂商 GPU 原语设计范例一套接口、两种实现、CPU 对答案、坑全部写进文档。它把 CUB 在 CUDA 生态中的地位用 Slang 计算核在 Vulkan 生态里重新搭了出来为上层的高斯泼溅训练换上了真正与厂商无关的双腿。如果你想给任何开源 GPU 项目添加跨厂商排序能力这套模式——接口先行、双后端实现、奇偶校验测试——都非常值得直接借鉴 【免费下载链接】spirula-studioCross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA.项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

“一数一源”怎么真正落地:从 17 家单位主数据整合看标准先行 2026/9/30 14:16:38

“一数一源”怎么真正落地:从 17 家单位主数据整合看标准先行

“一数一源”怎么真正落地:从 17 家单位主数据整合看标准先行 标签:#数据标准 #数据治理 #主数据 #数据目录 #数据质量 摘要: "一数一源、一源多用"喊了很多年,多数组织停留在口号——源头没人认定、标准各写各的、目录…

阅读更多 →
跨境卖家自己修改专利文件,和委托美国专利代理人修改差别在哪? 2026/9/30 14:16:25

跨境卖家自己修改专利文件,和委托美国专利代理人修改差别在哪?

跨境卖家自己修改美国专利文件,主要节省的是代理服务费,但需要自行承担格式、技术表述、权利要求范围和程序节点方面的风险。委托美国专利代理人修改,则是由熟悉美国专利审查规则的专业人员处理,适合涉及权利要求调整、审查意见答…

阅读更多 →
2026反爬技术全景:从设备指纹到行为识别的五层攻防拆解 2026/9/30 14:16:01

2026反爬技术全景:从设备指纹到行为识别的五层攻防拆解

一、行业背景与技术演进 过去两年,Web防护体系完成了一次根本性的技术迭代。如果说2024年之前的对抗还停留在浏览器特征伪装与IP轮换层面,那么进入2026年,防守方已经构建起从网络协议到硬件特征、从静态属性到动态行为的完整检测矩阵。 对于工业数据采集领域而言,单纯修改…

阅读更多 →
企业文档类型太杂怎么管?zyplayer-doc统一管理Office、接口文档和知识库 2026/9/30 14:15:55

企业文档类型太杂怎么管?zyplayer-doc统一管理Office、接口文档和知识库

企业文档类型太杂怎么管?zyplayer-doc统一管理Office、接口文档和知识库 企业选文档管理系统时,很容易遇到一个现实问题:行政资料主要是Word和PDF,研发团队写Markdown和API接口文档,产品团队还要维护流程图、表格&…

阅读更多 →
YOLO26 + .NET 9 Native AOT实战:纯C#工业视觉单EXE零依赖仅30MB 2026/9/30 14:15:54

YOLO26 + .NET 9 Native AOT实战:纯C#工业视觉单EXE零依赖仅30MB

做工控视觉这两年,最头疼的就是现场部署。 工控机大多是精简版Windows,缺VC++库、缺.NET运行时是常态,装个环境半小时起步。程序本体加ONNX Runtime、OpenCV、模型文件,DLL一大堆,少一个版本不对就弹窗报错,每次去现场都要背个U盘拷满文件,折腾一两个小时很正常。 最近…

阅读更多 →
MindSpore Transformers 大模型训练迁移:获取 GPT Layer 本地加速 2026/9/30 14:15:54

MindSpore Transformers 大模型训练迁移:获取 GPT Layer 本地加速

摘要在将 GPT 系列模型从 PyTorch 迁移至 MindSpore Transformers 训练场景中,get_gpt_layer_local_spec是分布式训练核心接口,用于定义 Transformer 层本地切分规范、张量并行布局、权重分片描述。在昇腾 910 集群进行 GPT 大模型迁移时,该接…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉