新闻中心

NVIDIA CUDA 13.3 发布:Tile C++、编译器自动调优与 Python 生态同步升级 NEWS DETAIL

当前位置:首页 > 新闻中心
资讯分类 · 新闻中心 发布时间 · 2026-07-21

NVIDIA 发布 CUDA 13.3,为 GPU 开发生态带来一组面向性能与开发体验的集中升级。此次更新覆盖 CUDA Tile C++、CUDA Python 1.0、CompileIQ 编译器自动调优框架、CCCL 3.3、NVCC 的 C++23 支持,以及多项数学库与分析工具优化,整体目标是让开发者在保持高性能的同时,更高效地构建现代 GPU 软件。

其中最受关注的变化之一,是 CUDA Tile 编程模型正式扩展到 C++。这一能力允许开发者以更高层级的 tile 方式编写 GPU kernel,同时把并行性、内存移动、异步执行等底层细节交由框架管理,从而在保留性能的前提下,提高代码可移植性与开发效率。文章还指出,CUDA Tile C++ 现已支持 Hopper 等更多架构,为现有 C++ 开发者提供了更直接的切入路径。

Python 生态方面,CUDA Python 1.0 的发布意味着相关 API 正式进入更稳定的语义化版本阶段。`cuda.core`、`cuda.bindings`、`cuda.compute` 等组件的能力被进一步整合,并新增了 green contexts、进程级 checkpoint/restore、跨进程显存共享等关键特性。这些变化有助于 Python 开发者构建更稳定的推理服务、共享集群任务和零拷贝数据通道,也让 CUDA 在 Python 侧的系统级能力更成熟。

对追求极致性能的团队而言,CompileIQ 的推出同样值得关注。文章表示,这一新的编译器自动调优框架可通过进化与遗传算法,为特定 kernel 自动生成更有针对性的编译配置。在 GEMM 和 attention 这类关键内核上,CompileIQ 对已高度优化的 Triton 与 CUTLASS kernel 仍可带来最高约 15% 的额外加速,说明编译层自动调优正开始成为 GPU 优化的新抓手。

同时,CUDA 13.3 还把更多底层能力系统化推进。CCCL 3.3 新增了 DLPack/mdspan 张量互操作、随机分布库、并行搜索与 segmented scan 等能力;NVCC 与 NVRTC 正式增强对 C++23 的支持;cuBLAS、cuSPARSE、cuSOLVER 以及 Nsight 工具链也获得了不同程度的性能和功能改进。整体来看,这不是单一特性的升级,而是从编程模型、语言标准、运行时到分析工具的一次协同演进。

对 GPU 开发者而言,CUDA 13.3 的价值在于它不只追求“更快”,也在试图降低高性能开发的门槛。无论是更现代的 C++ 抽象、更稳定的 Python 接口,还是自动化的编译优化路径,背后都在释放一个信号:未来的 GPU 软件开发,将越来越强调性能、可维护性与跨语言工作流的统一演进。