NVIDIA 发布 nvmath-python v1.0,提升 Python 的 GPU 数学性能
NVIDIA (NASDAQ: NVDA) 正式发布了 nvmath-python v1.0,这是其专为 Python 设计的库,结合了 CUDA-X 数学库的强大功能与科学 Python 社区的需求。该版本于 2026 年 7 月 16 日发布,带来了稳定的 API,以及对密集、稀疏、张量和分布式数学工作流的改进支持。其目标很明确:让 GPU 加速计算对开发者更易访问,无需熟悉 C++ 或 CUDA 编程。
nvmath-python 作为 NVIDIA CUDA-X 生态系统的高级抽象层,包括诸如 cuBLAS、cuFFT、cuSOLVER 及其分布式版本等库。它使得使用 NumPy、CuPy 或 PyTorch 的 Python 用户能够无缝利用 GPU 加速,执行如矩阵乘法、傅里叶变换和稀疏计算等任务——甚至可以扩展到多 GPU 和多节点系统。
重要性:Python 在科学计算领域占据主导地位,但其对基于 CPU 的库的依赖往往限制了性能。NVIDIA 的 nvmath-python 消除了这一瓶颈,为核心数学运算提供了接近原生 GPU 的速度,同时保持了开发者期望的 Python 风格简洁性。
v1.0 的主要功能
v1.0 版本引入了以下几项重要功能:
- 通用稀疏张量 (UST): 在早期版本中引入的 UST 允许用户无需编写底层代码即可定义自定义稀疏格式。v1.0 对其进行了优化,以便与 PyTorch 和 SciPy 等框架的互操作性。
- 复合操作: 该库提供了用于高级矩阵乘法等操作的融合内核,优化了低算术强度的工作负载,并减少了数据传输开销。
- 有状态的 API: 开发者现在可以在多次执行中分摊计划和自动调优的成本,这是在深度学习等重复性工作负载中至关重要的功能。
- 灵活的安装方式: 用户可以通过流行的包管理器(pip、conda)自定义安装,并根据其硬件和工作负载选择依赖项。
NVIDIA 分享的一个示例中,使用 nvmath-python 的 FFT 功能实现了一个高斯滤波器,该滤波器通过 Python 的 numba-cuda 编译自定义回调。这些使用场景展示了该库将高性能自定义内核与标准 Python 工作流集成的能力。
NVIDIA 市场地位的意义
NVIDIA 通过 nvmath-python 进军科学计算领域,符合其在 GPU 加速 AI 和高性能计算领域占据主导地位的总体战略。随着 Python 成为大多数机器学习和数据科学工作流的核心,该库巩固了 NVIDIA 硬件作为开发者追求性能又不愿牺牲可用性的首选。
截至 2026 年 7 月 30 日,NVIDIA 的股票交易价格为 $195.04,公司市值为 $4.76 万亿。nvmath-python 的发布正值 NVIDIA 持续扩展其 CUDA 生态系统之际,该生态系统一直是其在 AI 和科学计算市场占主导地位的基石。
未来展望
随着 nvmath-python v1.0 的正式发布,NVIDIA 为 GPU 加速计算在机器学习、计算生物学和物理模拟等以 Python 为主的领域的广泛应用奠定了基础。开发者现在可以通过 pip install nvmath-python[cu13] 获取该库,并在其 GitHub 仓库 上找到详细的教程和示例。
这一发布彰显了 NVIDIA 在硬件级性能与开发者友好工具之间架起桥梁的承诺,巩固了其在 GPU 驱动创新中的领导地位。