GPU 高性能计算
目录
- 计算的硬件加速思路
- 并行策略
- GPU 编程模型
- Roofline Model —— 性能优化方向的理论指导
- 内存访问密集型高性能计算
- 高级 cuda 特性 —— 从矩阵乘法(gemm)说起
- GPU 上动态的调度 —— 从run-length-compression说起
- Cuda TMA (Tensor Memory Accelerator)
- TPU 与分布式通信原语
- TIRx 基础
- TIRx 与高性能GEMM (上)
- TIRx 与高性能GEMM (下)
- Flash Attention 4:在 Blackwell 上把 Softmax 接进 Tensor Core 流水线
- Triton 高性能编程
- 参考