analyze-kernel-bottleneck - 分析 CUDA 内核瓶颈并选择优化方向
通过性能、Roofline、占用率、分块计算负载比和 SASS 分析,将 CUDA 内核分类为计算、内存或延迟受限。
标签
更新于: 2026-10-01能力
典型输入
典型输出
该技能可以做什么
- 测量内核基线性能
- 分类 Roofline 瓶颈
- 计算 GPU 占用率
- 计算分块计算负载比
- 检查 SASS 指令组成
- 分析指令停顿代码
- 检查共享内存占用拐点
- 选择优化策略
输入
- 已编译的 CUDA 内核
- CUDA 内核源代码
- 内核构建命令
- CUDA 基准测试程序
- 问题维度
- 目标 GPU 架构
- 预期峰值利用率
- 既有性能分析数据
输出
- 基线耗时和吞吐率指标
- 瓶颈分类结果
- 占用率分析表
- 计算负载比
- cp.async 建议
- SASS 指令计数表
- 停顿代码摘要
- 优化决策矩阵
要求
- 包含 nvcc 的 CUDA 工具包
- cuobjdump 工具
- 支持 CUDA 的 NVIDIA GPU
- CUDA 事件计时支持
- 编译和运行内核的权限
