fla-triton-to-gluon - 将 FLA Triton 内核移植到 Gluon
指导将 Triton 内核增量移植到 Gluon,并保持数值一致性,同时控制显式布局、异步数据移动、MMA 和调度。
标签
更新于: 2026-10-01能力
典型输入
典型输出
该技能可以做什么
- 评估内核移植价值
- 增量翻译 Triton 内核
- 配置显式张量布局
- 管理异步内存流水线
- 集成 Hopper 和 Blackwell MMA
- 保持前向反向数值一致
- 调整编译期和自动调优设置
输入
- 现有 Triton 内核
- 算子一致性测试
- 已安装的 Triton 版本
- 目标 NVIDIA GPU 架构
- 性能测量结果
输出
- Gluon 内核实现
- 前向和反向一致性结果
- 内核性能测量结果
要求
- 支持实验性 Gluon 的 Triton
- NVIDIA GPU 环境
- 使用 cp.async 需要 Ampere 或更新架构
- 使用 TMA 和 WGMMA 需要 Hopper 或更新架构
- 使用 TMEM 和 tcgen05 需要 Blackwell
