LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

fla-triton-to-gluon - 将 FLA Triton 内核移植到 Gluon

指导将 Triton 内核增量移植到 Gluon,并保持数值一致性,同时控制显式布局、异步数据移动、MMA 和调度。

标签

更新于: 2026-10-01

能力

典型输入

典型输出

该技能可以做什么

  • 评估内核移植价值
  • 增量翻译 Triton 内核
  • 配置显式张量布局
  • 管理异步内存流水线
  • 集成 Hopper 和 Blackwell MMA
  • 保持前向反向数值一致
  • 调整编译期和自动调优设置

输入

  • 现有 Triton 内核
  • 算子一致性测试
  • 已安装的 Triton 版本
  • 目标 NVIDIA GPU 架构
  • 性能测量结果

输出

  • Gluon 内核实现
  • 前向和反向一致性结果
  • 内核性能测量结果

要求

  • 支持实验性 Gluon 的 Triton
  • NVIDIA GPU 环境
  • 使用 cp.async 需要 Ampere 或更新架构
  • 使用 TMA 和 WGMMA 需要 Hopper 或更新架构
  • 使用 TMEM 和 tcgen05 需要 Blackwell

来源

  • 规范: SKILL.md
Triton
Gluon
GPU 内核
NVIDIA
内核移植
性能优化
评估内核移植价值
增量翻译 Triton 内核
配置显式张量布局
管理异步内存流水线
现有 Triton 内核
算子一致性测试
已安装的 Triton 版本
Gluon 内核实现
前向和反向一致性结果
内核性能测量结果