LogoClawIndex
案例技能关于
LogoClawIndex

optimizing-attention-flash - Flash Attention Transformer 注意力优化

通过 PyTorch SDPA、flash-attn 库、H100 FP8 及滑动窗口注意力优化 Transformer 注意力机制。

标签

更新于: 2026-06-30

能力

典型输入

典型输出

该技能可以做什么

  • 启用 Flash Attention 后端
  • 替换标准注意力计算
  • 基准测试注意力速度与显存
  • 验证输出精度一致性
  • 启用滑动窗口注意力
  • 启用多查询注意力支持
  • 转换注意力输入为 FP8
  • 在 H100 上运行 FP8 注意力

输入

  • 查询、键、值张量
  • 含注意力层的 PyTorch 模型
  • NVIDIA GPU 设备

输出

  • 优化后的注意力输出张量
  • 性能基准测试结果
  • 精度对比结果

要求

  • PyTorch 2.2+ 以支持原生 SDPA
  • NVIDIA Ampere+ GPU 或 AMD MI200+
  • CUDA 12.0+(最低 11.8)
  • flash-attn 库用于高级功能
  • 需要 float16 或 bfloat16 数据类型
  • H100 GPU 用于 FP8 支持

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
Flash Attention
注意力优化
显存优化
PyTorch
Transformer
GPU 优化
FP8
SDPA
启用 Flash Attention 后端
替换标准注意力计算
基准测试注意力速度与显存
验证输出精度一致性
查询、键、值张量
含注意力层的 PyTorch 模型
NVIDIA GPU 设备
优化后的注意力输出张量
性能基准测试结果
精度对比结果