optimizing-attention-flash - Flash Attention Transformer 注意力优化
通过 PyTorch SDPA、flash-attn 库、H100 FP8 及滑动窗口注意力优化 Transformer 注意力机制。
标签
更新于: 2026-06-30能力
典型输入
典型输出
该技能可以做什么
- 启用 Flash Attention 后端
- 替换标准注意力计算
- 基准测试注意力速度与显存
- 验证输出精度一致性
- 启用滑动窗口注意力
- 启用多查询注意力支持
- 转换注意力输入为 FP8
- 在 H100 上运行 FP8 注意力
输入
- 查询、键、值张量
- 含注意力层的 PyTorch 模型
- NVIDIA GPU 设备
输出
- 优化后的注意力输出张量
- 性能基准测试结果
- 精度对比结果
要求
- PyTorch 2.2+ 以支持原生 SDPA
- NVIDIA Ampere+ GPU 或 AMD MI200+
- CUDA 12.0+(最低 11.8)
- flash-attn 库用于高级功能
- 需要 float16 或 bfloat16 数据类型
- H100 GPU 用于 FP8 支持
