LogoClawIndex
案例技能关于
LogoClawIndex

model-infer-kvcache - 优化昇腾 NPU 推理中的 KVCache

分析和优化基于 PyTorch 的昇腾 NPU LLM 推理 KVCache 实现,涵盖连续缓存、分页注意力、融合算子和 MLA 压缩缓存。

标签

更新于: 2026-10-06

能力

典型输入

典型输出

该技能可以做什么

  • 分析 KVCache 实现
  • 选择缓存优化模式
  • 构造 block_table
  • 构造 slot_mapping
  • 集成融合注意力算子
  • 优化 MLA 压缩缓存
  • 诊断内存和性能问题

输入

  • 模型架构和配置
  • KVCache 实现
  • progress.md
  • 仓库模型参考实现
  • 内存或性能问题现象

输出

  • KVCache 分析结果
  • 优化方案建议
  • 实现指导
  • 缓存布局指导
  • 注意力算子集成指导

要求

  • PyTorch 运行环境
  • 昇腾 NPU 环境
  • torch_npu 支持
  • 融合注意力算子
  • 适用时的 MLA 算子支持

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
KVCache
LLM 推理
昇腾 NPU
PyTorch
分页注意力
Flash Attention
MLA
分析 KVCache 实现
选择缓存优化模式
构造 block_table
构造 slot_mapping
模型架构和配置
KVCache 实现
progress.md
KVCache 分析结果
优化方案建议
实现指导