model-infer-kvcache - 优化昇腾 NPU 推理中的 KVCache
分析和优化基于 PyTorch 的昇腾 NPU LLM 推理 KVCache 实现,涵盖连续缓存、分页注意力、融合算子和 MLA 压缩缓存。
标签
更新于: 2026-10-06能力
典型输入
典型输出
该技能可以做什么
- 分析 KVCache 实现
- 选择缓存优化模式
- 构造 block_table
- 构造 slot_mapping
- 集成融合注意力算子
- 优化 MLA 压缩缓存
- 诊断内存和性能问题
输入
- 模型架构和配置
- KVCache 实现
- progress.md
- 仓库模型参考实现
- 内存或性能问题现象
输出
- KVCache 分析结果
- 优化方案建议
- 实现指导
- 缓存布局指导
- 注意力算子集成指导
要求
- PyTorch 运行环境
- 昇腾 NPU 环境
- torch_npu 支持
- 融合注意力算子
- 适用时的 MLA 算子支持
