model-infer-kvcache - 优化昇腾 NPU 推理中的 KVCacheKVCacheLLM 推理昇腾 NPUPyTorch★ 0 · 更新于 2026-10-06分析和优化基于 PyTorch 的昇腾 NPU LLM 推理 KVCache 实现,涵盖连续缓存、分页注意力、融合算子和 MLA 压缩缓存。⚙ 分析 KVCache 实现⚙ 选择缓存优化模式⚙ 构造 block_table