★ 174 · 更新于 2026-09-22
针对目标 vLLM 版本与已安装的 MACA 组件评估并升级 MetaX 模型支持,递归包含依赖的注意力机制与算子。
浏览带有该标签的技能列表。
★ 174 · 更新于 2026-09-22
针对目标 vLLM 版本与已安装的 MACA 组件评估并升级 MetaX 模型支持,递归包含依赖的注意力机制与算子。
★ 1 · 更新于 2026-09-13
在本地硬件上使用 inspect-ai 或 lighteval 对 Hugging Face Hub 模型运行评估。
★ 3 · 更新于 2026-09-11
介绍用于将形状安全且跨框架的LLM架构自动编译为PyTorch、JAX、MLX和vLLM实现的Axon DSL。
★ 5 · 更新于 2026-05-11
适配Hugging Face或本地模型在vllm-ascend上运行,代码改动最小化
★ 602 · 更新于 2026-03-26
在Kubernetes上水平扩展LLM推理,支持GPU感知自动扩缩容、请求排队和竞价实例策略。
★ 0 · 更新于 2026-02-23
部署本地或开源AI模型,包括模型选择、量化、Ollama/vLLM设置以及与ModelSelector的集成
★ 602 · 更新于 2026-02-14
使用优化内核和服务引擎部署微调模型进行生产推理