★ 3 · 更新于 2026-09-29
使用 DeepSpeed 或 HuggingFace 训练和优化稀疏混合专家模型,涵盖路由、负载均衡、专家并行和推理优化。
浏览产出该输出的技能列表。
★ 3 · 更新于 2026-09-29
使用 DeepSpeed 或 HuggingFace 训练和优化稀疏混合专家模型,涵盖路由、负载均衡、专家并行和推理优化。
★ 650 · 更新于 2026-09-24
基于 AgentDB 的 9 种强化学习算法,为自主智能体创建、训练和管理学习插件。
★ 2 · 更新于 2026-09-23
提供有关 AI 系统设计、MLOps 架构、可扩展 ML 基础设施及 AI 平台工程的指导。
★ 0 · 更新于 2026-06-30
使用verl库进行LLM的RLHF、GRPO和PPO强化学习训练
★ 1 · 更新于 2026-06-30
大语言模型强化学习训练库