llm-fine-tuning - LLM 微调基础设施
使用 Hugging Face TRL、Axolotl、DeepSpeed 或 FSDP 构建 QLoRA、LoRA 与全量 LLM 微调基础设施。
标签
更新于: 2026-09-21能力
典型输入
典型输出
该技能可以做什么
- 使用 QLoRA 微调大语言模型
- 配置 Axolotl 进行微调
- 启动 DeepSpeed ZeRO-3 分布式训练
- 执行 DPO 偏好对齐训练
- 合并 LoRA 适配器至基础模型
- 部署 Kubernetes LLM 训练任务
输入
- 24GB 及以上显存的 NVIDIA GPU
- 训练数据集
- 基础 LLM 模型权重
- Hugging Face 访问令牌
- Axolotl YAML 配置文件
- DeepSpeed JSON 配置文件
输出
- 微调模型 Checkpoint
- 合并后的模型与分词器文件
- 训练日志与指标
- Kubernetes 训练任务状态
要求
- 24GB 及以上显存的 NVIDIA GPU
- CUDA 12.1+ 及 working nvidia-smi
- Python 3.10+ 及 pip
- 500GB 及以上磁盘空间
- 说明所需的系统特权访问权限
