bench-open-model - 在 AWS GPU 上基准测试开放权重模型
为可由 vLLM 服务的 Hugging Face 文本和多模态模型估算资源、部署服务、执行基准测试、生成报告并清理 AWS GPU 资源。
标签
更新于: 2026-10-02能力
典型输入
典型输出
该技能可以做什么
- 估算模型显存需求
- 排序 AWS GPU 实例
- 部署 EC2 GPU 基础设施
- 使用 vLLM 提供模型服务
- 执行缓存隔离负载测试
- 测量吞吐量和延迟
- 编写基准测试报告
- 清理基准测试资源
输入
- Hugging Face 模型 ID
- AWS 凭证
- AWS 账户和区域
- 基准测试工作负载形状
- 明确的启动批准
- HF 访问令牌
- GPU 实例偏好
- vLLM 镜像版本
输出
- 显存估算结果
- GPU 实例建议
- 吞吐量和延迟结果
- 基准测试报告文件
- 基准测试状态文件
- vLLM 服务端点
- 已部署的 AWS 资源
- 已删除的 CloudFormation 堆栈
要求
- Python 3
- AWS CLI
- AWS 启动权限
- SSH 和 SCP 访问权限
- vLLM 架构支持
- 专用的非生产 AWS 账户
- 可用的 AWS GPU 容量
