evaluating-code-models - 使用 BigCode Evaluation Harness 评估代码模型
基于 pass@k 指标在 HumanEval、MBPP、MultiPL-E 等 15 个以上的基准测试中评估代码生成模型。
标签
更新于: 2026-09-24能力
典型输入
典型输出
该技能可以做什么
- 评估标准代码生成基准测试
- 运行多语言代码评估
- 基准测试指令微调代码模型
- 比较不同模型的 pass@k 指标
- 在 Docker 容器内安全执行评估
输入
- HuggingFace 模型标识符或路径
- 基准测试任务名称
- 生成配置参数
- 预生成的解答 JSON 文件
输出
- 包含 pass@k 指标的 JSON 文件
- 保存的代码生成 JSON 文件
- 模型对比表格
要求
- bigcode-evaluation-harness
- transformers>=4.25.1
- accelerate>=0.13.2
- datasets>=2.6.1
- Docker 运行环境
- 代码执行权限
