LogoClawIndex
案例技能关于
LogoClawIndex

evaluating-code-models - 使用 BigCode Evaluation Harness 评估代码模型

基于 pass@k 指标在 HumanEval、MBPP、MultiPL-E 等 15 个以上的基准测试中评估代码生成模型。

标签

更新于: 2026-09-24

能力

典型输入

典型输出

该技能可以做什么

  • 评估标准代码生成基准测试
  • 运行多语言代码评估
  • 基准测试指令微调代码模型
  • 比较不同模型的 pass@k 指标
  • 在 Docker 容器内安全执行评估

输入

  • HuggingFace 模型标识符或路径
  • 基准测试任务名称
  • 生成配置参数
  • 预生成的解答 JSON 文件

输出

  • 包含 pass@k 指标的 JSON 文件
  • 保存的代码生成 JSON 文件
  • 模型对比表格

要求

  • bigcode-evaluation-harness
  • transformers>=4.25.1
  • accelerate>=0.13.2
  • datasets>=2.6.1
  • Docker 运行环境
  • 代码执行权限

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
评估
代码生成
HumanEval
MBPP
MultiPL-E
Pass@k
BigCode
基准测试
代码模型
评估标准代码生成基准测试
运行多语言代码评估
基准测试指令微调代码模型
比较不同模型的 pass@k 指标
HuggingFace 模型标识符或路径
基准测试任务名称
生成配置参数
包含 pass@k 指标的 JSON 文件
保存的代码生成 JSON 文件
模型对比表格