LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

具备该能力的 Skills:运行多语言代码评估

浏览具备该能力的技能列表。

  • evaluating-code-models - 使用 BigCode Evaluation Harness 评估代码模型
    评估代码生成HumanEvalMBPP

    ★ 0 · 更新于 2026-09-24

    基于 pass@k 指标在 HumanEval、MBPP、MultiPL-E 等 15 个以上的基准测试中评估代码生成模型。

    ⚙ 评估标准代码生成基准测试⚙ 运行多语言代码评估⚙ 基准测试指令微调代码模型