★ 0 · Updated 2026-09-24
Evaluates code generation models across HumanEval, MBPP, MultiPL-E, and 15+ benchmarks with pass@k metrics.
Browse skills that use this input.
★ 0 · Updated 2026-09-24
Evaluates code generation models across HumanEval, MBPP, MultiPL-E, and 15+ benchmarks with pass@k metrics.