run-evals - Run Existing Skill Evaluations
Execute and iterate on skill evaluations using existing test cases
Tags
Updated: 2026-03-23Typical Inputs
Typical Outputs
What this skill does
- Run eval commands
- Read eval configurations
- Read benchmark results
- Create feedback files
- Modify eval configurations
- Compare evaluation results
- Generate improvement suggestions
- Verify threshold conditions
- Compare skill versions
Inputs
- evals/evals.json
- skill directory
- old skill path
- CI threshold value
Outputs
- benchmark.json
- feedback.json
- evaluation report
- comparison report
- CI exit code
Requirements
- Existing evals/evals.json
- @github/copilot-sdk
- npx snapeval CLI
- Copilot CLI authentication
- Node.js environment
