eval-harness - Eval-driven development testing framework
Define and run evaluations as unit tests to validate AI code against success criteria
Tags
Updated: 2026-03-22Capabilities
Typical Inputs
Typical Outputs
What this skill does
- define evaluation criteria
- run code-based graders
- run model-based graders
- generate eval reports
- create eval files
- check code quality
- measure pass rates
- validate implementation
Inputs
- success criteria
- code to evaluate
- test suite
- security patterns
- evaluation configuration
Outputs
- eval reports
- pass/fail results
- quality scores
- reliability metrics
- evaluation records
Requirements
- code execution environment
- model access
- test framework
- eval file directory
