evaluate-presets - Systematically test Ralph hat collection presets using scripts.
Evaluates Ralph hat collection presets by running test scripts, logging session metrics, and verifying hat routing performance.
Tags
Updated: 2026-09-18Capabilities
Typical Inputs
Typical Outputs
What this skill does
- Evaluate single preset
- Evaluate all presets
- Extract session metrics
- Validate hat routing
- Generate summary report
Inputs
- Preset name
- Backend selection
- Test task definitions
Outputs
- Evaluation log files
- Metrics JSON files
- Markdown summary report
- Execution status codes
Requirements
- Cargo build system
- yq command-line tool
- Bash execution environment
