LogoClawIndex
CasesSkillsAbout
LogoClawIndex

ClawIndex

OpenClaw Skills & Use Case Index

ClawIndex is an ecosystem-driven index of OpenClaw skills and real-world use cases.

Index

Skills·
Cases

Meta

About·
Disclaimer·
Email·
GitHub
© 2026 ClawIndex All Rights Reserved.

eval-harness - Eval-driven development testing framework

Define and run evaluations as unit tests to validate AI code against success criteria

Tags

Updated: 2026-03-22

Capabilities

Typical Inputs

Typical Outputs

What this skill does

  • define evaluation criteria
  • run code-based graders
  • run model-based graders
  • generate eval reports
  • create eval files
  • check code quality
  • measure pass rates
  • validate implementation

Inputs

  • success criteria
  • code to evaluate
  • test suite
  • security patterns
  • evaluation configuration

Outputs

  • eval reports
  • pass/fail results
  • quality scores
  • reliability metrics
  • evaluation records

Requirements

  • code execution environment
  • model access
  • test framework
  • eval file directory

Source

  • Spec: SKILL.md
testing
code-quality
evaluation
validation
automation
define evaluation criteria
run code-based graders
run model-based graders
generate eval reports
success criteria
code to evaluate
test suite
eval reports
pass/fail results
quality scores