LogoClawIndex
CasesSkillsAbout
LogoClawIndex

eval-harness - Formal evaluation framework for Codex sessions based on EDD.

Provides a formal evaluation framework for Codex sessions to define, run, and report EDD metrics using code, model, and human graders.

Tags

Updated: 2026-09-17
eval-driven-developmentcodexevaluationtestingbenchmarkingmetrics

Capabilities

Define capability and regression evalsExecute code-based gradersExecute model-based gradersFlag changes for human review

Typical Inputs

Eval definition markdown filesRegression baseline checkpointsProject test suites and codebase

Typical Outputs

Eval definition filesEval execution run logsRegression baseline JSON files

What this skill does

  • Define capability and regression evals
  • Execute code-based graders
  • Execute model-based graders
  • Flag changes for human review
  • Calculate pass@k reliability metrics
  • Generate evaluation reports

Inputs

  • Eval definition markdown files
  • Regression baseline checkpoints
  • Project test suites and codebase

Outputs

  • Eval definition files
  • Eval execution run logs
  • Regression baseline JSON files
  • Formatted evaluation report outputs

Requirements

  • Codex session environment
  • Tool access for Read, Write, Edit, Bash, Grep, Glob

Source

  • Spec: SKILL.md

ClawIndex

OpenClaw Skills & Use Case Index

ClawIndex is an ecosystem-driven index of OpenClaw skills and real-world use cases.

Index

Skills·
Cases

Meta

About·
Disclaimer·
Email·
GitHub
© 2026 ClawIndex All Rights Reserved.