LogoClawIndex
CasesSkillsAbout
LogoClawIndex

orq-build-evaluator - Build and validate binary LLM evaluators

Creates binary Pass/Fail LLM-as-a-Judge evaluators for specific failure modes and validates them against human labels using TPR/TNR.

Tags

Updated: 2026-10-05

Capabilities

Typical Inputs

Typical Outputs

What this skill does

  • Define failure criteria
  • Design judge prompts
  • Validate TPR and TNR
  • Create orq.ai evaluators
  • Document evaluator limitations

Inputs

  • LLM pipeline details
  • Failure mode definitions
  • Human-labeled Pass/Fail examples
  • orq.ai project access

Outputs

  • Judge prompt
  • Validated evaluator
  • TPR and TNR metrics
  • Evaluator documentation

Requirements

  • orq.ai MCP or API access
  • Evaluator creation permissions
  • Available judge model

Source

  • Spec: SKILL.md

ClawIndex

OpenClaw Skills & Use Case Index

ClawIndex is an ecosystem-driven index of OpenClaw skills and real-world use cases.

Index

Skills·
Cases

Meta

About·
Disclaimer·
Email·
GitHub
© 2026 ClawIndex All Rights Reserved.
LLM evaluation
LLM-as-a-Judge
binary classification
failure analysis
quality assurance
Define failure criteria
Design judge prompts
Validate TPR and TNR
Create orq.ai evaluators
LLM pipeline details
Failure mode definitions
Human-labeled Pass/Fail examples
Judge prompt
Validated evaluator
TPR and TNR metrics