LogoClawIndex
CasesSkillsAbout
LogoClawIndex

advanced-evaluation - Advanced LLM Output Evaluation

Provides methods for scoring and comparing LLM outputs, creating rubrics, mitigating evaluation bias, and designing evaluation pipelines.

Tags

Updated: 2026-10-03
LLM evaluationLLM-as-a-judgepairwise comparisondirect scoringevaluation biasrubrics

Capabilities

Evaluate LLM outputsCompare model responsesCreate evaluation rubricsMitigate evaluation bias

Typical Inputs

Prompts and responsesEvaluation criteriaScoring rubrics

Typical Outputs

Scores and justificationsPairwise verdictsConfidence scores

What this skill does

  • Evaluate LLM outputs
  • Compare model responses
  • Create evaluation rubrics
  • Mitigate evaluation bias
  • Design evaluation pipelines
  • Calibrate confidence scores
  • Analyze judge agreement

Inputs

  • Prompts and responses
  • Evaluation criteria
  • Scoring rubrics
  • Evaluation context

Outputs

  • Scores and justifications
  • Pairwise verdicts
  • Confidence scores
  • Evaluation summaries

Requirements

  • LLM judge model

Source

  • Spec: SKILL.md

ClawIndex

OpenClaw Skills & Use Case Index

ClawIndex is an ecosystem-driven index of OpenClaw skills and real-world use cases.

Index

Skills·
Cases

Meta

About·
Disclaimer·
Email·
GitHub
© 2026 ClawIndex All Rights Reserved.