LogoClawIndex
CasesSkillsAbout
LogoClawIndex

ClawIndex

OpenClaw Skills & Use Case Index

ClawIndex is an ecosystem-driven index of OpenClaw skills and real-world use cases.

Index

Skills·
Cases

Meta

About·
Disclaimer·
Email·
GitHub
© 2026 ClawIndex All Rights Reserved.

llm-evaluation - Evaluate LLM application performance

Evaluate LLM applications using automated metrics, human assessment, LLM judges, and A/B testing.

Tags

Updated: 2026-09-28

Capabilities

Typical Inputs

Typical Outputs

What this skill does

  • Measure automated metrics
  • Assess human evaluation dimensions
  • Compare model outputs
  • Run LLM-as-judge evaluations
  • Analyze A/B test results
  • Detect performance regressions
  • Track evaluation baselines

Inputs

  • LLM application outputs
  • Reference answers
  • Evaluation test cases
  • Retrieval contexts
  • Evaluation criteria
  • Human ratings
  • Variant scores

Outputs

  • Evaluation metric scores
  • Human annotation records
  • LLM judge results
  • Model comparison results
  • A/B test statistics
  • Regression findings
  • Evaluation baselines

Requirements

  • Python environment
  • Evaluation metric libraries
  • Statistical analysis libraries
  • Pretrained evaluation models
  • LLM API access

Source

  • Spec: SKILL.md
LLM evaluation
automated metrics
human evaluation
LLM judge
A/B testing
regression testing
Measure automated metrics
Assess human evaluation dimensions
Compare model outputs
Run LLM-as-judge evaluations
LLM application outputs
Reference answers
Evaluation test cases
Evaluation metric scores
Human annotation records
LLM judge results