LogoClawIndex
案例技能关于
LogoClawIndex

orq-build-evaluator - 构建并验证二元 LLM 评估器

针对特定失败模式创建二元通过/失败 LLM-as-a-Judge 评估器,并使用人工标签通过 TPR/TNR 验证其效果。

标签

更新于: 2026-10-05
LLM 评估LLM-as-a-Judge二元分类失败分析质量保障

能力

典型输入

典型输出

该技能可以做什么

  • 定义失败标准
  • 设计评估器提示词
  • 验证 TPR 和 TNR
  • 创建 orq.ai 评估器
  • 记录评估器限制

输入

  • LLM 流程详情
  • 失败模式定义
  • 人工标注的通过/失败样本
  • orq.ai 项目访问权限

输出

  • 评估器提示词
  • 经过验证的评估器
  • TPR 和 TNR 指标
  • 评估器文档

要求

  • orq.ai MCP 或 API 访问权限
  • 评估器创建权限
  • 可用的评估模型

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
定义失败标准
设计评估器提示词
验证 TPR 和 TNR
创建 orq.ai 评估器
LLM 流程详情
失败模式定义
人工标注的通过/失败样本
评估器提示词
经过验证的评估器
TPR 和 TNR 指标