orq-build-evaluator - 构建并验证二元 LLM 评估器
针对特定失败模式创建二元通过/失败 LLM-as-a-Judge 评估器,并使用人工标签通过 TPR/TNR 验证其效果。
标签
更新于: 2026-10-05能力
典型输入
典型输出
该技能可以做什么
- 定义失败标准
- 设计评估器提示词
- 验证 TPR 和 TNR
- 创建 orq.ai 评估器
- 记录评估器限制
输入
- LLM 流程详情
- 失败模式定义
- 人工标注的通过/失败样本
- orq.ai 项目访问权限
输出
- 评估器提示词
- 经过验证的评估器
- TPR 和 TNR 指标
- 评估器文档
要求
- orq.ai MCP 或 API 访问权限
- 评估器创建权限
- 可用的评估模型
