LogoClawIndex
案例技能关于
LogoClawIndex

advanced-evaluation - 使用可靠的评估方法评估大模型输出

提供大模型输出评分与比较、评估量规设计、指标选择和评估偏差缓解方法。

标签

更新于: 2026-10-03
大模型评估大模型评审质量评估成对比较评估偏差评估量规评估管道

能力

典型输入

典型输出

该技能可以做什么

  • 直接为响应评分
  • 成对比较响应
  • 设计评估量规
  • 选择评估指标
  • 缓解位置偏差
  • 校准置信度评分
  • 分析评估一致性

输入

  • 原始提示
  • 大模型响应
  • 评估标准
  • 评估量规
  • 评估上下文

输出

  • 评分
  • 成对比较结论
  • 评分依据
  • 置信度评分
  • 评估摘要
  • 评估量规

要求

  • 支持作为评审的大模型
  • 支持结构化 JSON 输出

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
直接为响应评分
成对比较响应
设计评估量规
选择评估指标
原始提示
大模型响应
评估标准
评分
成对比较结论
评分依据