LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

llm-evaluation - 评估大语言模型应用性能

使用自动化指标、人工评估、LLM 评审和 A/B 测试评估大语言模型应用。

标签

更新于: 2026-09-28

能力

典型输入

典型输出

该技能可以做什么

  • 计算自动化指标
  • 评估人工评价维度
  • 比较模型输出
  • 执行 LLM 评审
  • 分析 A/B 测试结果
  • 检测性能回归
  • 跟踪评估基线

输入

  • 大语言模型应用输出
  • 参考答案
  • 评估测试用例
  • 检索上下文
  • 评估标准
  • 人工评分
  • 变体得分

输出

  • 评估指标分数
  • 人工标注记录
  • LLM 评审结果
  • 模型比较结果
  • A/B 测试统计结果
  • 回归问题发现
  • 评估基线

要求

  • Python 运行环境
  • 评估指标库
  • 统计分析库
  • 预训练评估模型
  • LLM API 访问权限

来源

  • 规范: SKILL.md
大语言模型评估
自动化指标
人工评估
LLM 评审
A/B 测试
回归测试
计算自动化指标
评估人工评价维度
比较模型输出
执行 LLM 评审
大语言模型应用输出
参考答案
评估测试用例
评估指标分数
人工标注记录
LLM 评审结果