LogoClawIndex
案例技能关于
LogoClawIndex

eval-harness - 构建可复现的 LLM 评测框架

为 LLM 流程构建可复现的评测框架,执行测试、评分、记录通过或失败历史并检测回归。

标签

更新于: 2026-10-05
LLM 评测测试回归测试评分智能体工作流

能力

典型输入

典型输出

该技能可以做什么

  • 定义评测用例
  • 创建评分量规
  • 运行流程评测
  • 记录通过或失败结果
  • 跟踪回归历史
  • 分析评测结果

输入

  • LLM 流程或 AI 功能
  • 测试用例
  • 预期输出
  • 评分量规
  • 评测阈值
  • 可复现的执行证据

输出

  • 评测框架文件
  • 带分数的测试结果
  • 通过或失败运行历史
  • 回归标记
  • 评测分析

要求

  • SQL 会话数据库

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
定义评测用例
创建评分量规
运行流程评测
记录通过或失败结果
LLM 流程或 AI 功能
测试用例
预期输出
评测框架文件
带分数的测试结果
通过或失败运行历史