LogoClawIndex
案例技能关于
LogoClawIndex

make-eval - 生成确定性的 LLM 评测 harness

为 LLM 支持的函数构建小型评测 harness,对封闭标签输出使用精确匹配评分,并可选集成 LangSmith。

标签

更新于: 2026-10-04

能力

典型输入

典型输出

该技能可以做什么

  • 识别 LLM 边界
  • 定义标签集合
  • 强化输出解析
  • 编写评测数据集
  • 生成评测运行器
  • 执行精确匹配评分
  • 计算混淆矩阵
  • 配置 LangSmith 评测

输入

  • LLM 支持的函数
  • 封闭标签集合
  • 评测样例
  • 项目包配置
  • LANGSMITH_API_KEY 环境变量

输出

  • 评测 harness 文件
  • CSV 评测数据集
  • 精确匹配分数
  • 通过或失败的阈值结果
  • 混淆矩阵
  • LangSmith 数据集 URL
  • LangSmith 实验 URL

要求

  • 本地项目执行环境
  • 可调用的 LLM 支持函数
  • LangSmith 模式所需的 LangSmith 包
  • LangSmith 模式所需的 LANGSMITH_API_KEY

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
LLM 评测
测试 harness
分类
精确匹配评分
回归测试
混淆矩阵
LangSmith
识别 LLM 边界
定义标签集合
强化输出解析
编写评测数据集
LLM 支持的函数
封闭标签集合
评测样例
评测 harness 文件
CSV 评测数据集
精确匹配分数