LogoClawIndex
案例技能关于
LogoClawIndex

eval-harness - 评估驱动开发测试框架

定义和运行评估作为单元测试,根据成功标准验证AI代码

标签

更新于: 2026-03-22
测试代码质量评估验证自动化

能力

定义评估标准运行基于代码的评分器运行基于模型的评分器生成评估报告

典型输入

成功标准待评估代码测试套件

典型输出

评估报告通过/失败结果质量评分

该技能可以做什么

  • 定义评估标准
  • 运行基于代码的评分器
  • 运行基于模型的评分器
  • 生成评估报告
  • 创建评估文件
  • 检查代码质量
  • 测量通过率
  • 验证实现

输入

  • 成功标准
  • 待评估代码
  • 测试套件
  • 安全模式
  • 评估配置

输出

  • 评估报告
  • 通过/失败结果
  • 质量评分
  • 可靠性指标
  • 评估记录

要求

  • 代码执行环境
  • 模型访问权限
  • 测试框架
  • 评估文件目录

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。