LogoClawIndex
案例技能关于
LogoClawIndex

eval-harness - 基于评估驱动开发原则的 Codex 会话评估框架。

为 Codex 会话提供正式评估框架,通过代码、模型及人工评分器定义、运行并报告评估指标。

标签

更新于: 2026-09-17
评估驱动开发codex测试评估自动化测试基准测试指标统计

能力

典型输入

典型输出

该技能可以做什么

  • 定义能力与回归评估
  • 执行基于代码的评分器
  • 执行基于模型的评分器
  • 标记变更为人工审查
  • 计算 pass@k 可靠性指标
  • 生成评估报告

输入

  • 评估定义 Markdown 文件
  • 回归基线检查点
  • 项目测试集与代码库

输出

  • 评估定义文件
  • 评估执行运行日志
  • 回归基线 JSON 文件
  • 格式化的评估报告输出

要求

  • Codex 会话环境
  • Read、Write、Edit、Bash、Grep、Glob 工具权限

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
定义能力与回归评估
执行基于代码的评分器
执行基于模型的评分器
标记变更为人工审查
评估定义 Markdown 文件
回归基线检查点
项目测试集与代码库
评估定义文件
评估执行运行日志
回归基线 JSON 文件