eval-harness - 基于评估驱动开发原则的 Codex 会话评估框架。
为 Codex 会话提供正式评估框架,通过代码、模型及人工评分器定义、运行并报告评估指标。
标签
更新于: 2026-09-17能力
典型输入
典型输出
该技能可以做什么
- 定义能力与回归评估
- 执行基于代码的评分器
- 执行基于模型的评分器
- 标记变更为人工审查
- 计算 pass@k 可靠性指标
- 生成评估报告
输入
- 评估定义 Markdown 文件
- 回归基线检查点
- 项目测试集与代码库
输出
- 评估定义文件
- 评估执行运行日志
- 回归基线 JSON 文件
- 格式化的评估报告输出
要求
- Codex 会话环境
- Read、Write、Edit、Bash、Grep、Glob 工具权限
