eval-harness - 构建可复现的 LLM 评测框架
为 LLM 流程构建可复现的评测框架,执行测试、评分、记录通过或失败历史并检测回归。
标签
更新于: 2026-10-05能力
典型输入
典型输出
该技能可以做什么
- 定义评测用例
- 创建评分量规
- 运行流程评测
- 记录通过或失败结果
- 跟踪回归历史
- 分析评测结果
输入
- LLM 流程或 AI 功能
- 测试用例
- 预期输出
- 评分量规
- 评测阈值
- 可复现的执行证据
输出
- 评测框架文件
- 带分数的测试结果
- 通过或失败运行历史
- 回归标记
- 评测分析
要求
- SQL 会话数据库
