make-eval - 生成确定性的 LLM 评测 harness
为 LLM 支持的函数构建小型评测 harness,对封闭标签输出使用精确匹配评分,并可选集成 LangSmith。
标签
更新于: 2026-10-04能力
典型输入
典型输出
该技能可以做什么
- 识别 LLM 边界
- 定义标签集合
- 强化输出解析
- 编写评测数据集
- 生成评测运行器
- 执行精确匹配评分
- 计算混淆矩阵
- 配置 LangSmith 评测
输入
- LLM 支持的函数
- 封闭标签集合
- 评测样例
- 项目包配置
- LANGSMITH_API_KEY 环境变量
输出
- 评测 harness 文件
- CSV 评测数据集
- 精确匹配分数
- 通过或失败的阈值结果
- 混淆矩阵
- LangSmith 数据集 URL
- LangSmith 实验 URL
要求
- 本地项目执行环境
- 可调用的 LLM 支持函数
- LangSmith 模式所需的 LangSmith 包
- LangSmith 模式所需的 LANGSMITH_API_KEY
