make-eval - 生成确定性的 LLM 评测 harnessLLM 评测测试 harness分类精确匹配评分★ 4 · 更新于 2026-10-04为 LLM 支持的函数构建小型评测 harness,对封闭标签输出使用精确匹配评分,并可选集成 LangSmith。⚙ 识别 LLM 边界⚙ 定义标签集合⚙ 强化输出解析