one-eval - 使用 One-Eval 进行端到端模型评测
对 API 或本地模型进行文本、多模态、代码、函数调用和 Agent benchmark 评测,并生成指标与可视化报告。
标签
更新于: 2026-10-01该技能可以做什么
- 测试模型连通性
- 选择评测 benchmark
- 生成评测配置
- 执行 smoke 评测
- 执行完整评测
- 续跑中断评测
- 计算评测指标
- 生成 HTML 报告
输入
- 模型名称或路径
- API 地址和密钥
- Benchmark 选择
- 采样参数
- 指标选择
- 评测仓库
输出
- 评测结果 JSON
- 指标结果 JSON
- 逐样本指标记录
- HTML 评测报告
- 评测运行目录
- Benchmark 就绪状态
要求
- One-Eval 主仓库
- Python 3.10–3.11
- 已安装项目依赖
- API 模型的 API 凭证
- 本地 vLLM 所需 GPU 和匹配的 CUDA
