LogoClawIndex
案例技能关于
LogoClawIndex

one-eval - 使用 One-Eval 进行端到端模型评测

对 API 或本地模型进行文本、多模态、代码、函数调用和 Agent benchmark 评测,并生成指标与可视化报告。

标签

更新于: 2026-10-01
模型评测基准测试多模态评测代码生成函数调用Agent 基准评测指标HTML 报告

能力

测试模型连通性选择评测 benchmark生成评测配置执行 smoke 评测

典型输入

模型名称或路径API 地址和密钥Benchmark 选择

典型输出

评测结果 JSON指标结果 JSON逐样本指标记录

该技能可以做什么

  • 测试模型连通性
  • 选择评测 benchmark
  • 生成评测配置
  • 执行 smoke 评测
  • 执行完整评测
  • 续跑中断评测
  • 计算评测指标
  • 生成 HTML 报告

输入

  • 模型名称或路径
  • API 地址和密钥
  • Benchmark 选择
  • 采样参数
  • 指标选择
  • 评测仓库

输出

  • 评测结果 JSON
  • 指标结果 JSON
  • 逐样本指标记录
  • HTML 评测报告
  • 评测运行目录
  • Benchmark 就绪状态

要求

  • One-Eval 主仓库
  • Python 3.10–3.11
  • 已安装项目依赖
  • API 模型的 API 凭证
  • 本地 vLLM 所需 GPU 和匹配的 CUDA

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。