LogoClawIndex
案例技能关于
LogoClawIndex

llm-benchmark - LLM基准测试:设计套件、对比模型与检测回归

设计基准测试套件、建立基线、执行A/B模型对比、检测质量回归、跟踪生产指标,并生成用于模型选型的排行榜。

标签

更新于: 2026-06-30

能力

典型输入

典型输出

该技能可以做什么

  • 设计基准测试套件
  • 建立性能基线
  • 执行统计模型对比
  • 检测质量回归
  • 跟踪生产质量指标
  • 生成模型排行榜
  • 运行模型更新金丝雀测试

输入

  • 待基准测试的LLM模型
  • 基准测试用例
  • 历史基线结果
  • 独立评判模型
  • 评估规则集
  • 成本与延迟阈值

输出

  • 基准对比报告
  • 回归检测告警
  • 模型排行榜
  • 基线数据记录
  • 生产监控仪表盘

要求

  • LLM API端点访问权限
  • Python运行环境
  • 统计分析库(numpy、scipy)
  • 独立评判模型访问权限
  • 基线数据持久化存储

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
LLM基准测试
模型对比
回归检测
质量指标
排行榜
A/B测试
性能基线
设计基准测试套件
建立性能基线
执行统计模型对比
检测质量回归
待基准测试的LLM模型
基准测试用例
历史基线结果
基准对比报告
回归检测告警
模型排行榜