LogoClawIndex
案例技能关于
LogoClawIndex

llm-benchmark - LLM基准测试与优化指南

设计、运行和解释LLM基准测试实验,包含统计分析与数据泄露防护

标签

更新于: 2026-05-28
基准测试LLM测试统计分析提示词优化性能数据泄露防护

能力

典型输入

典型输出

该技能可以做什么

  • 设计测试套件
  • 运行基准实验
  • 对比提示词变体
  • 分析通过率
  • 计算置信区间
  • 检测数据泄露
  • 测量每轮指标
  • 解读测试结果
  • 优化提示词
  • 验证测试约束

输入

  • 测试数据集
  • 提示词配置
  • LLM模型
  • 测试套件
  • 统计参数
  • 目标效果大小

输出

  • 测试结果
  • 通过率
  • 每轮指标
  • 统计分析
  • 性能对比

要求

  • LLM模型访问权限
  • 统计分析工具
  • 测试环境
  • 测试数据访问权限

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
设计测试套件
运行基准实验
对比提示词变体
分析通过率
测试数据集
提示词配置
LLM模型
测试结果
通过率
每轮指标