llm-benchmark - LLM基准测试:设计套件、对比模型与检测回归
设计基准测试套件、建立基线、执行A/B模型对比、检测质量回归、跟踪生产指标,并生成用于模型选型的排行榜。
标签
更新于: 2026-06-30能力
典型输入
典型输出
该技能可以做什么
- 设计基准测试套件
- 建立性能基线
- 执行统计模型对比
- 检测质量回归
- 跟踪生产质量指标
- 生成模型排行榜
- 运行模型更新金丝雀测试
输入
- 待基准测试的LLM模型
- 基准测试用例
- 历史基线结果
- 独立评判模型
- 评估规则集
- 成本与延迟阈值
输出
- 基准对比报告
- 回归检测告警
- 模型排行榜
- 基线数据记录
- 生产监控仪表盘
要求
- LLM API端点访问权限
- Python运行环境
- 统计分析库(numpy、scipy)
- 独立评判模型访问权限
- 基线数据持久化存储
