llm-evaluation - 评估大语言模型应用性能
使用自动化指标、人工评估、LLM 评审和 A/B 测试评估大语言模型应用。
标签
更新于: 2026-09-28能力
典型输入
典型输出
该技能可以做什么
- 计算自动化指标
- 评估人工评价维度
- 比较模型输出
- 执行 LLM 评审
- 分析 A/B 测试结果
- 检测性能回归
- 跟踪评估基线
输入
- 大语言模型应用输出
- 参考答案
- 评估测试用例
- 检索上下文
- 评估标准
- 人工评分
- 变体得分
输出
- 评估指标分数
- 人工标注记录
- LLM 评审结果
- 模型比较结果
- A/B 测试统计结果
- 回归问题发现
- 评估基线
要求
- Python 运行环境
- 评估指标库
- 统计分析库
- 预训练评估模型
- LLM API 访问权限
