cross-lingual-stability-judges-under - 审计跨语言 LLM 评审稳定性
诊断、测量并校准多语言 LLM 评审流水线中的评估不稳定性。
标签
更新于: 2026-10-03能力
典型输入
典型输出
该技能可以做什么
- 定义评估维度
- 构建受控生成协议
- 生成平行合成数据
- 计算表层指标
- 使用 LLM 评审输出
- 测量跨语言排名稳定性
- 识别不稳定维度
- 收集针对性人工标注
- 校准或替换指标
- 记录稳定性报告
输入
- 评估维度
- 生成参数
- 目标语言
- 生成模型
- 合成对话
- 评审分数
- 人工标注
输出
- 稳定性矩阵
- 指标分数
- 排名相关性
- 置信区间
- 校准状态
- 稳定性报告
要求
- LLM 提供商访问权限
- 多语言嵌入模型
- 统计分析工具
- 目标语言标注人员
