LogoClawIndex
案例技能关于
LogoClawIndex

cross-lingual-stability-judges-under - 审计跨语言 LLM 评审稳定性

诊断、测量并校准多语言 LLM 评审流水线中的评估不稳定性。

标签

更新于: 2026-10-03

能力

典型输入

典型输出

该技能可以做什么

  • 定义评估维度
  • 构建受控生成协议
  • 生成平行合成数据
  • 计算表层指标
  • 使用 LLM 评审输出
  • 测量跨语言排名稳定性
  • 识别不稳定维度
  • 收集针对性人工标注
  • 校准或替换指标
  • 记录稳定性报告

输入

  • 评估维度
  • 生成参数
  • 目标语言
  • 生成模型
  • 合成对话
  • 评审分数
  • 人工标注

输出

  • 稳定性矩阵
  • 指标分数
  • 排名相关性
  • 置信区间
  • 校准状态
  • 稳定性报告

要求

  • LLM 提供商访问权限
  • 多语言嵌入模型
  • 统计分析工具
  • 目标语言标注人员

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
多语言评估
LLM 评审
评估稳定性
排名分析
指标校准
人工标注
定义评估维度
构建受控生成协议
生成平行合成数据
计算表层指标
评估维度
生成参数
目标语言
稳定性矩阵
指标分数
排名相关性