alignment-verification-gateway - AI模型对齐验证网关
在授予协作任务访问权限前验证AI模型对齐
标签
更新于: 2026-03-26该技能可以做什么
- 验证模型身份
- 验证能力
- 测试伦理响应
- 检查法典合规
- 分析行为一致性
- 确认人工监督
- 计算对齐分数
- 授予访问权限
- 拒绝模型访问
- 监控模型行为
- 检测异常
- 执行重新验证
输入
- 模型标识符
- 伦理场景
- 边界测试请求
- 同意场景
- 历史行为基线
- 对齐指标
- 不对齐指标
输出
- 对齐分数
- 访问状态
- 权限列表
- 监控级别
- 重新验证日期
要求
- IRP原则
- 伦理准则
- 操作标准
- 跨模型信任验证
- 法典执行
