ai-red-teaming - 执行结构化 AI 红队安全评估
针对越狱抵抗、数据外泄、有害输出、工具滥用、社会工程和可用性滥用执行对抗性测试。
标签
更新于: 2026-09-29能力
典型输入
典型输出
该技能可以做什么
- 定义威胁场景
- 构建可复用攻击套件
- 生成对抗性提示
- 测试模型响应
- 评估攻击是否成功
- 分类发现严重性
- 导出测试结果
输入
- 目标模型端点
- 模型访问凭据
- 运行器配置
- 对抗性提示库
- 提示管理工具
- 隔离测试环境
输出
- 红队测试结果
- JSON 结果文件
- 攻击测试摘要消息
- 严重性分类
要求
- Python 3.10 或更高版本
- OpenAI 或 Anthropic SDK
- 目标模型访问权限
- 获授权的评估范围
- 隔离的生产近似环境
