ai-red-teaming - Run structured AI red team assessments
Runs adversarial tests for jailbreak resistance, data exfiltration, harmful outputs, tool abuse, social engineering, and availability abuse.
Tags
Updated: 2026-09-29Capabilities
Typical Outputs
What this skill does
- Define threat scenarios
- Build reusable attack suites
- Generate adversarial prompts
- Test model responses
- Evaluate attack success
- Classify finding severity
- Export test results
Inputs
- Target model endpoint
- Model access credentials
- Runner configuration
- Adversarial prompt library
- Prompt tracking tool
- Isolated test environment
Outputs
- Red team test results
- JSON results file
- Attack summary message
- Severity classifications
Requirements
- Python 3.10 or later
- OpenAI or Anthropic SDK
- Target model access
- Authorized assessment scope
- Isolated production-like environment
