blip-2-vision-language - BLIP-2 vision-language task support
Use BLIP-2 for image captioning, visual question answering, image-text retrieval, feature extraction, and multimodal chat.
Tags
Updated: 2026-10-05Capabilities
Typical Inputs
Typical Outputs
What this skill does
- Generate image captions
- Answer visual questions
- Retrieve image-text matches
- Extract image features
- Process image batches
- Control text generation
Inputs
- Input images
- Visual questions
- Text prompts
- Model checkpoints
Outputs
- Generated captions
- Question answers
- Matching scores
- Image features
- Console messages
Requirements
- Python environment
- Transformers package
- PyTorch package
- Pillow package
- BLIP-2 model checkpoint
