gt/gpt-multimodal - Analyze images and video frames with GPT
Analyzes images and sequential frames for visual content, text extraction, comparison, and scene understanding with OpenAI vision-capable GPT models.
Tags
Updated: 2026-10-05Capabilities
Typical Inputs
Typical Outputs
What this skill does
- Analyze image content
- Extract text from images
- Compare multiple images
- Analyze sequential frames
- Generate image descriptions
- Answer visual questions
Inputs
- Image files
- Image URLs
- Base64-encoded images
- Analysis prompts
- OpenAI API key
Outputs
- Image analysis results
- Extracted text
- Structured JSON responses
- Processing metadata
- Warnings
Requirements
- Python environment
- OpenAI Python library
- OpenAI API access
- Vision-capable GPT model
