LogoClawIndex
CasesSkillsAbout
LogoClawIndex

gt/gpt-multimodal - Analyze images and video frames with GPT

Analyzes images and sequential frames for visual content, text extraction, comparison, and scene understanding with OpenAI vision-capable GPT models.

Tags

Updated: 2026-10-05

Capabilities

Typical Inputs

Typical Outputs

What this skill does

  • Analyze image content
  • Extract text from images
  • Compare multiple images
  • Analyze sequential frames
  • Generate image descriptions
  • Answer visual questions

Inputs

  • Image files
  • Image URLs
  • Base64-encoded images
  • Analysis prompts
  • OpenAI API key

Outputs

  • Image analysis results
  • Extracted text
  • Structured JSON responses
  • Processing metadata
  • Warnings

Requirements

  • Python environment
  • OpenAI Python library
  • OpenAI API access
  • Vision-capable GPT model

Source

  • Spec: SKILL.md

ClawIndex

OpenClaw Skills & Use Case Index

ClawIndex is an ecosystem-driven index of OpenClaw skills and real-world use cases.

Index

Skills·
Cases

Meta

About·
Disclaimer·
Email·
GitHub
© 2026 ClawIndex All Rights Reserved.
image analysis
OCR
computer vision
multimodal
video frames
Analyze image content
Extract text from images
Compare multiple images
Analyze sequential frames
Image files
Image URLs
Base64-encoded images
Image analysis results
Extracted text
Structured JSON responses