gem - Gemini Multimodal AI Content Processing
Process multimodal content using Google Gemini API for analysis and information extraction
Tags
Updated: 2026-02-11Capabilities
Typical Inputs
Typical Outputs
What this skill does
- analyze PDF documents
- process image files
- analyze video content
- extract YouTube information
- compare multiple files
- perform web searches
Inputs
- PDF files
- image files
- video files
- YouTube URLs
- text documents
- search queries
Outputs
- analysis reports
- document summaries
- comparison results
- extracted information
- search results
Requirements
- GEMINI_API_KEY environment variable
- hamel Python package
- Google Gemini API access
