LogoClawIndex
CasesSkillsAbout
LogoClawIndex

ClawIndex

OpenClaw Skills & Use Case Index

ClawIndex is an ecosystem-driven index of OpenClaw skills and real-world use cases.

Index

Skills·
Cases

Meta

About·
Disclaimer·
Email·
GitHub
© 2026 ClawIndex All Rights Reserved.

Skills tagged: multimodal

Browse skills that share this tag.

  • seedance-v2 - Seedance 2.0 Pro — Pro Pack on RunComfy
    video-generationseedanceruncomfybytedance

    ★ 0 · Updated 2026-09-21

    Generates cinematic short-form video with native lip-synced audio using ByteDance Seedance 2.0 Pro via the local RunComfy CLI.

    ⚙ Generate cinematic short-form video⚙ Synchronize native lip-synced audio⚙ Process multi-modal reference inputs
  • firebase-ai-logic-basics - Integrate Firebase AI Logic into applications
    firebasegemini-apiai-logicmultimodal

    ★ 1 · Updated 2026-09-20

    Official skill for integrating Firebase AI Logic Gemini API into applications, covering setup, multimodal inference, structured output, and security.

    ⚙ Generate text responses⚙ Analyze multimodal input media⚙ Maintain multi-turn chat sessions
  • firebase-ai-logic-basics - Firebase AI Logic and Gemini API integration.
    firebaseai-logicgemini-apisdk

    ★ 0 · Updated 2026-09-20

    Integrates Firebase AI Logic to call Gemini models from client SDKs for multimodal generation, streaming, and structured output.

    ⚙ Generate text responses⚙ Process multimodal input media⚙ Manage multi-turn chat sessions
  • firebase-ai-logic-basics - Firebase AI Logic Integration Guide
    firebasegemini-apimultimodalai-integration

    ★ 0 · Updated 2026-09-20

    Integrates Firebase AI Logic and Gemini API into client apps for text generation, multimodal inference, streaming, and security.

    ⚙ Generate text from prompts⚙ Process multimodal input files⚙ Maintain multi-turn chat sessions
  • firebase-ai-logic-basics - Integrate Firebase AI Logic into web and mobile apps
    firebasegemini-apiai-logicmultimodal

    ★ 0 · Updated 2026-09-20

    Integrates Firebase AI Logic SDK into web and mobile apps for Gemini API multimodal inference, structured output, streaming, and security configuration.

    ⚙ Generate text content⚙ Process multimodal inputs⚙ Maintain multi-turn chat sessions
  • youtube-learn - Video Belief Archaeology and Multimodal Analysis
    youtubemultimodalbelief-archaeologyvideo-analysis

    ★ 29 · Updated 2026-09-20

    Extracts speaker worldviews and core beliefs from videos using multimodal frame analysis and transcripts.

    ⚙ Download video audio and frames⚙ Extract transcripts from audio⚙ Research speaker background and profile
  • ai-engineer - Build production-ready LLM applications and AI agents
    aillmragagent

    ★ 0 · Updated 2026-09-19

    Develops production-ready LLM applications, advanced RAG systems, vector search, multimodal AI, and agent orchestration.

    ⚙ Build LLM applications⚙ Implement RAG systems⚙ Orchestrate multi-agent workflows
  • napkin - Visual whiteboard collaboration for Copilot CLI
    whiteboardvisual-collaborationcopilot-climultimodal

    ★ 0 · Updated 2026-09-18

    Opens an interactive browser whiteboard to sketch ideas and share canvas snapshots with Copilot for visual analysis.

    ⚙ Open browser whiteboard template⚙ Read PNG canvas snapshot⚙ Read clipboard JSON data
  • sd3mf-multimodal-brain-network - Supervised Deep Multimodal Matrix Factorization
    brain-networkmultimodalmatrix-factorizationconnectome

    ★ 3 · Updated 2026-09-16

    Extends SNMTF to supervised prediction over populations of multimodal graphs for interpretable brain network analysis.

    ⚙ Analyze multimodal connectome data⚙ Perform supervised prediction on graphs⚙ Extract community level interaction matrices
  • ds-vision-skill - Vision extension skill for text reasoning models
    visionocrdocument-parsingrouting

    ★ 166 · Updated 2026-09-15

    Routes image, document, and OCR tasks to specialized execution tools and returns standard JSON output for text models.

    ⚙ Route vision reasoning tasks⚙ Parse document files⚙ Perform OCR text recognition
  • video-analyzer - Analyze Video
    video-analysisgeminimultimodaltranscription

    ★ 97 · Updated 2026-09-12

    Analyzes a video file with Google Gemini and returns a structured markdown report covering scenes, audio transcript, visual details, and key moments.

    ⚙ Analyze video files⚙ Generate structured markdown reports⚙ Extract audio transcripts
  • develop-agent-module - Develop Agent Module
    agentmoduledevelopmentdebugging

    ★ 71 · Updated 2026-06-15

    Modify, extend, or debug the agent module including graph, tools, guardrails, and wrappers

    ⚙ modify agent graph⚙ add node to agent graph⚙ modify routing
  • vllm-ascend-model-adapter - Adapt models for vLLM on Ascend NPU
    Ascend NPUvLLMHugging Facemodel adaptation

    ★ 0 · Updated 2026-05-11

    Adapt and debug Hugging Face or local models for vLLM on Ascend NPU

    ⚙ collect model context⚙ analyze model files⚙ implement model adapter
  • vllm-ascend-model-adapter - Adapt Models for vLLM on Ascend NPU
    vllmascendnpumodel adaptation

    ★ 2 · Updated 2026-05-11

    Adapt Hugging Face or local models to run on vllm-ascend with minimal changes

    ⚙ analyze model architecture⚙ inspect model files⚙ implement model adapter
  • vllm-ascend-model-adapter - vLLM Ascend Model Adaptation
    model adaptationAscend NPUvLLMinference

    ★ 57 · Updated 2026-05-11

    Adapt and debug models for vLLM on Ascend NPU.

    ⚙ analyze model architecture⚙ implement model adapter⚙ add processor support
  • ai-engineer - Build Production-Ready LLM Applications
    llmragagentsai

    ★ 11 · Updated 2026-05-09

    Build production-ready LLM applications, advanced RAG systems, and intelligent agents

    ⚙ Build LLM applications⚙ Implement RAG systems⚙ Deploy AI agents
  • replay-buffer - Multimodal Experience Replay Buffer
    reinforcement learningexperience replaymultimodalmemory

    ★ 0 · Updated 2026-03-22

    Records heartbeat transitions into indexed store with sampling, time-range queries, and episode replay support.

    ⚙ record transition⚙ query buffer⚙ replay episode
  • dual_branch_vit_adaptive_counter_guide - Dual-Branch ViT RGB/Event Fusion
    ViTmultimodalself_attentionPyTorch

    ★ 581 · Updated 2026-03-10

    Integrate Counter_Guide module with Adaptive_Weight into dual-branch ViT for RGB/Event fusion using Multi_Context architecture

    ⚙ implement self-attention module⚙ create multi_context attention⚙ apply adaptive weighting
  • looker - Multimodal Analysis Agent for PDFs, Images, Charts and Screenshots
    multimodalanalysispdfimage

    ★ 18 · Updated 2026-03-09

    Analyzes media files including PDFs, images, charts, diagrams and screenshots to extract information

    ⚙ extract text from PDF⚙ describe image content⚙ interpret chart data
  • looker - Multimodal Analysis Agent for PDF, Images, Charts and Screenshots
    multimodaldocument-analysisimage-analysisdata-extraction

    ★ 602 · Updated 2026-03-09

    Analyzes media files including PDFs, images, charts, architecture diagrams and screenshots

    ⚙ extract text from PDF⚙ describe image content⚙ interpret chart data

Scroll to load more