LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

带有该标签的 Skills:多模态

浏览带有该标签的技能列表。

  • seedance-v2 - RunComfy 上的 Seedance 2.0 Pro 专业包
    视频生成seedanceruncomfy字节跳动

    ★ 0 · 更新于 2026-09-21

    使用本地 RunComfy CLI 运行字节跳动 Seedance 2.0 Pro 生成带有原生口型同步音频的电影级短视频。

    ⚙ 生成电影级短视频⚙ 同步原生口型匹配音频⚙ 处理多模态参考输入
  • firebase-ai-logic-basics - 将 Firebase AI Logic 集成至应用程序
    firebasegemini-apiai-logic多模态

    ★ 1 · 更新于 2026-09-20

    用于将 Firebase AI Logic 集成至应用的官方技能,涵盖环境设置、多模态推理、结构化输出与安全配置。

    ⚙ 生成文本响应⚙ 分析多模态输入媒体⚙ 维护多轮对话会话
  • firebase-ai-logic-basics - Firebase AI Logic 与 Gemini API 集成。
    firebaseai-logicgemini-apisdk

    ★ 0 · 更新于 2026-09-20

    通过 Firebase AI Logic 客户端 SDK 调用 Gemini 模型,实现多模态推理、流式传输及结构化输出。

    ⚙ 生成文本响应⚙ 处理多模态输入媒体⚙ 管理多轮对话会话
  • firebase-ai-logic-basics - Firebase AI Logic 应用集成指南
    firebasegemini-api多模态ai集成

    ★ 0 · 更新于 2026-09-20

    用于在客户端应用中集成 Firebase AI Logic 与 Gemini API,涵盖文本生成、多模态推理、流式传输及安全配置。

    ⚙ 根据提示词生成文本⚙ 处理多模态输入文件⚙ 维护多轮对话会话
  • firebase-ai-logic-basics - 在 Web 与移动应用中集成 Firebase AI Logic
    FirebaseGemini APIAI Logic多模态

    ★ 0 · 更新于 2026-09-20

    将 Firebase AI Logic SDK 集成到 Web 与移动应用中,实现 Gemini API 多模态推理、结构化输出、流式响应与安全配置。

    ⚙ 生成文本内容⚙ 处理多模态输入⚙ 维护多轮对话会话
  • youtube-learn - 基于信念考古学与多模态视觉的视频分析
    youtube多模态信念考古视频分析

    ★ 29 · 更新于 2026-09-20

    通过多模态帧提取和逐字稿分析,深入解析视频演讲者的底层世界观与核心信念。

    ⚙ 下载视频音频与画面帧⚙ 提取并转录视频语音⚙ 检索演讲者背景与特征
  • ai-engineer - 构建生产级大语言模型应用与智能体
    AI大语言模型RAG智能体

    ★ 0 · 更新于 2026-09-19

    开发生产级大语言模型应用、高级检索增强生成系统、向量搜索、多模态 AI 及智能体编排。

    ⚙ 构建大语言模型应用⚙ 实现检索增强生成系统⚙ 编排多智能体工作流
  • napkin - 面向 Copilot CLI 的可视化白板协作工具
    白板可视化协作Copilot CLI多模态

    ★ 0 · 更新于 2026-09-18

    创建浏览器交互式白板,支持绘制草图并通过共享画布快照与便签供 Copilot 分析协作。

    ⚙ 打开浏览器白板模板⚙ 读取 PNG 画布快照⚙ 读取剪贴板 JSON 数据
  • sd3mf-multimodal-brain-network - 监督深度多模态矩阵分解框架
    脑网络多模态矩阵分解连接组

    ★ 3 · 更新于 2026-09-16

    将 SNMTF 扩展至多模态图群体的监督预测,用于可解释的脑网络分析。

    ⚙ 分析多模态连接组数据⚙ 对图数据执行监督预测⚙ 提取社区级相互作用矩阵
  • ds-vision-skill - 为纯文本推理模型提供视觉能力扩展的技能
    视觉ocr文档解析路由

    ★ 166 · 更新于 2026-09-15

    自动将图片、文档和 OCR 任务路由至专用工具处理,并向主模型返回标准 JSON 结果。

    ⚙ 路由视觉推理任务⚙ 解析文档文件⚙ 执行 OCR 文字识别
  • video-analyzer - 视频分析
    视频分析Gemini多模态语音转写

    ★ 97 · 更新于 2026-09-12

    使用 Google Gemini 分析视频文件并生成包含场景拆解、音频转录及视觉细节的结构化 Markdown 报告。

    ⚙ 分析视频文件⚙ 生成结构化 Markdown 报告⚙ 提取音频转录内容
  • develop-agent-module - 开发代理模块
    代理模块开发调试

    ★ 71 · 更新于 2026-06-15

    修改、扩展或调试代理模块,包括图、工具、护栏和包装器

    ⚙ 修改代理图⚙ 向代理图添加节点⚙ 修改路由
  • vllm-ascend-model-adapter - 在昇腾NPU上适配vLLM模型
    昇腾NPUvLLMHugging Face模型适配

    ★ 0 · 更新于 2026-05-11

    适配并调试Hugging Face或本地模型在昇腾NPU上运行vLLM

    ⚙ 收集模型上下文⚙ 分析模型文件⚙ 实现模型适配器
  • vllm-ascend-model-adapter - 适配模型在昇腾NPU上运行vLLM
    vllm昇腾NPU模型适配

    ★ 5 · 更新于 2026-05-11

    适配Hugging Face或本地模型在vllm-ascend上运行,代码改动最小化

    ⚙ 分析模型架构⚙ 检查模型文件⚙ 实现模型适配器
  • vllm-ascend-model-adapter - vLLM Ascend 模型适配
    模型适配Ascend NPUvLLM推理

    ★ 57 · 更新于 2026-05-11

    为 vLLM 在 Ascend NPU 上适配和调试模型

    ⚙ 分析模型架构⚙ 实现模型适配器⚙ 添加处理器支持
  • ai-engineer - 构建生产级LLM应用
    llmragagentsai

    ★ 11 · 更新于 2026-05-09

    构建生产级LLM应用、高级RAG系统和智能代理

    ⚙ 构建LLM应用⚙ 实现RAG系统⚙ 部署AI代理
  • replay-buffer - 多模态经验回放缓冲区
    强化学习经验回放多模态记忆

    ★ 0 · 更新于 2026-03-22

    将心跳转换记录到索引存储,支持采样、时间范围查询和情节重放。

    ⚙ 记录转换⚙ 查询缓冲区⚙ 重放情节
  • dual_branch_vit_adaptive_counter_guide - 双分支ViT RGB/事件融合
    ViT多模态自注意力PyTorch

    ★ 581 · 更新于 2026-03-10

    将基于自注意力的Counter_Guide模块与自适应权重集成到双分支ViT中,实现RGB/事件数据融合

    ⚙ 实现自注意力模块⚙ 创建多上下文注意力⚙ 应用自适应权重
  • looker - 多模态分析专家:PDF/图片/图表/架构图/截图分析
    多模态分析PDF图片

    ★ 18 · 更新于 2026-03-09

    分析PDF、图片、图表、架构图和截图等媒体文件以提取信息

    ⚙ 提取PDF文本⚙ 描述图片内容⚙ 解读图表数据
  • looker - 多模态分析专家,支持PDF、图片、图表和截图分析
    多模态文档分析图片分析数据提取

    ★ 602 · 更新于 2026-03-09

    分析媒体文件,包括PDF、图片、图表、架构图和截图

    ⚙ 提取PDF文本⚙ 描述图片内容⚙ 解释图表数据

Scroll to load more