LogoClawIndex
案例技能关于
LogoClawIndex

blip-2-vision-language - BLIP-2 视觉语言任务支持

使用 BLIP-2 进行图像描述、视觉问答、图文检索、特征提取和多模态对话。

标签

更新于: 2026-10-05
多模态视觉语言图像描述视觉问答图文检索零样本

能力

典型输入

典型输出

该技能可以做什么

  • 生成图像描述
  • 回答视觉问题
  • 检索图文匹配
  • 提取图像特征
  • 批量处理图像
  • 控制文本生成

输入

  • 输入图像
  • 视觉问题
  • 文本提示
  • 模型检查点

输出

  • 生成的图像描述
  • 问题答案
  • 匹配分数
  • 图像特征
  • 控制台消息

要求

  • Python 环境
  • Transformers 软件包
  • PyTorch 软件包
  • Pillow 软件包
  • BLIP-2 模型检查点

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
生成图像描述
回答视觉问题
检索图文匹配
提取图像特征
输入图像
视觉问题
文本提示
生成的图像描述
问题答案
匹配分数