LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

blip-2-vision-language - BLIP-2 视觉语言任务框架

使用冻结的视觉与语言模型支持图像描述、视觉问答、图文匹配、特征提取和多模态理解。

标签

更新于: 2026-10-04
多模态视觉语言图像描述视觉问答零样本

能力

典型输入

典型输出

该技能可以做什么

  • 生成图像描述
  • 回答视觉问题
  • 匹配图像与文本
  • 提取图像特征
  • 处理图像批次
  • 控制文本生成

输入

  • 图像文件
  • 视觉问题
  • 文本提示
  • 模型检查点

输出

  • 生成的图像描述
  • 视觉问题答案
  • 图文匹配分数
  • 图像特征嵌入
  • 生成文本

要求

  • transformers>=4.30.0
  • torch>=1.10.0
  • Pillow
  • 受支持的 OPT 或 FlanT5 模型

来源

  • 规范: SKILL.md
生成图像描述
回答视觉问题
匹配图像与文本
提取图像特征
图像文件
视觉问题
文本提示
生成的图像描述
视觉问题答案
图文匹配分数