blip-2-vision-language - BLIP-2 视觉语言任务框架
使用冻结的视觉与语言模型支持图像描述、视觉问答、图文匹配、特征提取和多模态理解。
标签
更新于: 2026-10-04能力
典型输入
典型输出
该技能可以做什么
- 生成图像描述
- 回答视觉问题
- 匹配图像与文本
- 提取图像特征
- 处理图像批次
- 控制文本生成
输入
- 图像文件
- 视觉问题
- 文本提示
- 模型检查点
输出
- 生成的图像描述
- 视觉问题答案
- 图文匹配分数
- 图像特征嵌入
- 生成文本
要求
- transformers>=4.30.0
- torch>=1.10.0
- Pillow
- 受支持的 OPT 或 FlanT5 模型
