gt/gpt-multimodal - 使用 GPT 分析图像与视频帧
使用 OpenAI 视觉模型分析图像和连续帧,执行视觉理解、文字提取、图像比较和场景分析。
标签
更新于: 2026-10-05能力
典型输入
典型输出
该技能可以做什么
- 分析图像内容
- 提取图像文字
- 比较多张图像
- 分析连续视频帧
- 生成图像描述
- 回答视觉问题
输入
- 图像文件
- 图像 URL
- Base64 编码图像
- 分析提示词
- OpenAI API 密钥
输出
- 图像分析结果
- 提取的文字
- 结构化 JSON 响应
- 处理元数据
- 警告信息
要求
- Python 运行环境
- OpenAI Python 库
- OpenAI API 访问权限
- 支持视觉的 GPT 模型
