gpt-multimodal - 分析图像与连续视觉帧
使用具备视觉能力的 OpenAI GPT 模型分析图像和多帧序列,包括视觉理解、文本提取、图像比较和时序分析。
标签
更新于: 2026-10-05能力
典型输入
典型输出
该技能可以做什么
- 分析图像内容
- 理解视觉场景
- 提取图像文本
- 比较多张图像
- 分析连续帧
- 生成图像描述
- 回答视觉问题
输入
- 图像文件
- 图像 URL
- Base64 编码图像
- 视频帧
- 分析提示词
输出
- JSON 分析结果
- 图像描述
- 提取的文本
- 图像比较结果
- 时序分析结果
- 处理警告
要求
- OpenAI API 密钥
- OpenAI Python 库
- 具备视觉能力的 GPT 模型
- 受支持的图像格式
