LogoClawIndex
案例技能关于
LogoClawIndex

gpt-multimodal - 分析图像与连续视觉帧

使用具备视觉能力的 OpenAI GPT 模型分析图像和多帧序列,包括视觉理解、文本提取、图像比较和时序分析。

标签

更新于: 2026-10-05
多模态计算机视觉图像分析文字识别视频帧OpenAI GPT

能力

典型输入

典型输出

该技能可以做什么

  • 分析图像内容
  • 理解视觉场景
  • 提取图像文本
  • 比较多张图像
  • 分析连续帧
  • 生成图像描述
  • 回答视觉问题

输入

  • 图像文件
  • 图像 URL
  • Base64 编码图像
  • 视频帧
  • 分析提示词

输出

  • JSON 分析结果
  • 图像描述
  • 提取的文本
  • 图像比较结果
  • 时序分析结果
  • 处理警告

要求

  • OpenAI API 密钥
  • OpenAI Python 库
  • 具备视觉能力的 GPT 模型
  • 受支持的图像格式

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
分析图像内容
理解视觉场景
提取图像文本
比较多张图像
图像文件
图像 URL
Base64 编码图像
JSON 分析结果
图像描述
提取的文本