LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

gt/gpt-multimodal - 使用 GPT 分析图像与视频帧

使用 OpenAI 视觉模型分析图像和连续帧,执行视觉理解、文字提取、图像比较和场景分析。

标签

更新于: 2026-10-05
图像分析OCR计算机视觉多模态视频帧

能力

典型输入

典型输出

该技能可以做什么

  • 分析图像内容
  • 提取图像文字
  • 比较多张图像
  • 分析连续视频帧
  • 生成图像描述
  • 回答视觉问题

输入

  • 图像文件
  • 图像 URL
  • Base64 编码图像
  • 分析提示词
  • OpenAI API 密钥

输出

  • 图像分析结果
  • 提取的文字
  • 结构化 JSON 响应
  • 处理元数据
  • 警告信息

要求

  • Python 运行环境
  • OpenAI Python 库
  • OpenAI API 访问权限
  • 支持视觉的 GPT 模型

来源

  • 规范: SKILL.md
分析图像内容
提取图像文字
比较多张图像
分析连续视频帧
图像文件
图像 URL
Base64 编码图像
图像分析结果
提取的文字
结构化 JSON 响应