LogoClawIndex
案例技能关于
LogoClawIndex

document-processor - 从PDF和DOCX文件中提取文本

从PDF和DOCX文件中提取文本,支持OCR和页面分割

标签

更新于: 2026-05-11
文档处理PDFDOCX文本提取OCR文件转换

能力

典型输入

典型输出

该技能可以做什么

  • 提取PDF内容
  • 提取DOCX内容
  • 对扫描文档执行OCR
  • 分割大文档
  • 将DOCX转换为markdown
  • 提取文档元数据
  • 提取嵌入图片

输入

  • PDF文件
  • DOCX文件
  • 图片型PDF

输出

  • 提取的文本
  • markdown文件
  • JSON输出
  • 提取的图片
  • 文档元数据

要求

  • Python环境
  • pypdf
  • python-docx
  • tesseract用于OCR
  • poppler用于pdftotext

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
提取PDF内容
提取DOCX内容
对扫描文档执行OCR
分割大文档
PDF文件
DOCX文件
图片型PDF
提取的文本
markdown文件
JSON输出