document-processor - 从PDF和DOCX文件中提取文本
从PDF和DOCX文件中提取文本,支持OCR和页面分割
标签
更新于: 2026-05-11能力
典型输入
典型输出
该技能可以做什么
- 提取PDF内容
- 提取DOCX内容
- 对扫描文档执行OCR
- 分割大文档
- 将DOCX转换为markdown
- 提取文档元数据
- 提取嵌入图片
输入
- PDF文件
- DOCX文件
- 图片型PDF
输出
- 提取的文本
- markdown文件
- JSON输出
- 提取的图片
- 文档元数据
要求
- Python环境
- pypdf
- python-docx
- tesseract用于OCR
- poppler用于pdftotext
