pdf-download-extract-fallback - PDF下载与多策略文本提取
多步骤PDF下载与文本提取,支持渐进式降级策略
标签
更新于: 2026-06-15能力
典型输入
典型输出
该技能可以做什么
- 从URL下载PDF
- 验证文件类型
- 使用pdftotext提取文本
- 使用PyMuPDF提取文本
- 检查工具可用性
- 验证本地文件
- 记录提取失败
输入
- PDF URL
- 本地PDF文件
- poppler-utils
- PyMuPDF
输出
- 下载的PDF文件
- 提取的文本文件
- 错误消息
- 失败记录
要求
- curl
- pdftotext (poppler-utils)
- Python 3
- PyMuPDF (fitz)
- file命令
