ocr_kb - 逐页提取 PDF 并生成 DOCX
使用多模态模型逐页读取 PDF,提取文本、LaTeX 公式和配图,并通过断点恢复与核查逐步生成 DOCX 文件。
标签
更新于: 2026-09-30该技能可以做什么
- 视觉读取 PDF 页面
- 提取文本和 LaTeX
- 裁剪页面配图
- 生成增量 DOCX 文件
- 跟踪断点和计数器
- 每两页执行核查
- 重跑指定页面
输入
- 源 PDF 文件
- 排版格式规范
- 可选 DOCX 模板
- 继续或重跑指令
输出
- 单页 PNG 文件
- 逐页 Markdown 文件
- 裁剪后的配图文件
- 汇总 Markdown 文件
- 断点 JSON 文件
- 核查点 DOCX 文件
- 最终 DOCX 文件
- 完成报告
要求
- 支持图像读取的多模态模型
- Python 运行环境
- resources/ 写入权限
- outputs/ 写入权限
