LogoClawIndex
案例技能关于
LogoClawIndex

ocr_kb - 逐页提取 PDF 并生成 DOCX

使用多模态模型逐页读取 PDF,提取文本、LaTeX 公式和配图,并通过断点恢复与核查逐步生成 DOCX 文件。

标签

更新于: 2026-09-30
OCRPDF 处理多模态提取LaTeX 提取配图裁剪DOCX 生成断点恢复

能力

视觉读取 PDF 页面提取文本和 LaTeX裁剪页面配图生成增量 DOCX 文件

典型输入

源 PDF 文件排版格式规范可选 DOCX 模板

典型输出

单页 PNG 文件逐页 Markdown 文件裁剪后的配图文件

该技能可以做什么

  • 视觉读取 PDF 页面
  • 提取文本和 LaTeX
  • 裁剪页面配图
  • 生成增量 DOCX 文件
  • 跟踪断点和计数器
  • 每两页执行核查
  • 重跑指定页面

输入

  • 源 PDF 文件
  • 排版格式规范
  • 可选 DOCX 模板
  • 继续或重跑指令

输出

  • 单页 PNG 文件
  • 逐页 Markdown 文件
  • 裁剪后的配图文件
  • 汇总 Markdown 文件
  • 断点 JSON 文件
  • 核查点 DOCX 文件
  • 最终 DOCX 文件
  • 完成报告

要求

  • 支持图像读取的多模态模型
  • Python 运行环境
  • resources/ 写入权限
  • outputs/ 写入权限

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。