LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

post-ocr-cleanup - 清理并评估 OCR 后文本

纠正 OCR 错误,执行确定性清理,保留溯源信息,并诊断多语言文本质量。

标签

更新于: 2026-10-05

能力

典型输入

典型输出

该技能可以做什么

  • 选择校正策略
  • 校正 OCR 文本
  • 应用确定性修复
  • 恢复语言特定变音符号
  • 约束解码输出
  • 清理模型过度生成
  • 计算编辑距离
  • 诊断页面质量
  • 标记可疑页面
  • 保留原始文本

输入

  • OCR 文本
  • 源语言元数据
  • 文档时代元数据
  • 文档类型元数据
  • 字体信息
  • 扫描规格
  • OCR 引擎信息
  • 文档图像
  • 下游质量阈值
  • 评估用真实文本

输出

  • 清理后的 OCR 文本
  • 原始文本副本
  • 溯源记录
  • 编辑距离指标
  • 变更比例
  • 页面质量诊断结果
  • 人工复核标记

要求

  • 用于模型校正的 LLM 访问权限
  • 用于模型推理的 GPU 资源
  • 用于令牌级 CBS 的模型 logits
  • 参考提示词和模式文件

来源

  • 规范: SKILL.md
OCR
文本清理
历史文档
研究语料库
多语言处理
数据溯源
质量诊断
选择校正策略
校正 OCR 文本
应用确定性修复
恢复语言特定变音符号
OCR 文本
源语言元数据
文档时代元数据
清理后的 OCR 文本
原始文本副本
溯源记录