document-ocr-agent - 提取文档文本与结构化字段
使用 Google Document AI 从 PDF、图像、收据、发票和扫描文档中提取 OCR 文本、结构化实体及页面级元数据。
标签
更新于: 2026-09-29能力
典型输入
典型输出
该技能可以做什么
- 处理文档并执行 OCR
- 提取结构化实体
- 返回页面级元数据
- 批量处理图像
- 选择文档处理器
输入
- 文档文件 URL
- 云文件 ID
- Base64 编码文件内容
- 文档类型
- MIME 类型
- 输出限制
输出
- 提取的 OCR 文本
- 结构化实体
- 逐页摘要元数据
- 原始 Document AI 响应
要求
- AgentPMT 托管的远程工具访问权限
- process_document 操作
