corpus-report - PDF Extraction Corpus Statistics and Quality Report
Report on the continuous PDF extraction learning system corpus statistics, quality analysis, and pipeline bottlenecks.
Tags
Updated: 2026-02-24Capabilities
Typical Inputs
Typical Outputs
What this skill does
- generate summary report
- analyze quality metrics
- identify failure patterns
- detect pipeline bottlenecks
- track quality trends
Inputs
- manifest.jsonl file
- pattern_registry.json file
- timings_summary.json files
- corpus root directory
Outputs
- summary report
- quality analysis report
- failure pattern report
- pipeline bottlenecks report
- trend analysis report
- JSON formatted data
Requirements
- Bash shell
- Read access to corpus files
- CORPUS_ROOT environment variable
- Python dependencies
