power-crawl - Collect structured web data with Playwright MCP
Discovers page data APIs, collects paginated or infinite-scroll records in browser loops, saves JSONL/CSV files, and validates data quality.
Tags
Updated: 2026-09-29Capabilities
Typical Inputs
Typical Outputs
What this skill does
- Discover internal JSON APIs
- Extract embedded JSON
- Collect paginated records
- Handle infinite scrolling
- Fetch authenticated data
- Save bulk data to files
- Normalize JSON into JSONL/CSV
- Measure field completeness
- Detect duplicate records
- Generate crawl reports
Inputs
- Target web page
- Collection fields
- Pagination parameters
- Output directory
- User-authenticated browser session
Outputs
- Raw JSON files
- JSONL output file
- CSV output file
- crawl-report.md
- Collection quality statistics
- Crawl error records
Requirements
- Playwright MCP
- Browser session access
- User-completed login when required
- Python 3 for finalization
