power-crawl - 使用 Playwright MCP 批量采集结构化网页数据
发现网页数据接口,在浏览器循环中采集分页或无限滚动记录,保存为 JSONL/CSV 文件并验证数据质量。
标签
更新于: 2026-09-29能力
典型输入
典型输出
该技能可以做什么
- 发现内部 JSON API
- 提取嵌入式 JSON
- 采集分页记录
- 处理无限滚动
- 获取认证数据
- 将批量数据保存到文件
- 将 JSON 规范化为 JSONL/CSV
- 计算字段填充率
- 检测重复记录
- 生成爬取报告
输入
- 目标网页
- 采集字段
- 分页参数
- 输出目录
- 用户已认证的浏览器会话
输出
- 原始 JSON 文件
- JSONL 输出文件
- CSV 输出文件
- crawl-report.md
- 采集质量统计
- 爬取错误记录
要求
- Playwright MCP
- 浏览器会话访问权限
- 需要时由用户完成登录
- 用于整理结果的 Python 3
