LogoClawIndex
案例技能关于
LogoClawIndex

power-crawl - 使用 Playwright MCP 批量采集结构化网页数据

发现网页数据接口,在浏览器循环中采集分页或无限滚动记录,保存为 JSONL/CSV 文件并验证数据质量。

标签

更新于: 2026-09-29

能力

典型输入

典型输出

该技能可以做什么

  • 发现内部 JSON API
  • 提取嵌入式 JSON
  • 采集分页记录
  • 处理无限滚动
  • 获取认证数据
  • 将批量数据保存到文件
  • 将 JSON 规范化为 JSONL/CSV
  • 计算字段填充率
  • 检测重复记录
  • 生成爬取报告

输入

  • 目标网页
  • 采集字段
  • 分页参数
  • 输出目录
  • 用户已认证的浏览器会话

输出

  • 原始 JSON 文件
  • JSONL 输出文件
  • CSV 输出文件
  • crawl-report.md
  • 采集质量统计
  • 爬取错误记录

要求

  • Playwright MCP
  • 浏览器会话访问权限
  • 需要时由用户完成登录
  • 用于整理结果的 Python 3

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
网页爬取
网页抓取
数据采集
Playwright
API 发现
分页采集
无限滚动
数据验证
发现内部 JSON API
提取嵌入式 JSON
采集分页记录
处理无限滚动
目标网页
采集字段
分页参数
原始 JSON 文件
JSONL 输出文件
CSV 输出文件