crawl4ai - 抓取 JavaScript 重型网站并提取结构化数据
抓取 JavaScript 渲染页面和多个 URL,生成 Markdown,并通过 CSS 或基于 LLM 的策略提取结构化数据。
标签
更新于: 2026-10-01能力
典型输入
典型输出
该技能可以做什么
- 抓取 JavaScript 重型页面
- 生成 Markdown 内容
- 提取结构化数据
- 并发处理多个 URL
- 从站点地图发现 URL
- 应用 CSS 提取模式
- 运行基于 LLM 的提取
输入
- 目标 URL
- CSS 或 JSON 模式
- 提取提示词
- 浏览器配置
- 爬虫配置
- URL 列表
- 站点地图或域名来源
输出
- Markdown 内容
- 原始 HTML
- 发现的链接
- 媒体元数据
- 提取的结构化数据
- 批处理输出文件
要求
- 已安装的 crawl4ai 软件包
- 已配置的 Playwright 浏览器
- 使用 SDK 所需的 Python 运行环境
- 运行基于 LLM 提取所需的 LLM 访问权限
