Skill 广场
网站多页面批量爬取 Skill

网站多页面批量爬取.Skill

@firecrawl/firecrawl-crawl

4.6优秀AI 评分基础检查通过源自 GitHub

该功能基于 Firecrawl CLI 提供的整站或指定子路径批量递归爬取能力。用户可以指定根网址、抓取深度上限(--max-depth)或子目录白名单(--include-paths),自动顺着超链接遍历全站多层级页面,提取干净的页面结构与正文数据,支持同步等待导出到指定 JSON 文件,或提交异步后台任务供后续查询状态。

AI工作流大模型应用与RAG开发者知识库构建工程师数据采集与分析人员2026-09-23 更新main

网站多页面批量爬取

该功能基于 Firecrawl CLI 提供的整站或指定子路径批量递归爬取能力。用户可以指定根网址、抓取深度上限(--max-depth)或子目录白名单(--include-paths),自动顺着超链接遍历全站多层级页面,提取干净的页面结构与正文数据,支持同步等待导出到指定 JSON 文件,或提交异步后台任务供后续查询状态。

它会先理解你的原始内容和目标,再按清晰的步骤完成处理。你不需要学习复杂命令,也不用理解背后的技术细节。

常见场景

它能帮你做什么?

01

02

03

三步完成

怎么使用

1安装 Skill

把右侧安装请求发给你的 AI。

2说清楚目标

告诉 AI 你想完成什么,或直接贴入内容。

3检查结果

按需要继续调整语气、范围或格式。

复制就能用

你可以直接这样说

抓取 https://docs.example.com 下的所有文档页面,限定路径为 /docs 且最多爬取 50 页,并将结果保存至 .firecrawl/crawl.json

对 https://blog.example.com 启动全站爬取,限制最大深度为 3 层,并实时输出抓取进度

查询后台正在运行的 Firecrawl 爬取任务 job_abc123 的当前进度与状态

适用人群

适合谁?

大模型应用与RAG开发者知识库构建工程师数据采集与分析人员技术文档维护人员

上手门槛

使用难度

进阶

需要了解任务流程,页面已整理好使用步骤。

兼容范围

支持哪些 AI?

Codex可直接使用
Claude Code可直接使用
OpenClaw可直接使用
Hermes可直接使用
国内 Agent可直接使用

中文用户增强

Skill Px 做了什么?

中文说明简化使用方式补充中文案例整理安装流程降低理解难度