网页正文与数据抓取
该功能基于 Firecrawl CLI 提供的网页抓取能力,支持读取指定网页 URL 或调用数据服务契约。它可以自动等待 JavaScript 动态渲染、剔除导航栏和页脚等杂质仅提取主体正文、抽取页面链接,并支持对 PDF 文档进行页数预算控制与内容解析。此外,它还支持并发抓取多个 URL,将网页转录为便于大模型或下游程序读取的干净 Markdown 或 JSON 格式。
它会先理解你的原始内容和目标,再按清晰的步骤完成处理。你不需要学习复杂命令,也不用理解背后的技术细节。
常见场景
它能帮你做什么?
三步完成
怎么使用
把右侧安装请求发给你的 AI。
告诉 AI 你想完成什么,或直接贴入内容。
按需要继续调整语气、范围或格式。
复制就能用
你可以直接这样说
“使用 firecrawl scrape 抓取 https://docs.python.org/3/tutorial/ 并仅保留主要正文保存为 markdown 文件”
“抓取某动态渲染的报价页面,设置等待前端渲染 3000 毫秒后提取全部内容和外链为 JSON”
“抓取一份线上白皮书 PDF,设置 --max-pages 限制最多解析前 5 页以控制额度消耗”
适用人群
适合谁?
上手门槛
使用难度
需要了解任务流程,页面已整理好使用步骤。
兼容范围
支持哪些 AI?
中文用户增强