新闻详情

新闻详情

首页 / 资讯中心 / 详情

Crawlee 爬虫入门指南:快速搭建专业级网页抓取项目

发布时间:2026/9/5 17:20:50来源:尧图网络
Crawlee 爬虫入门指南:快速搭建专业级网页抓取项目
Crawlee 爬虫入门指南快速搭建专业级网页抓取项目【免费下载链接】crawleeCrawlee—A web scraping and browser automation library for Node.js to build reliable crawlers. In JavaScript and TypeScript. Extract data for AI, LLMs, RAG, or GPTs. Download HTML, PDF, JPG, PNG, and other files from websites. Works with Puppeteer, Playwright, Cheerio, JSDOM, and raw HTTP. Both headful and headless mode. With proxy rotation.项目地址: https://gitcode.com/GitHub_Trending/cr/crawlee要把网页上的数据变成自己的 JSON 文件Node.js 里最顺手的工具是 Crawlee——它把 HTTP 抓取、Cheerio/Playwright/Puppeteer 解析、无头浏览器自动化装进同一个库里一套 API 走到底。这是一篇重写过的 Crawlee 入门教程专治「装完不知道下一步」用 CLI 命令一条线完成项目生成与启动3 种爬虫类型的选型标准附对比表直接对号入座一个字段提取实战数据直接落到本地数据集文件。两步跑起来先确认环境Crawlee 要求 Node.js 16 以上用下面这条命令看一眼版本node -v然后让 Crawlee CLI 帮你把项目脚手架和依赖一次装齐交互式选模板即可npx crawlee create my-crawler cd my-crawler npm start先问页面一个问题要不要跑 JS选型判断逻辑很简单页面是服务器端渲染好的静态 HTML就用最轻的 HTTP 方案页面靠 JavaScript 动态渲染就上无头浏览器如果你长期深耕 Chrome 生态、需要最成熟的 Chromium 自动化 APIPuppeteer 更稳。CheerioCrawler纯 HTTP 请求 Cheerio 解析速度最快但 JS 渲染的页面拿不到。PlaywrightCrawler可驱动 Chromium、Firefox、WebKit是功能最全面的多浏览器自动化方案。PuppeteerCrawler专注 Chrome/ChromiumAPI 稳定生态集成成熟。维度CheerioCrawlerPlaywrightCrawlerPuppeteerCrawlerJS 渲染支持不支持支持支持运行速度最快快快可驱动浏览器无HTTPChromium / Chrome / Firefox / WebKitChrome / Chromium典型场景静态页、API 型站点动态页、跨浏览器验证Chrome 深度集成实战抓列表页三个字段落盘目标访问首页提取标题、meta description、链接数三个字段存入数据集而不是只抓一个标题。import { CheerioCrawler, Dataset } from crawlee; const crawler new CheerioCrawler({ async requestHandler({ $, log }) { // 一次性取走三个字段 const data { title: $(title).text(), metaDesc: $(meta[namedescription]).attr(content) ?? , linkCount: $(a).length, }; await Dataset.pushData(data); // 落盘到本地数据集 log.info(已保存${data.title}链接 ${data.linkCount} 条); }, }); await crawler.run([https://crawlee.dev]);预期终端输出每次运行结果会略有不同INFO CheerioCrawler: Starting the crawl 已保存Crawlee · The scalable web crawling, scraping and automation library for JavaScript/Node.js | Crawlee链接 120 条 INFO CheerleeCrawler: Crawling finished. Final request statistics: Requests processed: 1跑完后到./storage/datasets/default/找生成的 JSON 文件即可每条 pushData 对应一个文件。生产环境四个关键点递归发现链接在 handler 里调await enqueueLinks()页面新链接自动进队列配合transformRequestFunction可过滤域名或路径。导出 CSV/JSON数据集支持一键导出文件名由你指定import { Dataset } from crawlee; await Dataset.exportToCSV(my-data); // 导出 CSV await Dataset.exportToJSON(my-data); // 导出 JSON重试与反屏蔽maxRequestRetries默认 3 次控制失败重试配合maxConcurrency限并发、proxyConfiguration轮换代理、sessionPoolOptions复用会话比单纯加延迟更稳。Headful 调试加两个构造参数即可看见浏览器实际操作slowMo还能放慢节奏new PlaywrightCrawler({ headless: false, // 显示浏览器窗口 slowMo: 500, // 每步间隔 500ms便于观察 });部署三选一Docker官方镜像预装好浏览器与依赖本地与服务器行为一致。云部署任意 Node.js 云服务AWS、GCP 等直接部署用CRAWLEE_STORAGE_DIR环境变量指向持久化存储目录。Apify 平台托管运行平台自动处理存储与代理。详见docs/guides/docker_images、docs/deployment。收个尾用npx crawlee create生成项目并npm start按「静态页 → Cheerio动态页 → Playwright/Puppeteer」选爬虫在requestHandler里提取字段并Dataset.pushData落盘生产上启用maxRequestRetries、代理与会话池继续深入可以读快速上手示例docs/quick-start结果存储详解docs/guides/result-storage反屏蔽指南docs/guides/avoid_blocking现在就可以打开终端输入第一条命令十分钟之后你会看到自己的第一份 JSON 数据集。【免费下载链接】crawleeCrawlee—A web scraping and browser automation library for Node.js to build reliable crawlers. In JavaScript and TypeScript. Extract data for AI, LLMs, RAG, or GPTs. Download HTML, PDF, JPG, PNG, and other files from websites. Works with Puppeteer, Playwright, Cheerio, JSDOM, and raw HTTP. Both headful and headless mode. With proxy rotation.项目地址: https://gitcode.com/GitHub_Trending/cr/crawlee创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Python数字滤波器实战:参数设计、scipy实现与边界效应排查 2026/9/5 17:53:55

Python数字滤波器实战:参数设计、scipy实现与边界效应排查

滤波器这个词,看起来很正经,做起来却很考验心态。数字滤波器用来处理一维时间序列,把不需要的频率成分压掉、保留有用的部分,听起来只是“几句话的事”。可真当自己拿到一段脏数据,调完一个低通滤波之后发现输出还是乱…

阅读更多 →
Codex 技能目录 skills4/skills 快速上手指南:3 步管好技能安装与状态 2026/9/5 17:53:55

Codex 技能目录 skills4/skills 快速上手指南:3 步管好技能安装与状态

Codex 技能目录 skills4/skills 快速上手指南:3 步管好技能安装与状态 【免费下载链接】skills Skills Catalog for Codex 项目地址: https://gitcode.com/GitHub_Trending/skills4/skills 管 Codex 技能最容易掉进"散装管理"的坑:装没…

阅读更多 →
数字滤波器设计实战:从频域分析到Python实现 2026/9/5 17:53:55

数字滤波器设计实战:从频域分析到Python实现

做信号处理的同学可能都有过这样的经历:采回来一组传感器数据,时域波形抖动得像一团乱麻,下意识的想法是赶紧滤波。可真到动手的时候,滤波器类型、截止频率、阶数、通带纹波这些参数铺开在眼前,又不知道该从哪一个下手…

阅读更多 →
3分钟装好霞鹜文楷:Windows、macOS、Linux 字体安装全攻略 2026/9/5 17:53:55

3分钟装好霞鹜文楷:Windows、macOS、Linux 字体安装全攻略

3分钟装好霞鹜文楷:Windows、macOS、Linux 字体安装全攻略 【免费下载链接】LxgwWenKai An open-source Chinese font derived from Fontworks Klee One. 一款开源中文字体,基于 FONTWORKS 出品字体 Klee One 衍生。 项目地址: https://gitcode.com/G…

阅读更多 →
awesome-design-systems 完整指南:设计系统资源库一站配齐 2026/9/5 17:53:55

awesome-design-systems 完整指南:设计系统资源库一站配齐

awesome-design-systems 完整指南:设计系统资源库一站配齐 【免费下载链接】awesome-design-systems 💅🏻 ⚒ A collection of awesome design systems 项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-design-systems awe…

阅读更多 →
无需摇杆!Arduino+MPU6050自制体感遥控器全攻略 2026/9/5 17:50:55

无需摇杆!Arduino+MPU6050自制体感遥控器全攻略

如果手里只有一块 Arduino Uno R3 和一块 MPU6050,有没有可能不买摇杆模块,直接做一个体感遥控器?答案是能。这类项目在智能小车、机械臂、飞行器地面站里用得很多,本质是把“板子倾斜多少度”换算成“摇杆应该输出什么值”。这篇…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞