新闻详情

新闻详情

首页 / 资讯中心 / 详情

ScrapeGraphAI(葡萄牙语版指南解析):用 LLM 与有向图构建声明式 AI 爬虫管道

发布时间:2026/9/30 10:55:15来源:尧图网络
ScrapeGraphAI(葡萄牙语版指南解析):用 LLM 与有向图构建声明式 AI 爬虫管道
网页爬虫人工智能AI 应用【免费下载链接】Scrapegraph-aiPython scraper based on AI项目地址https://gitcode.com/GitHub_Trending/sc/Scrapegraph-ai点击查看免费下载ScrapeGraphAI 是一个基于 Python 的开源 Web 爬虫库核心思想是只用自然语言描述你想提取什么库自动完成剩余工作。本指南围绕仓库中的 docs/portuguese.md葡萄牙语版项目文档展开系统讲解其安装方式、SmartScraperGraph等标准管道的用法、多页/脚本/语音等扩展图、多 LLM 适配与隐私遥测配置并深入对应源码实现帮助读者快速上手并理解其内部机制。项目定位与设计哲学ScrapeGraphAI 是一款将LLM大语言模型与有向图逻辑graph logic结合的 Python 爬虫库能够为网站和本地文档XML、HTML、JSON、Markdown 等构建爬取管道。用户只需说明想提取什么信息库就会自动完成抓取、解析与结构化输出。其完整可用管道在 scrapegraphai/graphs/init.py 中统一导出包括SmartScraperGraph、SearchGraph、SpeechGraph、ScriptCreatorGraph及各 Multi 变体。说明本仓库的葡萄牙语版文档与英文版 README 属于同一套宣传与技术说明体系本文以其为主体骨架并以仓库源码为佐证展开。快速安装与运行环境按照 docs/portuguese.md 的说明安装分为两步pip install scrapegraphai # 重要用于抓取网站内容 playwright install其中playwright install用于安装浏览器运行时是抓取真实网页内容的前提。文档同时建议将库安装在虚拟环境中以避免与其他依赖库产生版本冲突。仓库根目录还提供了requirements.txt与requirements-dev.txt后者面向开发与测试并可通过pyproject.toml查看包的元数据与依赖声明。核心用法SmartScraperGraph 单页智能抓取SmartScraperGraph是文档重点演示的管道给定一个用户 prompt 和一个来源 URL即可从单个页面提取结构化信息。其最小可用代码示例如下from scrapegraphai.graphs import SmartScraperGraph # 定义爬取管道配置 graph_config { llm: { model: ollama/llama3.2, model_tokens: 8192, format: json, }, verbose: True, headless: False, } # 创建 SmartScraperGraph 实例 smart_scraper_graph SmartScraperGraph( promptExtract useful information from the web page, including a description of what the company does, founders and social media links, sourcehttps://scrapegraphai.com/, configgraph_config ) # 执行管道 result smart_scraper_graph.run() import json print(json.dumps(result, indent4))执行后输出为 JSON 风格的字典示例结果{ description: ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction., founders: [ { name: , role: Founder Technical Lead, linkedin: https://www.linkedin.com/in/perinim/ }, { name: Marco Vinciguerra, role: Founder Software Engineer, linkedin: https://www.linkedin.com/in/marco-vinciguerra-7ba365242/ }, { name: Lorenzo Padoan, role: Founder Product Engineer, linkedin: https://www.linkedin.com/in/lorenzo-padoan-4521a2154/ } ], social_media_links: { linkedin: https://www.linkedin.com/company/101881123, twitter: https://x.com/scrapegraphai, github: https://github.com/ScrapeGraphAI/Scrapegraph-ai } }文档特别强调切换到 OpenAI 或其他模型时只需更换llm配置块。例如graph_config { llm: { api_key: YOUR_OPENAI_API_KEY, model: openai/gpt-4o-mini, }, verbose: True, headless: False, }配置项逐字段说明从 abstract_graph.py 的__init__与_create_llm实现可以看出graph_config中的关键字段对应如下行为配置字段默认值作用源码依据llm.model无形如provider/model如ollama/llama3.2、openai/gpt-4o-mini不带斜杠时会在helpers/models_tokens.py的 token 表中自动推断 providerllm.model_tokens8192未声明时兜底决定ParseNode的chunk_size即文档内容按 token 切块的尺寸llm.format无指定 LLM 输出格式如json配合结构化输出llm.api_key无云厂商 API 密钥本地 Ollama 无需填写llm.rate_limit无可传入requests_per_second与max_retries底层使用 LangChainInMemoryRateLimiter实现限流verboseFalse控制执行过程日志等级INFO / WARNINGheadlessTrue是否以无头模式运行浏览器loader_kwargs{}透传给文档加载器的附加参数cache_pathFalse请求级缓存路径timeout480单步执行超时秒html_modeFalse为True时跳过ParseNode文本解析直接以原始 HTML 喂给生成节点reasoningFalse为True时插入ReasoningNode做推理再回答reattemptFalse为True时加入ConditionalNode与重试生成节点当答案为NA时空时自动重试additional_info无附加到生成 prompt 的辅助信息storage_state/browser_base/scrape_do无分别接入浏览器登录态、BrowserBase 与 Scrape.do 集成library无ScriptCreatorGraph专用指定生成的爬虫脚本所用库底层的节点图结构SmartScraperGraph._create_graph见 smart_scraper_graph.py将上述配置组合为有向图。默认变体html_modeFalse, reasoningFalse, reattemptFalse包含三条边、四个关键节点FetchNode输入url | local_dir抓取页面并输出docParseNode将doc按chunk_size切块输出parsed_docGenerateAnswerNode结合user_prompt与解析内容生成answer支持传入 Pydanticschema做约束输出。源码中以(html_mode, reasoning, reattempt)三元组定义了 8 种图变体例如开启reasoning后会在解析与回答之间插入ReasoningNode。这种节点 边 入口点的设计统一由BaseGraph执行方便按需组合。更多可运行示例可参考 examples/smart_scraper_graph/openai/smart_scraper_openai.py、examples/smart_scraper_graph/ollama/smart_scraper_ollama.py对应测试用例见 tests/graphs/smart_scraper_openai_test.py 与 tests/graphs/smart_scraper_ollama_test.py。更多标准管道搜索、语音、脚本生成与多页抓取文档指出除SmartScraperGraph外还有多条标准管道分别面向不同场景管道名称描述SmartScraperGraph单页抓取只需用户 prompt 与一个来源输入SearchGraph多页抓取从搜索引擎的前 n 个结果中提取信息SpeechGraph单页抓取提取信息并生成音频文件ScriptCreatorGraph单页抓取提取信息并生成 Python 爬虫脚本SmartScraperMultiGraph多页抓取给定单个 prompt 与来源列表从多个页面提取信息ScriptCreatorMultiGraph多页抓取生成 Python 脚本以从多个页面/来源提取信息文档特别说明每个图都有对应的 multi 版本以便并行发起 LLM 调用。从源码看multi语义由GraphIteratorNodeMergeAnswersNode实现search_graph.py 的SearchGraph先经SearchInternetNode获得 URL 列表再由GraphIteratorNode对每个 URL 实例化SmartScraperGraph逐页抓取最后由MergeAnswersNode合并答案并提供get_considered_urls()返回实际考察的 URL 列表smart_scraper_multi_graph.py 的SmartScraperMultiGraph直接对用户提供的source列表做迭代抓取与合并speech_graph.py 的SpeechGraph在FetchNode → ParseNode → GenerateAnswerNode之后追加TextToSpeechNode默认使用OpenAITextToSpeech将答案转为音频并保存到output_path默认output.mp3script_creator_graph.py 的ScriptCreatorGraph通过GenerateScraperNode结合config[library]生成可复用的 Python 爬虫脚本。这些图的完整清单与导入方式以 scrapegraphai/graphs/init.py 为准。多 LLM 支持云端 API 与本地模型文档指出ScrapeGraphAI 可以通过 API 使用不同 LLM包括OpenAI、Groq、Azure、Gemini也可以使用本地模型Ollama。若使用本地模型需先安装 Ollama并通过ollama pull拉取模型。从 abstract_graph.py 的_create_llm实现看当前仓库已知支持known_providers远不止此openai、azure_openai、google_genai、google_vertexai、ollama、oneapi、nvidia、groq、anthropic、bedrock、mistralai、hugging_face、deepseek、ernie、fireworks、clod、togetherai、xai、minimax。其中部分 provider如clod、deepseek、minimax、xai、oneapi、nvidia在 scrapegraphai/models 中提供定制封装其余走 LangChain 的init_chat_model统一初始化。文档中的葡萄牙语原文还提醒model_tokens若未在配置中声明代码会优先从helpers/models_tokens.py的映射表取值找不到时告警并回退到 8192。API、SDK 与生态集成文档介绍 ScrapeGraphAI 还提供托管 API 与 SDK便于快速集成到业务系统API提供云端智能抓取服务登录 Dashboard 使用另有scrapegraphai/smart-scraper作为内置模型名当llm.model设为该值时smart_scraper_graph.py 会转而调用scrapegraph-pySDK 的云端 SmartScraper 接口需先pip install scrapegraph-py并在config中提供api_keySDK官方提供 Python SDKscrapegraph-py与 Node.js SDKscrapegraph-js生态集成文档提及 LangChain、Llama Index、Crew.ai、Agno、CamelAI 等 LLM 框架以及 Pipedream、Bubble、Zapier、n8n、Dify 等低代码平台另有 MCP 服务器支持。遥测与隐私开关文档说明库会收集匿名的使用指标以改进包质量与兼容性。如需退出可设置环境变量export SCRAPEGRAPHAI_TELEMETRY_ENABLEDfalse对应实现位于 scrapegraphai/telemetry/telemetry.py模块启动时读取配置文件默认~/.scrapegraphai.conf与环境变量SCRAPEGRAPHAI_TELEMETRY_ENABLED来决定是否启用遥测启用后每个会话最多上报 1000 次MAX_COUNT_SESSION错误节点error_node is not None不会上报。详细说明可参考 docs/source/scrapers/telemetry.rst。基准、贡献、引用与许可Benchmark文档引用了 Firecrawl 的基准评测结果作为项目性能说明见仓库 docs/assets/histogram.png并强调该结论为第三方基准数据的转述具体场景请以实际评测为准。贡献欢迎贡献者参与贡献指南见 CONTRIBUTING.md社区沟通与建议通过 Discord 等渠道进行。引用若在研究中使用了本库文档给出了推荐引用格式misc{scrapegraph-ai, author {Lorenzo Padoan, Marco Vinciguerra}, title {Scrapegraph-ai}, year {2024}, url {https://github.com/VinciGit00/Scrapegraph-ai}, note {Uma biblioteca Python para scraping aproveitando grandes modelos de linguagem} }许可项目采用 MIT 许可证见仓库根目录 LICENSE。使用边界文档明确声明该库仅用于数据探索与研究目的不对任何滥用行为负责。官方文档与更多资源Sphinx 构建的完整文档docs/source/目录入口 docs/source/index.rst涵盖 graphs、nodes、helpers、models、integrations 等模块说明多语言版本除葡萄牙语 docs/portuguese.md 外还有 docs/chinese.md、docs/japanese.md、docs/korean.md、docs/russian.md、docs/turkish.md可运行示例examples/目录按图类型smart_scraper_graph、search_graph、speech_graph、script_generator_graph 等并区分 ollama/openai 提供可直接运行的脚本测试用例tests/graphs/与tests/nodes/下包含各图与节点的验证用例是理解各管道输入输出契约的最佳参考。赞分享网页爬虫人工智能AI 应用【免费下载链接】Scrapegraph-aiPython scraper based on AI项目地址https://gitcode.com/GitHub_Trending/sc/Scrapegraph-ai点击查看免费下载相关推荐RTL960x开源光猫固件完全解析从硬件逆向到网络定制的深度指南RTL960x开源光猫固件完全解析从硬件逆向到网络定制的深度指南 在传统光猫设备中用户往往受限于厂商固件的封闭性无法充分发挥硬件性能也难以根据自身网络需文档网络通信固件嵌入式逆向工程Tkinter Designer 入门与使用指南巴西葡萄牙语版文档深度解析Tkinter Designer 入门与使用指南巴西葡萄牙语版文档深度解析 Tkinter Designer 是一个利用 Figma 设计文件自动生成 Py开发工具代码生成低代码GetX 葡萄牙语指南Flutter 状态管理、依赖注入与路由导航全解析GetX 葡萄牙语指南Flutter 状态管理、依赖注入与路由导航全解析 本篇技术指南基于当前仓库中的 README.pt br.md https://lin前端上一篇终极U盘多系统启动神器Ventoy完整使用指南下一篇告别语言障碍Dism-Multi-language无障碍设计指南与WCAG 2.1 AA实践创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

拖拽式H5编辑器部署实战:从Nginx托管到Docker交付 2026/9/30 11:58:20

拖拽式H5编辑器部署实战:从Nginx托管到Docker交付

做前端这行,最不缺的就是“帮我做个H5活动页”这种需求。市场部要一个秒杀页,产品经理要一个抽奖落地页,运营今天改文案明天换Banner,每次改起来比新建还慢。后来我给自己找了个一劳永逸的办法:部署一套拖拽式H5页面制…

阅读更多 →
ChatGPT 提示词工程实战:11 种 AI 指令把大模型变成你的私人学习教练 2026/9/30 11:58:18

ChatGPT 提示词工程实战:11 种 AI 指令把大模型变成你的私人学习教练

简介:这份docx文档收录了11个可直接套用的ChatGPT学习指令,聚焦思维导图、费曼技巧、精细提问、间隔重复、SQ3R法、双编码、类比隐喻、故事叙述、交错学习等主流高效学习法,适合需要借助AI辅助自学新技能、备考或系统攻克某一领域知识的学习者…

阅读更多 →
车辆路径优化实战:从TSP到VRP的Python求解指南 2026/9/30 11:58:18

车辆路径优化实战:从TSP到VRP的Python求解指南

最近在折腾一个配送调度的小项目,白天上班跟业务方对需求,晚上回家写算法,满脑子都是车辆路径优化这几个字。等我真正把一条条路线在图上铺开的时候,才发现车辆路径优化这件事,真的是既奇妙又折磨人。今天想从我的实战…

阅读更多 →
Flutter库鸿蒙化:用lints和CI搭建代码质量拦截网 2026/9/30 11:58:17

Flutter库鸿蒙化:用lints和CI搭建代码质量拦截网

说实话,第一步往往不是写业务代码,而是先想办法把项目控制在不会变得更烂的状态里。我最近把一套 Flutter 三方库往 OpenHarmony 上迁移,这个库本身是纯 Dart 写的,逻辑不复杂,真正头疼的是它的代码风格和结构太“野生…

阅读更多 →
从预测到策略:MCM 2022 C题量化交易建模复盘与实战要点 2026/9/30 11:58:17

从预测到策略:MCM 2022 C题量化交易建模复盘与实战要点

每年MCM的C题都会刷掉一批把"预测"当"策略"的队伍,2022年的Problem C尤其典型。题目名字叫Trading Strategies,很多队伍拿到数据后第一反应是调LSTM去预测明天收盘价,然后拿着预测结果画一条漂亮的净值曲线。等真正提交才…

阅读更多 →
SSH断开后程序退出?Linux进程会话与SIGHUP机制详解 2026/9/30 11:57:50

SSH断开后程序退出?Linux进程会话与SIGHUP机制详解

1. 项目概述:为什么SSH断开后程序会“突然消失”?你有没有遇到过这样的情况:在Linux服务器上用SSH远程执行一个耗时较长的命令,比如python train.py训练模型、tar -czf backup.tar.gz /data打包大目录,或者npm run bui…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉