ScrapeGraphAI

2026-07-07发布 609 0 0

使用自然语言与 Schema 完成网页抓取、结构化提取、站点 Crawl 和变化监测的 v2 API

所在地:
USA
语言:
en
收录时间:
2026-07-07
ScrapeGraphAIScrapeGraphAI

ScrapeGraphAI 把自然语言提取与常规网页抓取组合在同一 API 中,适合目标是产品、职位、公司资料或其他固定字段的任务。当前接入应以 v2 文档为准:旧 v1 主机以及 smartscrapersearchscrapermarkdownifysmartcrawler 等端点名已被官方标记为弃用。

v2 服务按交付物区分

服务 输入与结果 适合任务
Scrape 单页,多格式输出 Markdown、HTML、截图或 JSON
Extract URL、HTML 或 Markdown + 提示 固定字段提取
Crawl 异步多页遍历 文档站与目录采集
Monitor 定时任务与变化检测 页面监测
History 按请求 ID 查询结果 审计和失败追踪

先定义字段,再写自然语言提示

“提取重要信息”无法形成稳定验收。应先规定字段名、类型、是否可为空、证据 URL 和缺失处理,再决定使用 Schema 还是提示。对于稳定 DOM,选择器仍可能更简单;LLM 提取的价值在于字段语义比页面位置更重要时。

Crawl 与 Monitor 是异步运营任务

多页 Crawl 需要设置路径、深度和最大页数,并轮询任务状态;Monitor 还涉及计划频率、变化阈值和 webhook 验证。API Key 必须保存在服务端,webhook 要校验签名,失败和额度不足也应进入日志。

从 v1 迁移时检查这些位置

  • Base URL 与 /api/ 前缀。
  • 旧端点名到 Scrape、Extract、Search、Crawl 的映射。
  • 鉴权头、异步 job ID 与历史结果读取。
  • 原有字段名、错误码和额度监控。

可先按结构化字段任务比较 ScrapeGraphAI 与其他方案,用相同 Schema、失败样本和证据要求判断是否值得采用模型驱动提取。

官方核验:https://docs.scrapegraphai.com/api-reference/introduction(2026-08-13)。

数据统计

相关导航

暂无评论

none
暂无评论...