MirrorZ
按项目选择镜像并核对换源条件与回退
ScrapeGraphAI 把自然语言提取与常规网页抓取组合在同一 API 中,适合目标是产品、职位、公司资料或其他固定字段的任务。当前接入应以 v2 文档为准:旧 v1 主机以及 smartscraper、searchscraper、markdownify、smartcrawler 等端点名已被官方标记为弃用。
| 服务 | 输入与结果 | 适合任务 |
|---|---|---|
| Scrape | 单页,多格式输出 | Markdown、HTML、截图或 JSON |
| Extract | URL、HTML 或 Markdown + 提示 | 固定字段提取 |
| Crawl | 异步多页遍历 | 文档站与目录采集 |
| Monitor | 定时任务与变化检测 | 页面监测 |
| History | 按请求 ID 查询结果 | 审计和失败追踪 |
“提取重要信息”无法形成稳定验收。应先规定字段名、类型、是否可为空、证据 URL 和缺失处理,再决定使用 Schema 还是提示。对于稳定 DOM,选择器仍可能更简单;LLM 提取的价值在于字段语义比页面位置更重要时。
多页 Crawl 需要设置路径、深度和最大页数,并轮询任务状态;Monitor 还涉及计划频率、变化阈值和 webhook 验证。API Key 必须保存在服务端,webhook 要校验签名,失败和额度不足也应进入日志。
/api/ 前缀。可先按结构化字段任务比较 ScrapeGraphAI 与其他方案,用相同 Schema、失败样本和证据要求判断是否值得采用模型驱动提取。
官方核验:https://docs.scrapegraphai.com/api-reference/introduction(2026-08-13)。