Tavily
为 AI Agent 与 RAG 提供搜索、提取、站点映射、抓取和研究能力的网页访问 API
FireCrawl 是面向 AI 应用的托管式网页数据 API。它把搜索、单页抓取、URL 发现、整站 Crawl 和字段提取放在同一产品里,但这些入口并不是同一个动作的不同名称。接入前先写清输出目标,往往比直接选择功能最多的端点更重要。
已知页面地址、目标是正文或链接时,先使用 Scrape。官方接口允许请求 Markdown、HTML、链接、截图与 JSON 等输出;需要点击、输入或页面内导航时,再进入 Interact 或动作层。这样能把普通读取失败与真实交互需求分开定位。
| 入口 | 主要任务 | 验收重点 |
|---|---|---|
| Map | 发现站内 URL | 路径覆盖、重复 URL、语言版本 |
| Crawl | 获取多页内容 | 深度、页数、失败页、停止条件 |
| Extract | 生成固定字段 | Schema、缺失值、证据 URL |
导入文档站时,先用 Map 确认范围,再给 Crawl 设置路径、页数与停止条件。若没有范围约束,抓到更多页面并不等于知识库质量更好,还会把归档页、重复语言和参数 URL 一并带入。
Scrape 文档提供缓存控制、持久浏览器 Profile 和数据保留相关选项。含 Cookie、内部 URL 或敏感参数的任务,不应沿用公开文章抓取的默认配置;密钥也只应放在服务端密钥系统。目标站点的条款、robots 与访问授权仍由使用方负责。
如果还在 FireCrawl、Reader、自托管爬虫与云浏览器之间筛选,可参考按任务层级比较网页抓取与数据提取工具,用相同 URL 和验收字段比较可交付结果,而不是比较功能清单长度。
官方核验:https://docs.firecrawl.dev/api-reference/endpoint/scrape(2026-08-13)。