ScrapingBee
将 JavaScript 渲染和代理路由封装为网页抓取 API,适合不自建浏览器与代理池的开发团队
Hyperbrowser 同时提供轻量 Web API 与云浏览器能力。它的关键不只是“能开浏览器”,而是让团队从单页 Fetch、整站 Crawl、Web Search 逐步升级到需要状态和交互的浏览器任务,不必一开始就把所有请求都当作自动化会话。
| 入口 | 默认目标 | 常见输出 |
|---|---|---|
| Fetch | 一个 URL | Markdown、HTML、链接、截图、JSON |
| Crawl | 同站多页 | 逐页内容、元数据和状态 |
| Search | 发现外部来源 | 清洗后的搜索结果 |
Crawl 是异步任务,可设置最大页数、链接跟随、Sitemap、包含和排除路径。知识库导入应把目录边界、语言版本和重复 URL 写进配置,并保留每页的状态与错误;否则“抓完整站”很容易变成不可维护的数据堆积。
公开页面能直接返回完整正文时,不需要 Profile、代理位置或额外等待。
页面需要 localStorage、sessionStorage、特定地区、等待脚本或登录态时,再使用 Profile、storageState 和导航控制。凭据与 Cookie 应限制权限并设保留期。
Hyperbrowser 的 Web API 更强调从 Fetch/Crawl/Search 到浏览器能力的统一入口;若主要任务是长期运行、调试和观察浏览器会话,则应同时比较专门的浏览器基础设施。两者不能只按“都支持浏览器”归为同一类。
可参考判断任务是否真的需要 Hyperbrowser 的浏览器层,先验证普通读取,再增加状态、代理与交互。
官方核验:https://www.hyperbrowser.ai/docs/web/overview 与 /web/crawl(2026-08-13)。