Scrapfly API 设置:网页抓取、云浏览器与截图
了解如何设置 Scrapfly 的网页抓取、云浏览器和截图 API。逐步配置、代码示例,以及与 AdsCrawl 真实浏览器基础设施的对比。
Scrapfly API 设置:网页抓取、云浏览器与截图
Scrapfly 将自己定位为一个统一的网页数据平台,将反机器人绕过、隐身浏览器会话、住宅代理和结构化提取整合在一个 API 密钥后面。对于开发者和 AI 团队来说,其承诺很简单:调用一个端点,即可获得干净的 HTML、渲染后的 JavaScript 或整页截图,而无需管理无头浏览器集群或轮换代理列表。本指南将逐步介绍 Scrapfly 三大核心产品——网页抓取 API、云浏览器和截图 API——的实际设置,然后探讨像 AdsCrawl 这样的平台如何以不同的架构理念应对同样的挑战。
了解 Scrapfly 的产品架构

Scrapfly API 设置:网页抓取、云浏览器与截图 - 了解 Scrapfly 的产品架构.
Scrapfly API 设置:网页抓取、云浏览器与截图 - 了解 Scrapfly 的产品架构。
Scrapfly 将其功能组织为五个不同的 API 端点,它们共享相同的信用池和认证模型。其中最常用的三个是:
- 网页抓取 API(
POST api.scrapfly.io/scrape):获取 URL,支持可配置的反机器人绕过、代理轮换和可选的 JavaScript 渲染。返回 HTML、Markdown 或结构化 JSON。 - 云浏览器(
wss://browser.scrapfly.io/cdp):通过 Chrome DevTools 协议(CDP)暴露一个隐身 Chromium 实例,兼容 Playwright 和 Puppeteer。浏览器是托管的、可扩展的,并带有指纹以避免检测。 - 截图 API(
POST api.scrapfly.io/screenshot):以 PNG、JPEG 或 WebP 格式捕获整页、视口或元素级别的截图。支持广告拦截、cookie 横幅关闭和自定义视口尺寸。
这三个产品共享一个基于信用的计费模型,其中因反机器人阻止而失败的请求不收费。该平台还提供提取 API、爬虫 API、AI 浏览器代理,以及用于连接 Claude、Cursor 和其他 AI 工具的 MCP 服务器。
初始设置:API 密钥和认证

Scrapfly API 设置:网页抓取、云浏览器与截图 - 初始设置:API 密钥和认证.
Scrapfly API 设置:网页抓取、云浏览器与截图 - 初始设置:API 密钥和认证。
每个 Scrapfly 请求都通过 API 密钥进行认证,该密钥可以作为查询参数或 HTTP 头传递。注册后,您将获得 1,000 个免费信用点,没有时间限制,也不需要信用卡。
第 1 步:获取您的密钥 在 scrapfly.io 注册,并从仪表板复制密钥。该密钥可立即用于所有产品。
第 2 步:选择您的认证方法 对于基于 GET 的端点(如截图 API),将密钥作为查询参数传递:
https://api.scrapfly.io/screenshot?url=https://example.com&key=YOUR_KEY
对于基于 POST 的端点(如网页抓取 API),将其包含在 JSON 主体中或作为 x-api-key 头:
curl -X POST https://api.scrapfly.io/scrape \
-H "Content-Type: application/json" \
-d '{"key": "YOUR_KEY", "url": "https://example.com"}'
第 3 步:验证连接
运行一个最小的抓取请求。成功的响应返回一个 JSON 信封,其中包含 success: true、页面内容、状态代码和元数据头(如 X-Scrapfly-Api-Cost),指示信用消耗。
配置网页抓取 API

Scrapfly API 设置:网页抓取、云浏览器与截图 - 配置网页抓取 API.
Scrapfly API 设置:网页抓取、云浏览器与截图 - 配置网页抓取 API。
网页抓取 API 是数据提取的主力。一个基本调用会获取 URL 并返回原始 HTML,但其真正价值在于其渲染和解锁参数。
启用 JavaScript 渲染
许多现代网站动态加载内容。设置 render_js: true 以在返回 HTML 之前执行 JavaScript:
import requests
response = requests.post(
"https://api.scrapfly.io/scrape",
json={
"key": "YOUR_KEY",
"url": "https://dynamic-site.com",
"render_js": True
}
)
data = response.json()
print(data["result"]["content"])
反机器人绕过和代理选择
Scrapfly 的反机器人引擎通过一个参数激活。添加 "asp": True 以通过隐身堆栈路由。将其与代理选择结合以实现地理定位:
{
"key": "YOUR_KEY",
"url": "https://protected-site.com",
"asp": True,
"proxy_pool": "public_residential_pool",
"country": "us"
}
结构化提取
无需手动解析 HTML,而是使用提取 API 和 JSON 模式或自然语言提示。这将返回产品、文章、评论或自定义实体的类型化数据:
response = requests.post(
"https://api.scrapfly.io/extraction",
json={
"key": "YOUR_KEY",
"url": "https://ecommerce-site.com/product/1",
"extraction_prompt": "提取产品名称、价格和描述。"
}
)
设置云浏览器
Scrapfly API 设置:网页抓取、云浏览器与截图 - 设置云浏览器。
对于需要完整浏览器交互的工作流程——点击、表单填写或会话持久化——Scrapfly 的云浏览器提供了一个可通过 CDP 访问的远程 Chromium 实例。
使用 Playwright 连接
安装 Playwright 并将其指向云浏览器的 WebSocket 端点:
pip install playwright
playwright install
from playwright.sync_api import sync_playwright
with sync_playwright() as p:
browser = p.chromium.connect_over_cdp(
"wss://browser.scrapfly.io/cdp?key=YOUR_KEY"
)
page = browser.new_page()
page.goto("https://example.com")
page.click("button#load-more")
content = page.content()
browser.close()
云浏览器在后台处理指纹随机化、头部对齐和代理出口。团队将其用于复杂的登录流程、单页应用爬取以及需要确定性控制的 AI 代理循环。
会话持久化
通过存储和引用会话 ID,在多个请求之间重用浏览器上下文。这可以保持 cookie、本地存储和认证状态,而无需重新登录。
截图 API 配置
截图 API 设计为简单易用,接受带有 URL 编码参数的 GET 请求。它非常适合监控仪表板、视觉回归测试以及捕获渲染状态以供审计。
基本整页捕获
https://api.scrapfly.io/screenshot?url=https://example.com&key=YOUR_KEY&format=png&full_page=true
高级选项
添加参数以控制输出和页面行为:
viewport_width和viewport_height:设置浏览器窗口大小。auto_scroll:滚动到底部以触发懒加载图像。block_banners:关闭 cookie 同意弹窗和广告。js:在捕获前执行自定义 JavaScript。format:选择png、jpg、webp或gif。
包含多个选项的示例:
https://api.scrapfly.io/screenshot?url=https://example.com&key=YOUR_KEY&format=webp&full_page=true&auto_scroll=true&block_banners=true
检索截图
响应主体是图像二进制。或者,X-Scrapfly-Screenshot-Url 头提供了一个托管 URL,供以后检索,适用于异步工作流程。
监控和可观测性
Scrapfly 包括一个 Web 仪表板,跟踪每个项目的成功率、延迟和信用消耗。每个响应都带有 X-Scrapfly-Api-Cost 和 X-Scrapfly-Remaining-Api-Credit 等头,支持在生产管道中进行实时预算监控。该平台还提供实时遥测视图和用于正常运行时间跟踪的状态页面。
AdsCrawl 在浏览器 API 领域中的定位
虽然 Scrapfly 将抓取、浏览器和截图功能捆绑到一个信用系统中,但 AdsCrawl 采取了不同的方法:它被构建为面向 AI 时代的浏览器基础设施。AdsCrawl 没有将浏览器抽象为简化的抓取端点,而是暴露了具有完整 CDP 控制、指纹配置文件和并发执行的真实浏览器会话——专为需要将可重复的网页操作包装成可靠 API 的团队而设计。
真实浏览器会话与托管端点
Scrapfly 的云浏览器提供 CDP 访问,但其主要价值主张是托管抓取管道——反机器人绕过、代理轮换和提取模板。AdsCrawl 专注于为开发者提供原始的浏览器能力:您直接控制 Chrome DevTools 协议,定义自定义指纹配置文件,并在不管理基础设施的情况下运行并发会话。这使其特别适合需要实时导航、点击和提取的 AI 代理,而不是提交单个 URL 并等待结果。
有关云浏览器平台的更深入比较,请参阅 AdsCrawl vs Browserless:2026 年哪个浏览器 API 胜出?。
信用模型和定价理念
Scrapfly 使用信用系统,请求成本随复杂性扩展——简单 HTTP 抓取 1 个信用点,JavaScript 渲染 5 个信用点,住宅代理 25 个信用点,整页截图 60 个信用点。AdsCrawl 也采用基于信用的免费增值模式,但将消耗与浏览器会话持续时间和并发性挂钩,而不是按请求功能。两个平台都提供免费层级:Scrapfly 提供 1,000 个永久信用点,而 AdsCrawl 包括一个用于原型设计的免费层级。
何时选择每个平台
- 选择 Scrapfly 如果您的核心工作流程是高容量 URL 获取,并带有托管反机器人绕过,并且您希望在一个 API 密钥下使用提取模板和截图捕获。在受保护网站上的 98% 成功率和零成本失败使其成为抓取密集型团队的强大选择。
- 选择 AdsCrawl 如果您需要持久浏览器会话、自定义 CDP 命令、指纹管理以及专为 AI 代理和自动化工作流程设计的基础设施。该平台的真实浏览器能力支持超越单请求抓取的复杂交互序列。
要更广泛地了解这些工具与 Playwright 和 Selenium 等框架的比较,请阅读 AdsCrawl vs ScrapingBee vs Playwright:哪个工具胜出? 和 AdsCrawl vs Selenium:2026 年云 API 与框架。
实际集成:结合 Scrapfly 和 AdsCrawl
在生产管道中,团队通常在不同阶段使用两个平台。Scrapfly 处理批量数据提取和截图监控,而 AdsCrawl 管理需要状态导航的交互式浏览器会话。例如:
- 使用 Scrapfly 的网页抓取 API 从列表页面收集产品 URL。
- 将这些 URL 传递给 AdsCrawl 浏览器会话,该会话登录零售商门户,将商品添加到购物车,并捕获结账流程。
- 使用 Scrapfly 的截图 API 每天拍摄竞争对手着陆页的视觉快照,用于监控仪表板。
这种关注点分离——托管抓取与交互式浏览器自动化——让每个工具在其优势领域运作。
相关阅读
- axiom.ai 评测:真正有效的无代码浏览器自动化? - 深入的 axiom.ai 评测:测试其无代码、代码和 AI 机器人构建器,云与本地运行,定价信号,以及真实用例。看看它是否适合您的工作流程。
来源和进一步阅读
- Scrapfly - 网页抓取 API、云浏览器、截图 API - 使用 Scrapfly 的网页数据平台为网页爬虫和 AI 代理提供支持。一个 API 密钥即可实现反机器人绕过、通过 CDP 的隐身 Chromium、住宅代理、截图和结构化提取。
- Scrapfly 截图 API | API 规范 - Scrapfly API - API 规范 - 使用 Scrapfly API 截取任何网页截图所需的一切。可用选项、提示和错误。
- Scrapfly 定价 - 网页抓取 API、云浏览器、截图。一个密钥,所有产品。 - 基于使用量的定价,适用于 Scrapfly 的每个产品。注册时获得 1,000 个免费 API 信用点,无需信用卡。使用同一个 API 密钥,从原型扩展到每月 150 亿+ 请求。
常见问题解答
Scrapfly 的网页抓取 API 和云浏览器有什么区别?
网页抓取 API 是一个托管的 HTTP 端点,用于获取 URL,可选地渲染 JavaScript,并返回内容。云浏览器是一个完整的远程 Chromium 实例,您可以通过 CDP 控制,适用于多步骤交互和持久会话。
Scrapfly 是否对失败的请求收费?
不。由于反机器人阻止或上游错误(4xx/5xx)导致的失败请求不收费。只有成功的抓取才消耗信用点。
我可以将 Scrapfly 与 Playwright 或 Puppeteer 一起使用吗?
可以。云浏览器端点(wss://browser.scrapfly.io/cdp)接受来自 Playwright、Puppeteer 以及任何 CDP 兼容客户端的标准 CDP 连接。
AdsCrawl 与 Scrapfly 相比,在 AI 代理工作流程方面如何?
AdsCrawl 专为 AI 代理构建,提供真实浏览器会话、指纹配置文件和并发执行,并具有完整的 CDP 控制。Scrapfly 的 AI 浏览器代理针对类似用例,但将其打包在托管抓取平台中。选择取决于您是需要基础设施优先的浏览器控制(AdsCrawl)还是统一的抓取到代理管道(Scrapfly)。
Scrapfly 支持哪些截图格式?
PNG、JPEG、WebP 和 GIF。您可以使用 CSS 选择器捕获整页、仅视口或特定元素。
结论
Scrapfly 提供了一个成熟的、信用统一的平台,将反机器人复杂性、代理管理和浏览器渲染抽象在干净的 API 端点后面。其设置是最小的:注册、复制密钥,然后选择与您的任务匹配的端点。对于主要需求是可靠的大规模数据提取的团队,网页抓取 API 和截图 API 提供了快速的价值实现时间。对于那些需要更深入浏览器控制的团队,云浏览器在同一生态系统中提供 CDP 访问。
然而,当工作流程需要持久浏览器会话、自定义指纹配置文件以及专为 AI 代理构建的基础设施时,AdsCrawl 提供了一个引人注目的替代方案。它不是将浏览器访问层叠在抓取平台之上,而是以浏览器作为核心原语——为开发者提供下一代网页自动化所需的控制力和并发性。理解这两种方法可以让您将工具与任务匹配,无论是为一百万页面调用一个 API,还是一个像代理一样思考和行动的有状态浏览器会话。
