9 min

如何使用AdsCrawl:完整API教程

了解如何使用AdsCrawl的浏览器自动化API捕获截图、提取HTML/Markdown,并控制远程CDP会话。逐步设置及代码示例。

AAnonymous

如何使用AdsCrawl:完整API教程

AdsCrawl为开发者提供统一的API,用于控制真实的云浏览器,实现截图、数据提取和交互式自动化。无需管理自己的无头Chrome集群,只需发送请求即可获得渲染后的内容或实时DevTools会话。本指南将逐步介绍账户设置、首次API调用、指纹配置以及可靠自动化的实用模式——一切你需要在自有项目中开始使用AdsCrawl的内容。

前提条件

如何使用AdsCrawl:完整API教程 - 前提条件

如何使用AdsCrawl:完整API教程 - 前提条件.

如何使用AdsCrawl:完整API教程 - 前提条件。

在编写任何代码之前,请确保你具备:

  • 一个AdsCrawl账户(提供免费套餐,无需信用卡)
  • 来自仪表板的API密钥
  • 用于发出HTTP请求的工具(cURL、带requests的Python,或带fetch的Node.js)

在官方网站注册,验证电子邮件,然后在API密钥部分获取密钥。每次调用时,你都需要将其作为Bearer令牌传递。

第1步:拍摄第一张截图

如何使用AdsCrawl:完整API教程 - 第1步:拍摄第一张截图

如何使用AdsCrawl:完整API教程 - 第1步:拍摄第一张截图.

如何使用AdsCrawl:完整API教程 - 第1步:拍摄第一张截图。

截图端点在真实浏览器中渲染整个页面并返回图像。这是确认你的设置是否正常工作的最快方式。

端点: POST https://api.adscrawl.net/v1/screenshot

请求头:

  • Authorization: Bearer YOUR_API_KEY
  • Content-Type: application/json

最小cURL示例:

curl -X POST https://api.adscrawl.net/v1/screenshot \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com", "format": "png"}'

JSON响应包含一个screenshot_url字段,其中包含PNG的临时链接。如果你更喜欢直接使用base64编码的图像,请在请求体中添加"encoding": "base64"

Python等效代码:

import requests

api_url = "https://api.adscrawl.net/v1/screenshot"
headers = {"Authorization": "Bearer YOUR_API_KEY"}
payload = {"url": "https://example.com", "format": "png"}

response = requests.post(api_url, json=payload, headers=headers)
print(response.json()["screenshot_url"])

这一单次调用取代了在本地启动Puppeteer、管理Chrome版本或担心内存泄漏的需要。对于运行大规模视觉监控的团队,这种模式简化了基础设施。

第2步:提取HTML和Markdown

如何使用AdsCrawl:完整API教程 - 第2步:提取HTML和Markdown

如何使用AdsCrawl:完整API教程 - 第2步:提取HTML和Markdown.

如何使用AdsCrawl:完整API教程 - 第2步:提取HTML和Markdown。

对于数据管道和AI增强,你通常需要干净的内容而不是截图。/scrape端点返回你选择的格式的页面源代码。

端点: POST https://api.adscrawl.net/v1/scrape

Markdown请求示例:

{
  "url": "https://example.com",
  "output_type": "markdown"
}

响应提供带有解析后Markdown的content字段,以及HTTP状态码。你还可以将output_type设置为"html"以获取完整DOM,或设置为"text"以获取纯文本。

当你将网页数据输入大型语言模型时,这尤其有用。如果你正在构建一个需要阅读和总结页面的AI代理,将此提取与ChatGPT等模型结合可以创建强大的管道。请参阅我们的指南如何将AdsCrawl与ChatGPT结合用于AI驱动的网页数据以获取完整教程。

第3步:通过远程CDP控制实时浏览器

如何使用AdsCrawl:完整API教程 - 第3步:通过远程CDP控制实时浏览器

如何使用AdsCrawl:完整API教程 - 第3步:通过远程CDP控制实时浏览器.

当页面需要交互——登录、点击“加载更多”、滚动——时,你需要的不只是静态快照。AdsCrawl允许你打开远程Chrome DevTools协议(CDP)会话并直接发送命令。

端点: POST https://api.adscrawl.net/v1/browser

这将返回一个WebSocket URL(ws://...)。使用任何兼容CDP的客户端(Puppeteer、Playwright或原始WebSocket库)连接,并像本地浏览器一样控制它。

使用websocket-client的最小Python示例:

import requests
import websocket

api_url = "https://api.adscrawl.net/v1/browser"
headers = {"Authorization": "Bearer YOUR_API_KEY"}
resp = requests.post(api_url, headers=headers, json={"url": "https://example.com"})
ws_url = resp.json()["ws_endpoint"]

ws = websocket.WebSocket()
ws.connect(ws_url)
# 导航到新页面
ws.send('{"id":1,"method":"Page.navigate","params":{"url":"https://example.com"}}')
# 根据需要读取响应

远程CDP会话非常适合复杂流程:登录一次,重用cookie,并提取登录墙后的数据。AdsCrawl管理浏览器生命周期,因此你可以专注于自动化逻辑。

第4步:配置指纹配置文件

现代网站通过指纹识别访问者以检测机器人。AdsCrawl集成了反检测技术,允许你定义真实的浏览器配置文件——用户代理、时区、WebGL供应商、屏幕分辨率等。

在截图或CDP请求中添加fingerprint_profile对象:

{
  "url": "https://example.com",
  "fingerprint_profile": {
    "user_agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/125.0.0.0 Safari/537.36",
    "timezone": "America/New_York",
    "webgl_vendor": "Google Inc. (Intel)"
  }
}

你可以在AdsPower账户中存储预配置的配置文件,并通过ID引用它们。在会话之间轮换指纹可以减少大规模抓取同一站点时的模式检测。要更深入地比较AdsCrawl的反检测与替代方案,请阅读AdsCrawl vs Scrapfly vs Browserless:2026年API对决

第5步:管理并发和速率限制

AdsCrawl支持多个并行浏览器会话。你的计划决定了最大并发数——免费套餐为你提供实验空间,而付费计划为生产工作负载解锁更高的吞吐量。

扩展时:

  • 注意HTTP 429响应并实现指数退避。
  • 重用CDP会话中的cookie以避免重复登录。
  • 使用/health端点在启动大型作业前检查API可用性。

成本按会话分钟和并发计费,而不是按请求计费。这使得预算可预测:在免费套餐上测量你的使用情况,然后根据计划限制预测成本。有关完整细分,请参阅AdsCrawl定价指南

常见工作流和最佳实践

视觉回归监控

安排关键页面的截图请求,随时间比较图像,并在意外变化时发出警报。由于AdsCrawl使用真实浏览器,你可以捕获仅无头工具会遗漏的渲染问题。

SEO审计管道

从竞争对手页面提取HTML或Markdown,分析标题结构,并跟踪元标签变化。与调度器配对,构建定期审计系统,而无需维护浏览器服务器。

AI数据收集

将干净的Markdown输入LLM进行摘要、分类或问答。真实浏览器渲染和结构化输出的结合使AdsCrawl成为AI应用的可靠数据源。

错误处理模板

import time
import requests

def robust_scrape(url, headers, max_retries=3):
    for attempt in range(max_retries):
        resp = requests.post(
            "https://api.adscrawl.net/v1/scrape",
            json={"url": url, "output_type": "markdown"},
            headers=headers
        )
        if resp.status_code == 200:
            return resp.json()
        elif resp.status_code == 429:
            time.sleep(2 ** attempt)
        else:
            raise Exception(f"Request failed: {resp.status_code}")
    raise Exception("Max retries exceeded")

相关阅读

来源和进一步阅读

常见问题解答

什么是AdsCrawl?

AdsCrawl是一个浏览器自动化和数据提取API,运行真实的云浏览器会话。它捕获截图、提取结构化内容(HTML、Markdown、文本),并提供完整的远程CDP控制,全部集成反检测指纹技术。

有免费套餐吗?

有。免费套餐包括每月有限数量的会话——无需信用卡。它专为测试、概念验证和小型项目设计。

AdsCrawl能处理需要登录的网站吗?

当然。启动远程CDP会话,导航到登录页面,填写凭据,并在需要时解决CAPTCHA。认证后,重用会话cookie进行后续请求。

支持哪些指纹配置?

你可以自定义用户代理、时区、WebGL参数、屏幕分辨率、语言以及许多其他浏览器属性。AdsPower的预构建配置文件可以直接在API调用中引用。

失败的会话需要付费吗?

通常,只有活动会话时间计费。异常终止的会话不会全额收费。请查看官方文档了解最新政策。

结论

AdsCrawl将浏览器自动化转变为简单的API调用。你学习了如何捕获截图、提取干净内容、启动交互式CDP会话,以及配置指纹以保持自动化不被检测。无论你是构建价格追踪器、SEO审计工具还是AI数据管道,该平台处理浏览器基础设施,以便你可以专注于应用程序逻辑。

要与其他工具进行正面比较,请参阅AdsCrawl vs Browserless:2026年哪个浏览器API胜出?。如果你正在评估无代码替代方案,我们的axiom.ai评测涵盖了浏览器自动化的不同方法。

从免费套餐开始,运行你的第一张截图,并在准备好时扩展。