跳至正文

Crawl API

一次调用即可遍历整个网站,读取起始 URL 下的每个页面,并以可直接用于 LLM 的 Markdown 而非原始 HTML 返回。抓取按广度优先跟踪链接,停留在你的站点和路径之下,并使用 Unlocker 引擎获取每个页面,因此受保护的网站也不在话下。

  • 一次调用,数百个页面:在起始 URL 下按广度优先抓取,仅限同站
  • max_pages、max_depth 和 RE2 路径过滤在开始前划定范围
  • 每个页面均可输出 Markdown 或 JSON,干净到可直接向量化
  • 异步:返回 202 和 job_id,随后轮询状态并分页读取结果
  • 自动去重:无论有多少链接指向同一页面,都只保留一条
  • Basic 每页 1 个积分,js_rendering 为 5 个;失败页面退还积分
每页低至 1 个积分。失败页面退还积分。无需银行卡即可开始。
支持 MCP一条命令即可连接你的智能体:npx -y @datafuel/mcp initClaudeOpenAI / ChatGPTGeminiCursorMistral

一个任务搞定一切

该接口的六大能力,一目了然。
多页面遍历一个起始 URL;按广度优先跟踪链接,读取其下的每个页面。
深度与规则控制max_depth、max_pages 以及 RE2 包含/排除路径,在开始前就划定范围。
Markdown 或 JSON 输出result_format 可返回便于向量化的干净 Markdown,或逐页的结构化 JSON。
异步任务立即返回 202 和 job_id;轮询 GET /crawl/{job_id},结果一到即可分页读取。
自动去重无论有多少链接指向同一页面,都只保留一条。仅限同站 URL。
安全上限页面数绝不超过 max_pages,绝不越出站点,失败页面退还积分。
01 · 语料库

从一个 URL 到完整语料库

给 Crawl 一个起始 URL,它会按广度优先遍历其下所有页面,并将每个页面以干净的 Markdown 返回。一次调用,一个数据集:无需维护链接列表,也无需编排逐页请求。

演示数据。页面数量仅作示意;真实抓取会在你设定的上限内跟踪网站链接。

Datafuel / CrawlEstimatingBounded
max_depth53
max_pages1,000200
include_paths["/docs/*"]
pages reachabledepth 11depth 224depth 3310depth 41,900depth 56,400
Maximum this job can cost1,000 credits200 credits
02 · 控制

杜绝意外的控制项

max_depth 和 max_pages 在抓取开始前划定边界,包含/排除规则可进一步缩小范围。任务入队的页面绝不会超出你的许可,因此成本有上限、可预测,而不是一张无底账单。

演示数据。估算基于 Basic 价格,每页 1 个积分;js_rendering 页面为 5 个。

Datafuel / CrawlConvertingEmbedded
rate-limits.html · 214 KB
<div class="hero"><nav>…</nav><h1>Rate limits</h1><script src="…"><p>Each key allows…<footer>…</footer>
rate-limits.md · 6 KB
# Rate limitsEach key allows **600 req/min**.## Headers- X-RateLimit-Remaining- Retry-After
vector store · 3 chunks
chunk_01 · 512 tok
chunk_02 · 498 tok
chunk_03 · 301 tok
The Markdown is what you embed. No cleanup step in between.
03 · RAG 就绪

为 RAG 和 AI 流水线而生

每个页面都以结构化 Markdown 返回:保留标题、列表和表格,去除导航、脚本和模板内容。无需后处理:直接分块、向量化、检索。

演示数据。分块和向量化在你的流水线中完成;API 返回 Markdown。

Datafuel / CrawlJob runningCompleted
POST/api/v1/crawl"max_pages": 500you
202 Accepted"job_id": "d3f8ae31-…"< 1 s
pendingprocessing · fetching pagescompleted0 / 500 pages236 / 500 pages500 / 500 pages
GET /crawl/{job_id} whenever you want: no open connection, nothing blocked.
GET/crawl/{job_id}/results"next_cursor": "MTc4…"pollingpage 1 · 100 pages
500 pages · one job · stop_reason max_pagestotal_cost 500
04 · 异步

规模化的异步处理

抓取是一个任务,而不是一次请求:你会立即得到 202 和 job_id,抓取在我们这边运行。你的代码无需阻塞:轮询 GET /crawl/{job_id} 查看进度,页面仍在到达时即可分页读取结果。

演示数据。job_id、耗时和页面数量仅作示意。

价格

只为成功请求付费

选择月度套餐、一次性购买积分,或使用不限线程套餐。失败的请求永不计费。

每个套餐都包含所有端点和所有接口(API、MCP)。共用一个积分余额:你只为用量付费,而且只为成功的请求付费。

每月需要多少次请求?每月 1,000,000 已抓取页面
≈ 1,000,000 积分 · Growth
1K300K1M3.5M12M定制
Free

用真实积分测试每个端点。无需信用卡。

$0一次性试用
1,000 积分,一次性发放1,000 已抓取页面2 并发线程
  • 试用积分有效期 1 年
  • 所有端点,API + MCP
  • 社区支持
Growth最适合

适合需要充裕容量的生产级爬虫和智能体。

原价 $79,现价 $55.30 $79/ 月,按月计费
1,000,000 积分 / 月1,000,000 已抓取页面25 并发线程$0.055$0.079 每 1K 页面$0.277$0.395 每 1K(含 JS)
  • 包含 Starter 的全部功能
  • 自动充值
  • 优先聊天支持
Business

适合按计划交付数据产品的团队。

原价 $199,现价 $139.30 $199/ 月,按月计费
3,500,000 积分 / 月3,500,000 已抓取页面50 并发线程$0.040$0.057 每 1K 页面$0.199$0.284 每 1K(含 JS)
  • 包含 Growth 的全部功能
  • 按 API 密钥设置用量提醒
  • 客户经理
Scale

大用量,最低单页价格。即时开通。

原价 $499,现价 $349.30 $499/ 月,按月计费
12,000,000 积分 / 月12,000,000 已抓取页面150 并发线程$0.029$0.042 每 1K 页面$0.146$0.208 每 1K(含 JS)
  • 包含 Business 的全部功能
  • 专属 IP 池
  • 99.9% SLA
Enterprise

承诺用量、发票开具和治理管控。

定制
定制 积分 / 月250+ 并发线程
  • 定制用量定价
  • 定制并发数(250+)
  • SSO · 审计日志 · 数据处理协议
对比
FreeStarterGrowthBusinessScaleEnterprise
每月积分1K 一次性300K1M3.5M12M定制
并发线程2102550150250+
API 密钥131025无限制无限制
JS 渲染
住宅代理
AI 实时提取(使用你的密钥)
地理定位 · 195+ 个国家
批量多 URL
Unlocker · Crawl · Map · LLM Scraper
自动充值——
支持社区邮件优先聊天客户经理Slack + 电话专属支持 + SLA
一次请求实际花费多少?1 积分 = 1 个基础页面 · 费用不叠加:JS + 住宅代理为 20 积分,而不是 5 + 10
1×基础 HTTP简单 HTML,数据中心代理
5×JS 渲染用于动态网站的无头浏览器
10×住宅代理真实住宅 IP
20×JS + 住宅代理全力应对受保护网站
免费AI In-Flight任意 Unlocker 请求均可使用 LLM 提取(使用你自己的 AI 密钥),不额外消耗积分
FAQ

常见问题

范围、结果与计费,直截了当地回答。

Crawl API范围、深度与结果。
Crawl 如何决定访问哪些页面?
它从你的 URL 出发,按广度优先跟踪链接,只停留在同一站点和起始路径之下。max_pages 是入队页面数的硬性上限,max_depth 限制距起始页的链接层数,include_paths / exclude_paths(RE2)可进一步缩小范围;exclude 始终优先。
Crawl 是单次调用还是一个任务?
以任务形式运行。POST /api/v1/crawl 会立即返回 202 和 job_id。轮询 GET /crawl/{job_id} 查看状态和页面数,完成后通过 next_cursor 分页读取 GET /crawl/{job_id}/results。
每个页面会返回什么?
默认以 Markdown 返回页面(可通过 result_format 设置其他格式),并附带其 URL 和深度。每个页面都使用完整的 Unlocker 选项抓取,因此受保护或大量依赖 JavaScript 的网站也不在话下。
什么时候应该改用 Map?
当你只需要 URL 时。Map 一次调用即可从站点地图和页面链接中返回同一站点的所有 URL,Basic 只需 1 积分(Premium 为 10 积分),这是评估网站规模或精确挑选要抓取页面最便宜的方式。
计费积分、失败与上限。
Crawl 如何计费?
按每个入队页面计费:Basic 代理 1 个积分,开启 js_rendering 为 5 个,选择 Premium 档位时按上表 Premium 费率计费。抓取费用绝不会超出你设置的 max_pages。
失败的页面怎么处理?
与任何任务一样会退还积分。封锁、未解出的 CAPTCHA、超时和空响应都不收费;你只为返回了内容的页面付费。
积分会过期吗?
按量付费积分永不过期。月度套餐中未用完的积分可顺延一个月,试用积分有效期为 1 年。同一余额可用于所有抓取产品。
有并发上限吗?
有,按账户计算。GET /users/@me 会显示 current_concurrency 和 concurrency_limit;可在控制台中提高上限,或与我们联系。
立即开始

准备好开始构建了吗?

从免费套餐起步,随项目增长灵活扩展。 无需信用卡,无需销售电话。

直接与工程师沟通,而不是聊天机器人。