Crawl API
一次调用即可遍历整个网站,读取起始 URL 下的每个页面,并以可直接用于 LLM 的 Markdown 而非原始 HTML 返回。抓取按广度优先跟踪链接,停留在你的站点和路径之下,并使用 Unlocker 引擎获取每个页面,因此受保护的网站也不在话下。
- 一次调用,数百个页面:在起始 URL 下按广度优先抓取,仅限同站
- max_pages、max_depth 和 RE2 路径过滤在开始前划定范围
- 每个页面均可输出 Markdown 或 JSON,干净到可直接向量化
- 异步:返回 202 和 job_id,随后轮询状态并分页读取结果
- 自动去重:无论有多少链接指向同一页面,都只保留一条
- Basic 每页 1 个积分,js_rendering 为 5 个;失败页面退还积分
npx -y @datafuel/mcp init一个任务搞定一切
该接口的六大能力,一目了然。从一个 URL 到完整语料库
给 Crawl 一个起始 URL,它会按广度优先遍历其下所有页面,并将每个页面以干净的 Markdown 返回。一次调用,一个数据集:无需维护链接列表,也无需编排逐页请求。
演示数据。页面数量仅作示意;真实抓取会在你设定的上限内跟踪网站链接。
杜绝意外的控制项
max_depth 和 max_pages 在抓取开始前划定边界,包含/排除规则可进一步缩小范围。任务入队的页面绝不会超出你的许可,因此成本有上限、可预测,而不是一张无底账单。
演示数据。估算基于 Basic 价格,每页 1 个积分;js_rendering 页面为 5 个。
为 RAG 和 AI 流水线而生
每个页面都以结构化 Markdown 返回:保留标题、列表和表格,去除导航、脚本和模板内容。无需后处理:直接分块、向量化、检索。
演示数据。分块和向量化在你的流水线中完成;API 返回 Markdown。
规模化的异步处理
抓取是一个任务,而不是一次请求:你会立即得到 202 和 job_id,抓取在我们这边运行。你的代码无需阻塞:轮询 GET /crawl/{job_id} 查看进度,页面仍在到达时即可分页读取结果。
演示数据。job_id、耗时和页面数量仅作示意。
只为成功请求付费
选择月度套餐、一次性购买积分,或使用不限线程套餐。失败的请求永不计费。
每个套餐都包含所有端点和所有接口(API、MCP)。共用一个积分余额:你只为用量付费,而且只为成功的请求付费。
适合需要充裕容量的生产级爬虫和智能体。
- 包含 Starter 的全部功能
- 自动充值
- 优先聊天支持
适合按计划交付数据产品的团队。
- 包含 Growth 的全部功能
- 按 API 密钥设置用量提醒
- 客户经理
大用量,最低单页价格。即时开通。
- 包含 Business 的全部功能
- 专属 IP 池
- 99.9% SLA
| Free | Starter | Growth | Business | Scale | Enterprise | |
|---|---|---|---|---|---|---|
| 每月积分 | 1K 一次性 | 300K | 1M | 3.5M | 12M | 定制 |
| 并发线程 | 2 | 10 | 25 | 50 | 150 | 250+ |
| API 密钥 | 1 | 3 | 10 | 25 | 无限制 | 无限制 |
| JS 渲染 | ||||||
| 住宅代理 | ||||||
| AI 实时提取(使用你的密钥) | ||||||
| 地理定位 · 195+ 个国家 | ||||||
| 批量多 URL | ||||||
| Unlocker · Crawl · Map · LLM Scraper | ||||||
| 自动充值 | — | — | ||||
| 支持 | 社区 | 邮件 | 优先聊天 | 客户经理 | Slack + 电话 | 专属支持 + SLA |
常见问题
范围、结果与计费,直截了当地回答。