AI 与网页数据 · 应用场景
为需要海量数据的模型提供干净的网页数据
爬取整站,得到 LLM 可直接使用的 Markdown。逐页获取受保护的页面。每个页面都来自你能说清来源的网络。
失败请求免费流量永不过期未使用套餐 24 小时内可退款
crawl · docs.northwindapi.com
depth 3max 500 pagesmarkdowninclude /docs/*main content only
412 / 500 pages3 blocked · refunded4 min 12 s
.mdGetting started1,240 tokens
.mdAuthentication2,010 tokens
.mdRate limits860 tokens
.mdWebhooks1,530 tokens
.mdError codes1,105 tokens
Vector store412 docs2,140 chunks
POST /crawlresult_format: markdownmain_content_only: trueGET /crawl/{job_id}/results
输入一个起始 URL,输出一个干净、已分块的语料库。
要点
针对 AI 训练数据和 RAG,Datafuel 提供两条路径:为你现有的爬虫提供数据中心代理,或使用 Crawl API,在一个异步任务中把整站以 LLM 可用的 Markdown 返回。失败的页面免费。
为什么AI 训练数据与 RAG难以规模化
模型的上限取决于它获得的数据。训练和检索系统都需要规模大、持续更新的语料库,而获取它们比看起来更难。
把原始 HTML 喂给模型代价高昂。导航、脚本、Cookie 横幅和模板内容可能占据一个页面的大部分 token,而且毫无帮助。自己清洗意味着要构建并维护一条流水线。
第二个问题是规模。内容最有价值的网站,恰恰最可能对爬虫限速或封锁,这意味着流水线正需要扩展的时候反而慢了下来。
而数据来源已不再是可选项。随着欧盟《人工智能法案》生效,一个说不清来源的语料库,可能是一个无法使用的语料库。
Datafuel 如何处理AI 训练数据与 RAG
Crawl API 接收一个起始 URL,在你设定的范围内跟踪链接,并将每个页面以去除模板内容的干净 Markdown 返回。一次调用,一个语料库。对于单个受保护的页面,Unlocker API 以单页粒度完成同样的工作。
每个页面都通过 Datafuel 自有的网络获取,住宅 IP 经用户同意获得,并依据 GDPR 记录在案。当有人问数据从哪里来时,你有答案。
爬取任务docs.example.com
3 个页面Markdown
Datafuel · crawl
/guides/api/pricing
guides.mdapi.mdpricing.md
向量数据库 · 向量化 · 检索你手上有什么?
一个会被封锁的爬虫
数据中心代理独享 IP不限带宽欺诈评分为 0
你的流水线
一组起始 URL
Crawl API深度与路径过滤LLM 可用的 Markdown异步任务
你的向量数据库
干净的文本,只为成功付费
保留你的采集器、修好网络,或者把 URL 交给我们。同样的 IP,同样的计费规则。
| 数据中心代理 | Crawl API | |
|---|---|---|
| 你提供 | 自己的爬虫和解析器 | 一个起始 URL、深度和路径过滤规则 |
| 你得到 | 来自独享 IP 的原始页面 | 每个页面都是 LLM 可用的 Markdown |
| 定位 | 国家 | 域名范围、深度、包含与排除路径 |
| 验证码 | 由你的爬虫处理 | 在请求内部处理 |
| 计费 | 按 IP 按月计费,不限带宽 | 按爬取页面计费,失败页面免费 |
| 最适合 | 你已有爬虫,只需要干净的 IP | 你希望直接拿到语料库 |
很多团队两者都用:API 处理会封锁的页面,代理服务于已在运行的采集器。
适用于AI 训练数据与 RAG的产品
所有应用场景价格相同。失败请求免费,已购流量永不过期。
工作原理
- 01发送一个起始 URL,并设置深度、页面上限和域名范围。
- 02Datafuel 在这些限制内爬取,必要时渲染页面,遇到防护时予以清除。
- 03页面以 Markdown 形式返回;轮询任务并在结果到达时分页读取。
在你自己的目标上试试。失败请求免费。免费开始
注意事项
- 不加限制,爬取就没有边界。开始前先设置页面上限和深度;一个大型网站在深度五时就是数百万个页面。
- 导入前先去重。网站会在不同 URL 下重复同样的内容,重复内容会扭曲检索结果。
- 存储含有个人数据的页面负有相应义务。在数据进入你的存储之前,删除不需要的部分。
AI 训练数据与 RAG:常见问题
可以获得哪些格式?
面向模型的 Markdown;如需原始内容可用 HTML;结构化提取可用带 schema 的 JSON。
可以直接投递到 S3 或 GCS 吗?
暂不支持直接投递。抓取目前没有 webhook 或存储投递功能;请分页读取 GET /crawl/{job_id}/results,再把每个页面写入你的存储桶。
你们如何应对封锁爬虫的网站?
爬取的代理档位和 js_rendering 由你选择,被拦截的页面会退款。如果页面需要 JavaScript 渲染,API 会在创建爬取时告知你,请设置 js_rendering: true 后重新提交。只有成功返回的页面才计费。
可以只爬取网站的某一部分吗?
可以。包含与排除规则、深度和页面上限都可以配置。
IP 来自哪里?
住宅 IP 通过 Datafuel SDK 在设备所有者同意的前提下获得。ISP 和数据中心 IP 运行在 Datafuel 自有的基础设施上。
最后更新:。