跳至正文
AI 与网页数据 · 应用场景

从任意页面到模型所需的精确 JSON

定义 schema,发送 URL,获得一致的结构化数据。无需选择器,无需解析,不在冗余内容上浪费任何 token。

失败请求免费流量永不过期未使用套餐 24 小时内可退款
从 schema 到 JSON示意数据

输入 schema,输出 JSON,每次运行结果一致。

要点

面向 LLM 的数据提取,意味着页面以 Markdown 或符合 schema 的 JSON 形式送达,而不是 200 KB 的 HTML。Unlocker API 在一次请求中完成抓取、解封和转换;失败的请求不收费。

为什么面向 LLM 的数据提取难以规模化

网上有数据,和数据能被模型使用,是两回事。原始 HTML 大部分都不是内容:导航、脚本、跟踪代码、横幅。把它交给模型既浪费 token,又会干扰答案。

显而易见的办法是让模型读每个页面并提取所需内容,但这有三个问题。它很慢,每页要几秒。量大时成本很高。而且结果不确定:同一页面两次运行可能生成不同的 JSON,让下游代码变得脆弱。

为每个网站编写选择器是老办法,而网站每次改版它都会失效。

Datafuel 如何处理面向 LLM 的数据提取

发送 URL 和 schema。Unlocker API 返回填好字段的 JSON,每次都符合 schema。也可以请求 Markdown,获得已去除冗余内容的页面正文。

在底层,提取逻辑为每个网站构建一次,之后以确定性方式运行,因此同一页面总是得到相同的输出,成本也保持在低位。如果你更想用自己的模型完成解析,也可以:提供你自己的 API 密钥,Datafuel 会通过它执行提取。

确定性与非确定性示意数据

适用于面向 LLM 的数据提取的产品

所有应用场景价格相同。失败请求免费,已购流量永不过期。

一次调用,干净输出Unlocker API原价 $0.042,现价 $0.029 $0.042每 1K 次任意 URL 转为 Markdown 或 JSON,突破任何防护,一次请求完成。
  • 任意页面,突破任何防护
  • 在请求内处理 CAPTCHA
  • Markdown、JSON、HTML 或截图
  • 失败的请求不收费
  • 支持 MCP

工作原理

  1. 01发送 URL 和 JSON schema,或用自然语言描述所需字段。
  2. 02Datafuel 突破任何防护抓取页面,并按 schema 提取数据。
  3. 03返回结构化 JSON,每次调用的结构都完全一致。
在你自己的目标上试试。失败请求免费。免费开始

注意事项

  • 规定字段缺失时返回什么:null、空值还是省略。这里行为不明确会导致下游代码出错。
  • 对含义模糊的字段要写清楚。“价格”可能指标价、促销价、单价或含税价,请说明是哪一种。
  • Markdown 适合阅读和 RAG;JSON 适合数据管道。按用途选择,而不是按项目选择。

面向 LLM 的数据提取:常见问题

我必须编写 schema 吗?
不必。你可以用自然语言描述字段,Datafuel 会生成 schema。
每次的输出都会一样吗?
对于给定的页面和 schema,是的。某个网站的提取逻辑建立后,提取就是确定性的。
我可以用自己的模型来提取吗?
可以。提供你的 API 密钥并选择模型,解析步骤将通过你的服务商完成。
如果网站改版了怎么办?
提取逻辑会自动重新生成,期间失败的请求不收费。
支持哪些格式?
Markdown、HTML、符合你 schema 的 JSON,以及截图和链接列表。
最后更新:。
立即开始

准备好开始构建了吗?

从免费套餐起步,随项目增长灵活扩展。 无需信用卡,无需销售电话。

直接与工程师沟通,而不是聊天机器人。