AI 与网页数据 · 应用场景
从任意页面到模型所需的精确 JSON
定义 schema,发送 URL,获得一致的结构化数据。无需选择器,无需解析,不在冗余内容上浪费任何 token。
失败请求免费流量永不过期未使用套餐 24 小时内可退款
URL:https://runstore.example/air-zoom-pegasus-42schema: 5 fields
Schema
titlestring
pricenumber
currencystring
ratingnumber
in_stockboolean
Air Zoom Pegasus 42€129.994.6In stockAdd to cart
Response
{
"title": "Air Zoom Pegasus 42",
"price": 129.99,
"currency": "EUR",
"rating": 4.6,
"in_stock": true
}
Run 1=Run 2=Run 3identical · hash a91f3c
POST /tasktype: unlockerresult_format: jsonproxy_type: Premium10 credits1.2 s
输入 schema,输出 JSON,每次运行结果一致。
要点
面向 LLM 的数据提取,意味着页面以 Markdown 或符合 schema 的 JSON 形式送达,而不是 200 KB 的 HTML。Unlocker API 在一次请求中完成抓取、解封和转换;失败的请求不收费。
为什么面向 LLM 的数据提取难以规模化
网上有数据,和数据能被模型使用,是两回事。原始 HTML 大部分都不是内容:导航、脚本、跟踪代码、横幅。把它交给模型既浪费 token,又会干扰答案。
显而易见的办法是让模型读每个页面并提取所需内容,但这有三个问题。它很慢,每页要几秒。量大时成本很高。而且结果不确定:同一页面两次运行可能生成不同的 JSON,让下游代码变得脆弱。
为每个网站编写选择器是老办法,而网站每次改版它都会失效。
Datafuel 如何处理面向 LLM 的数据提取
发送 URL 和 schema。Unlocker API 返回填好字段的 JSON,每次都符合 schema。也可以请求 Markdown,获得已去除冗余内容的页面正文。
在底层,提取逻辑为每个网站构建一次,之后以确定性方式运行,因此同一页面总是得到相同的输出,成本也保持在低位。如果你更想用自己的模型完成解析,也可以:提供你自己的 API 密钥,Datafuel 会通过它执行提取。
两次运行,同一页面输入相同,输出相同
运行 1 · 运行 2每次请求调用模型输出不同
运行 1
"price": 129.00,"currency": "EUR""in_stock": true
运行 2
"price": 129.00,"price_eur": "€129""stock": "yes"
Datafuel输出完全相同
运行 1
"price": 129.00,"currency": "EUR""in_stock": true
运行 2
"price": 129.00,"currency": "EUR""in_stock": true
适用于面向 LLM 的数据提取的产品
所有应用场景价格相同。失败请求免费,已购流量永不过期。
工作原理
- 01发送 URL 和 JSON schema,或用自然语言描述所需字段。
- 02Datafuel 突破任何防护抓取页面,并按 schema 提取数据。
- 03返回结构化 JSON,每次调用的结构都完全一致。
在你自己的目标上试试。失败请求免费。免费开始
注意事项
- 规定字段缺失时返回什么:null、空值还是省略。这里行为不明确会导致下游代码出错。
- 对含义模糊的字段要写清楚。“价格”可能指标价、促销价、单价或含税价,请说明是哪一种。
- Markdown 适合阅读和 RAG;JSON 适合数据管道。按用途选择,而不是按项目选择。
面向 LLM 的数据提取:常见问题
我必须编写 schema 吗?
不必。你可以用自然语言描述字段,Datafuel 会生成 schema。
每次的输出都会一样吗?
对于给定的页面和 schema,是的。某个网站的提取逻辑建立后,提取就是确定性的。
我可以用自己的模型来提取吗?
可以。提供你的 API 密钥并选择模型,解析步骤将通过你的服务商完成。
如果网站改版了怎么办?
提取逻辑会自动重新生成,期间失败的请求不收费。
支持哪些格式?
Markdown、HTML、符合你 schema 的 JSON,以及截图和链接列表。
最后更新:。