Vai al contenuto
AI e dati web · Caso d’uso

Dati web puliti per modelli che ne hanno bisogno in grande quantità

Scansiona siti interi e ottieni Markdown pronto per LLM. Recupera le pagine protette una alla volta. Ogni pagina arriva da una rete di cui puoi documentare l'origine.

Richieste fallite gratuiteIl traffico non scade maiRimborso in 24 ore sui piani non usati
Job di crawlValori illustrativi

Un URL di partenza in ingresso. Un corpus pulito, già diviso in chunk, in uscita.

In sintesi

Per i dati di training AI e il RAG, Datafuel offre due strade: proxy datacenter per il crawler che usi già, oppure la Crawl API, che restituisce siti interi come Markdown pronto per LLM in un unico job asincrono. Le pagine fallite sono gratuite.

Perché dati di training AI e RAG è difficile su larga scala

Un modello è limitato dai dati che ha ricevuto. Sia i cicli di training sia i sistemi di retrieval hanno bisogno di corpus ampi e sempre aggiornati, e ottenerli è più difficile di quanto sembri.

Dare HTML grezzo a un modello costa caro. Navigazione, script, banner dei cookie e testo di contorno possono essere la maggior parte dei token di una pagina, e nessuno di questi aiuta. Ripulirlo internamente è una pipeline da costruire e mantenere.

Il secondo problema è il volume. I siti con i contenuti più utili sono proprio quelli che più facilmente limitano o bloccano un crawler, quindi la pipeline rallenta esattamente quando deve crescere.

E la provenienza non è più facoltativa. Con l'AI Act europeo in vigore, un corpus di cui non sai spiegare l'origine è un corpus che potresti non poter usare.

Come Datafuel gestisce dati di training AI e RAG

La Crawl API parte da un URL, segue i link entro i limiti che imposti e restituisce ogni pagina come Markdown pulito, senza testo di contorno. Una chiamata, un corpus. Per le singole pagine protette, la Unlocker API fa lo stesso lavoro una pagina alla volta.

Ogni pagina viene recuperata attraverso una rete di proprietà di Datafuel, con IP residenziali ottenuti con consenso e documentati ai sensi del GDPR. Quando qualcuno chiede da dove vengono i dati, c'è una risposta.

Un URL di partenza, un corpus
Due strade

Tieni il tuo collector e sistema la rete, oppure passaci l'URL. Stessi IP, stessa regola di fatturazione.

Proxy datacenterCrawl API
Porti tuil tuo crawler e il tuo parserun URL di partenza, una profondità e i filtri sui percorsi
Ottienipagine grezze da IP dedicatiogni pagina come Markdown pronto per LLM
Targetingpaeseambito del dominio, profondità, percorsi inclusi ed esclusi
CAPTCHAgestiti dal tuo crawlergestiti dentro la richiesta
Fatturazioneper IP al mese, banda illimitataper pagina scansionata, pagine fallite gratuite
Ideale quandohai un crawler e ti servono IP pulitivuoi ricevere il corpus già pronto

Molti team usano entrambi: l'API per le pagine che bloccano, i proxy per i collector che hanno già.

Prodotti per dati di training AI e RAG

Stesso prezzo per ogni caso d’uso. Le richieste fallite sono gratuite e il traffico acquistato non scade mai.

Se usi un tuo crawlerDatacenter Proxiesprima 2,00 $, ora 1,40 $ 2,00 $per IPIP dedicati e veloci con fraud score 0 per i target non protetti.
  • IP dedicati, subnet /24 miste
  • Banda illimitata
  • Fraud score verificato prima della consegna
  • Consegna immediata
Se vuoi ricevere il corpusCrawl APIprima 0,042 $, ora 0,029 $ 0,042 $ogni 1.000Siti interi in Markdown pronto per LLM, in un unico job asincrono.
  • Siti interi in Markdown pronto per LLM
  • Filtri di profondità e percorso
  • Job asincroni
  • Le pagine fallite sono gratuite

Come funziona

  1. 01Invia un URL di partenza con profondità, limite di pagine e ambito del dominio.
  2. 02Datafuel esegue il crawl entro quei limiti, con il rendering dove serve e superando le protezioni dove presenti.
  3. 03Le pagine arrivano in Markdown; interroghi il job e scorri i risultati man mano che arrivano.
Provalo sui tuoi target. Le richieste fallite sono gratuite.Inizia gratis

A cosa fare attenzione

  • Il crawl non ha limiti finché non glieli dai. Imposta limiti di pagine e di profondità prima di iniziare; un sito grande a profondità cinque sono milioni di pagine.
  • Deduplica prima di importare. I siti ripetono gli stessi contenuti su URL diversi, e i duplicati falsano il retrieval.
  • Conservare pagine che contengono dati personali comporta obblighi. Elimina ciò che non ti serve prima che arrivi nel tuo archivio.

Dati di training AI e RAG: domande frequenti

In quali formati posso ricevere i dati?
Markdown per i modelli, HTML se ti serve l'originale, JSON con uno schema per l'estrazione strutturata.
Posso consegnare direttamente su S3 o GCS?
Non direttamente. Il crawl non ha ancora webhook né consegna su storage; scorri GET /crawl/{job_id}/results e scrivi ogni pagina nel tuo bucket.
Come gestite i siti che bloccano i crawler?
Scegli tu il livello di proxy e js_rendering del crawl, e le pagine bloccate vengono rimborsate. Se le pagine richiedono il rendering JavaScript, l'API te lo dice quando crei il crawl; lo rinvii con js_rendering: true. Paghi solo le pagine che tornano.
Posso limitare il crawl a una sola sezione di un sito?
Sì. Pattern di inclusione ed esclusione, profondità e limiti di pagine sono tutti configurabili.
Da dove vengono gli IP?
Gli IP residenziali sono ottenuti tramite l'SDK di Datafuel con il consenso del proprietario del dispositivo. Gli IP ISP e datacenter girano su infrastruttura di proprietà di Datafuel.
Ultimo aggiornamento: .
Inizia

Pronto a costruire?

Parti dal piano gratuito e cresci insieme al tuo progetto. Nessuna carta di credito, nessuna call commerciale.

Parli con un ingegnere, non con un chatbot.