Dati web puliti per modelli che ne hanno bisogno in grande quantità
Scansiona siti interi e ottieni Markdown pronto per LLM. Recupera le pagine protette una alla volta. Ogni pagina arriva da una rete di cui puoi documentare l'origine.
Un URL di partenza in ingresso. Un corpus pulito, già diviso in chunk, in uscita.
Per i dati di training AI e il RAG, Datafuel offre due strade: proxy datacenter per il crawler che usi già, oppure la Crawl API, che restituisce siti interi come Markdown pronto per LLM in un unico job asincrono. Le pagine fallite sono gratuite.
Perché dati di training AI e RAG è difficile su larga scala
Un modello è limitato dai dati che ha ricevuto. Sia i cicli di training sia i sistemi di retrieval hanno bisogno di corpus ampi e sempre aggiornati, e ottenerli è più difficile di quanto sembri.
Dare HTML grezzo a un modello costa caro. Navigazione, script, banner dei cookie e testo di contorno possono essere la maggior parte dei token di una pagina, e nessuno di questi aiuta. Ripulirlo internamente è una pipeline da costruire e mantenere.
Il secondo problema è il volume. I siti con i contenuti più utili sono proprio quelli che più facilmente limitano o bloccano un crawler, quindi la pipeline rallenta esattamente quando deve crescere.
E la provenienza non è più facoltativa. Con l'AI Act europeo in vigore, un corpus di cui non sai spiegare l'origine è un corpus che potresti non poter usare.
Come Datafuel gestisce dati di training AI e RAG
La Crawl API parte da un URL, segue i link entro i limiti che imposti e restituisce ogni pagina come Markdown pulito, senza testo di contorno. Una chiamata, un corpus. Per le singole pagine protette, la Unlocker API fa lo stesso lavoro una pagina alla volta.
Ogni pagina viene recuperata attraverso una rete di proprietà di Datafuel, con IP residenziali ottenuti con consenso e documentati ai sensi del GDPR. Quando qualcuno chiede da dove vengono i dati, c'è una risposta.
Tieni il tuo collector e sistema la rete, oppure passaci l'URL. Stessi IP, stessa regola di fatturazione.
| Proxy datacenter | Crawl API | |
|---|---|---|
| Porti tu | il tuo crawler e il tuo parser | un URL di partenza, una profondità e i filtri sui percorsi |
| Ottieni | pagine grezze da IP dedicati | ogni pagina come Markdown pronto per LLM |
| Targeting | paese | ambito del dominio, profondità, percorsi inclusi ed esclusi |
| CAPTCHA | gestiti dal tuo crawler | gestiti dentro la richiesta |
| Fatturazione | per IP al mese, banda illimitata | per pagina scansionata, pagine fallite gratuite |
| Ideale quando | hai un crawler e ti servono IP puliti | vuoi ricevere il corpus già pronto |
Molti team usano entrambi: l'API per le pagine che bloccano, i proxy per i collector che hanno già.
Prodotti per dati di training AI e RAG
Stesso prezzo per ogni caso d’uso. Le richieste fallite sono gratuite e il traffico acquistato non scade mai.
- IP dedicati, subnet /24 miste
- Banda illimitata
- Fraud score verificato prima della consegna
- Consegna immediata
- Siti interi in Markdown pronto per LLM
- Filtri di profondità e percorso
- Job asincroni
- Le pagine fallite sono gratuite
Come funziona
- 01Invia un URL di partenza con profondità, limite di pagine e ambito del dominio.
- 02Datafuel esegue il crawl entro quei limiti, con il rendering dove serve e superando le protezioni dove presenti.
- 03Le pagine arrivano in Markdown; interroghi il job e scorri i risultati man mano che arrivano.
A cosa fare attenzione
- Il crawl non ha limiti finché non glieli dai. Imposta limiti di pagine e di profondità prima di iniziare; un sito grande a profondità cinque sono milioni di pagine.
- Deduplica prima di importare. I siti ripetono gli stessi contenuti su URL diversi, e i duplicati falsano il retrieval.
- Conservare pagine che contengono dati personali comporta obblighi. Elimina ciò che non ti serve prima che arrivi nel tuo archivio.
Dati di training AI e RAG: domande frequenti
In quali formati posso ricevere i dati?
Posso consegnare direttamente su S3 o GCS?
Come gestite i siti che bloccano i crawler?
Posso limitare il crawl a una sola sezione di un sito?
Da dove vengono gli IP?
Pronto a costruire?
Parti dal piano gratuito e cresci insieme al tuo progetto. Nessuna carta di credito, nessuna call commerciale.
Parli con un ingegnere, non con un chatbot.