Vai al contenuto

API Crawl

Una chiamata percorre un intero sito e legge ogni pagina sotto l'URL di partenza, restituendole in Markdown pronto per LLM invece che in HTML grezzo. Il crawl segue i link in ampiezza, resta sul tuo sito e sotto il tuo percorso, e recupera ogni pagina con il motore Unlocker: i siti protetti non sono un caso speciale.

  • Una chiamata, centinaia di pagine: crawl in ampiezza sotto l'URL di partenza, solo sullo stesso sito
  • max_pages, max_depth e filtri di percorso RE2 tracciano il perimetro prima dell'avvio
  • Markdown o JSON per ogni pagina, abbastanza pulito da usarlo così com'è per gli embedding
  • Asincrono: 202 con un job_id, poi interroghi lo stato e scorri i risultati
  • Deduplicato: una voce per pagina, qualunque sia il numero di link che vi puntano
  • 1 credito per pagina con Basic, 5 con js_rendering; pagine fallite rimborsate
Da 1 credito per pagina. Le pagine fallite sono rimborsate. Nessuna carta per iniziare.
Pronto per MCPCollega il tuo agente con un solo comando:npx -y @datafuel/mcp initClaudeOpenAI / ChatGPTGeminiCursorMistral

Tutto in un solo job

Sei cose che fa l'endpoint, a colpo d'occhio.
Navigazione multipaginaUn solo URL di partenza; il crawl segue i link in ampiezza e legge ogni pagina sottostante.
Controllo di profondità e patternmax_depth, max_pages e i percorsi RE2 include/exclude definiscono il perimetro prima dell'avvio.
Output Markdown o JSONresult_format restituisce Markdown pulito per gli embedding, oppure JSON strutturato per pagina.
Job asincrono202 e un job_id subito; interroghi GET /crawl/{job_id} e scorri i risultati man mano che arrivano.
DeduplicatoUna voce per pagina, a prescindere da quanti link vi puntano. Solo URL dello stesso sito.
Limiti di sicurezzaMai più pagine di max_pages, mai fuori dal sito, pagine fallite rimborsate.
01 · Corpus

Da un URL a un corpus completo

Dai al crawl un URL di partenza e percorre ogni pagina sottostante, in ampiezza, restituendole una per una in Markdown pulito. Una chiamata, un dataset: nessun elenco di link da mantenere, nessuna richiesta per pagina da orchestrare.

Dati dimostrativi. I conteggi delle pagine sono indicativi; i crawl reali seguono i link del sito fino ai tuoi limiti.

Datafuel / CrawlEstimatingBounded
max_depth53
max_pages1,000200
include_paths["/docs/*"]
pages reachabledepth 11depth 224depth 3310depth 41,900depth 56,400
Maximum this job can cost1,000 credits200 credits
02 · Controlli

Controlli che evitano sorprese

max_depth e max_pages tracciano il perimetro prima dell'avvio del crawl, e i pattern include/exclude lo restringono ulteriormente. Il job non mette mai in coda più pagine di quelle consentite, così il costo è limitato e prevedibile, non una fattura senza tetto.

Dati dimostrativi. Le stime usano i prezzi Basic, 1 credito per pagina; le pagine con js_rendering costano 5.

Datafuel / CrawlConvertingEmbedded
rate-limits.html · 214 KB
<div class="hero"><nav>…</nav><h1>Rate limits</h1><script src="…"><p>Each key allows…<footer>…</footer>
rate-limits.md · 6 KB
# Rate limitsEach key allows **600 req/min**.## Headers- X-RateLimit-Remaining- Retry-After
vector store · 3 chunks
chunk_01 · 512 tok
chunk_02 · 498 tok
chunk_03 · 301 tok
The Markdown is what you embed. No cleanup step in between.
03 · Pronto per RAG

Pronto per pipeline RAG e AI

Ogni pagina torna come Markdown strutturato: titoli, elenchi e tabelle preservati, navigazione, script e boilerplate rimossi. Nessuna fase di post-elaborazione: dividi in chunk, crea gli embedding, recupera.

Dati dimostrativi. Chunking ed embedding avvengono nella tua pipeline; l'API restituisce il Markdown.

Datafuel / CrawlJob runningCompleted
POST/api/v1/crawl"max_pages": 500you
202 Accepted"job_id": "d3f8ae31-…"< 1 s
pendingprocessing · fetching pagescompleted0 / 500 pages236 / 500 pages500 / 500 pages
GET /crawl/{job_id} whenever you want: no open connection, nothing blocked.
GET/crawl/{job_id}/results"next_cursor": "MTc4…"pollingpage 1 · 100 pages
500 pages · one job · stop_reason max_pagestotal_cost 500
04 · Asincrono

Asincrono su larga scala

Un crawl è un job, non una richiesta: ricevi subito un 202 e un job_id e il crawl gira sui nostri server. Il tuo codice non resta bloccato: interroghi GET /crawl/{job_id} per l'avanzamento e scorri i risultati mentre le pagine arrivano ancora.

Dati dimostrativi. job_id, tempi e conteggi delle pagine sono indicativi.

Prezzi

Paghi solo le richieste riuscite

Scegli un piano mensile, acquista crediti una tantum o usa thread illimitati. Le richieste fallite non vengono mai fatturate.

Ogni piano include tutti gli endpoint e tutte le interfacce (API, MCP). Un unico saldo di crediti condiviso: paghi solo il volume, e solo per le richieste riuscite.

Quante richieste al mese?1.000.000 pagine sottoposte a crawl / mese
≈ 1.000.000 crediti · Growth
1K300K1M3.5M12MSu misura
Free

Prova ogni endpoint con crediti reali. Nessuna carta richiesta.

0 $prova una tantum
1.000 crediti, una tantum1.000 pagine sottoposte a crawl2 thread simultanei
  • Crediti di prova validi 1 anno
  • Tutti gli endpoint, API + MCP
  • Supporto della community
GrowthPiù adatto

Per crawler e agenti in produzione che hanno bisogno di margine.

prima 79 $, ora 55,30 $ 79 $/ mese, fatturazione mensile
1.000.000 crediti / mese1.000.000 pagine sottoposte a crawl25 thread simultanei0,055 $0,079 $ ogni 1K pagine0,277 $0,395 $ ogni 1K con JS
  • Tutto quello del piano Starter
  • Ricarica automatica
  • Supporto chat prioritario
Business

Per team che rilasciano prodotti di dati a cadenza regolare.

prima 199 $, ora 139,30 $ 199 $/ mese, fatturazione mensile
3.500.000 crediti / mese3.500.000 pagine sottoposte a crawl50 thread simultanei0,040 $0,057 $ ogni 1K pagine0,199 $0,284 $ ogni 1K con JS
  • Tutto quello del piano Growth
  • Avvisi di utilizzo per API key
  • Account manager
Scale

Alto volume alla tariffa per pagina più bassa. Checkout immediato.

prima 499 $, ora 349,30 $ 499 $/ mese, fatturazione mensile
12.000.000 crediti / mese12.000.000 pagine sottoposte a crawl150 thread simultanei0,029 $0,042 $ ogni 1K pagine0,146 $0,208 $ ogni 1K con JS
  • Tutto quello del piano Business
  • Pool di IP dedicato
  • SLA 99.9%
Enterprise

Volume garantito, fatturazione e governance.

Su misura
Su misura crediti / mese250+ thread simultanei
  • Prezzi a volume su misura
  • Concorrenza su misura (250+)
  • SSO · audit log · DPA
Confronta
FreeStarterGrowthBusinessScaleEnterprise
Crediti / mese1K una tantum300K1M3,5M12MSu misura
Thread simultanei2102550150250+
API key131025IllimitateIllimitate
Rendering JS
Proxy residenziali
AI in-flight (con la tua chiave)
Geotargeting · 195+ paesi
Batch multi-URL
Unlocker · Crawl · Map · LLM Scraper
Ricarica automatica——
SupportoCommunityEmailChat prioritariaAccount managerSlack + telefonoDedicato + SLA
Quanto costa davvero una richiesta?1 credito = 1 pagina base · i costi non si sommano: JS + Residenziale costa 20 crediti, non 5 + 10
1×HTTP baseHTML semplice, proxy datacenter
5×Rendering JSBrowser headless per siti dinamici
10×Proxy residenzialeIP residenziali reali
20×JS + ResidenzialeMassima potenza per i siti protetti
GratisAI In-FlightEstrazione LLM su qualsiasi richiesta Unlocker con la tua chiave AI, zero crediti in più
FAQ

Domande frequenti

Perimetro, risultati e fatturazione, con risposte dirette.

API CrawlPerimetro, profondità e risultati.
Come decide il crawl quali pagine visitare?
Parte dal tuo URL e segue i link in ampiezza, restando sullo stesso sito e sotto il percorso iniziale. max_pages è un limite rigido alle pagine in coda, max_depth limita quanti link di distanza dall'inizio può raggiungere, e include_paths / exclude_paths (RE2) restringono ulteriormente; exclude vince sempre.
Un crawl è una singola chiamata o un job?
Un job. POST /api/v1/crawl risponde subito 202 con un job_id. Interroga GET /crawl/{job_id} per stato e conteggio delle pagine, poi scorri GET /crawl/{job_id}/results con next_cursor quando ha finito.
Cosa ricevo per ogni pagina?
La pagina in Markdown per impostazione predefinita (imposta result_format per altri formati), con il suo URL e la profondità. Ogni pagina viene recuperata con tutte le opzioni di Unlocker, quindi i siti protetti o pesanti in JavaScript non sono un caso speciale.
Quando conviene usare Map al posto di Crawl?
Quando ti servono solo gli URL. Map restituisce in una sola chiamata tutti gli URL dello stesso sito presi da sitemap e link nelle pagine, per 1 credito con Basic (10 con Premium): è il modo più economico per misurare un sito o scegliere esattamente quali pagine scaricare.
FatturazioneCrediti, errori e limiti.
Come viene fatturato un crawl?
Per pagina messa in coda: 1 credito con i proxy Basic, 5 con js_rendering, e le tariffe Premium della tabella qui sopra quando scegli quel livello. Il crawl non fattura mai oltre il tuo max_pages.
Cosa succede alle pagine non riuscite?
Vengono rimborsate come qualsiasi task. Blocchi, CAPTCHA non risolti, timeout e risposte vuote non costano nulla; paghi le pagine tornate con contenuto.
I crediti scadono?
I crediti pay-as-you-go non scadono mai. I crediti non usati dei piani mensili restano disponibili per un altro mese, e i crediti di prova valgono 1 anno. Lo stesso saldo vale per ogni prodotto di scraping.
C'è un limite di concorrenza?
Sì, per account. GET /users/@me mostra current_concurrency e concurrency_limit; puoi aumentarla dalla dashboard o parlando con noi.
Inizia

Pronto a costruire?

Parti dal piano gratuito e cresci insieme al tuo progetto. Nessuna carta di credito, nessuna call commerciale.

Parli con un ingegnere, non con un chatbot.