Informazioni su webatlabot
webatlabot è il crawler web gestito da webatla. Visita pagine web pubbliche e registra quali tecnologie utilizza un sito. Se è arrivato qui da una stringa User-Agent nei Suoi registri, tutto ciò che Le serve per identificare, verificare o bloccare il crawler si trova in questa pagina.
Ultimo aggiornamento 2026-08-24
1Come identificare il crawler
Mozilla/5.0 (compatible; webatlabot/1.0; +https://webatla.com/bot; abuse@webatla.com)From: abuse@webatla.com46.224.210.134 → crawl.webatla.com2a01:4f8:1c19:79a5::1 → crawl.webatla.comOgni richiesta effettuata dal crawler porta esattamente questa stringa User-Agent e questa intestazione From. Il traffico proviene dai due indirizzi sopra indicati e da nessun altro.
2Cosa fa e cosa non fa il crawler
- ✓Richiede pagine pubbliche via HTTP e HTTPS, esattamente come farebbe un browser.
- ✓Legge l’HTML restituito e le intestazioni di risposta per determinare quale software utilizza il sito.
- ✓Segue i normali reindirizzamenti e registra l’URL finale.
- ✗Non invia moduli, non effettua l’accesso né tenta alcun tipo di autenticazione.
- ✗Non esegue la scansione delle porte e non cerca vulnerabilità.
- ✗Non esegue JavaScript e non raccoglie dati personali dalle pagine.
3Come verificare che una richiesta provenga davvero da noi
Entrambi i nostri indirizzi hanno un DNS inverso che punta a crawl.webatla.com, e quel nome host si risolve di nuovo verso questi stessi due indirizzi. Verifichi entrambe le direzioni prima di fidarsi di una richiesta.
# risoluzione inversa dell’indirizzo IPv4 dig -x 46.224.210.134 +short crawl.webatla.com. # la risoluzione diretta deve restituire lo stesso indirizzo dig +short crawl.webatla.com 46.224.210.134 # lo stesso controllo per IPv6 dig -x 2a01:4f8:1c19:79a5::1 +short crawl.webatla.com.
Una stringa User-Agent da sola non dimostra nulla. Chiunque può inviare il nostro User-Agent. Se una richiesta dichiara di essere webatlabot ma l’indirizzo non supera il controllo indicato sopra, non siamo noi, e vorremmo saperlo.
Da notare che crawl.webatla.com è solo l’host del crawler. Questa pagina e il resto del sito vengono serviti da indirizzi diversi dietro una CDN, quindi una risoluzione di webatla.com non corrisponderà.
4Perché il crawler ha raggiunto un indirizzo che non riconosce
Il crawler lavora a partire da elenchi pubblici di domini e dal DNS. Se un dominio punta ancora al suo indirizzo IP, il crawler si connette a quell’indirizzo, anche quando il dominio non ha più alcun rapporto con lei.
Questa è la spiegazione più comune per una visita inattesa. Un ex cliente si è trasferito lasciando un record A o AAAA puntato verso il suo intervallo, oppure un dominio parcheggiato si risolve verso un host che nel frattempo ha rilevato.
Ci invii il nome del dominio insieme all’indirizzo e potremo confermarle cosa è successo. Correggere il record DNS obsoleto alla fonte ferma ogni crawler, non solo il nostro.
5Come fermare il crawler
Il blocco ha effetto immediato e non richiede nulla da parte nostra. Filtri sul token webatlabot nello User-Agent, oppure sui due indirizzi.
# blocco per User-Agent (Apache) SetEnvIfNoCase User-Agent "webatlabot" bad_bot Deny from env=bad_bot # blocco per indirizzo (firewall Linux) iptables -A INPUT -s 46.224.210.134 -j DROP ip6tables -A INPUT -s 2a01:4f8:1c19:79a5::1 -j DROP
Può anche scrivere all’indirizzo sottostante e chiederci di escludere i suoi domini o il suo intervallo di indirizzi. Gestiamo le richieste di esclusione entro un giorno lavorativo e confermiamo via email non appena la modifica è attiva.
6Contatto
Una persona legge questo indirizzo: abuse@webatla.com
- •Il nome di dominio o l’indirizzo IP coinvolti
- •Alcune righe di log, con data e ora e il fuso orario
- •Cosa desidera che facciamo (bloccare un dominio, escludere un intervallo o spiegare una richiesta specifica)
- •Un indirizzo a cui possiamo rispondere