Documentazione del crawler

LohiSoftBot

LohiSoftBot è il crawler web gestito da LohiSoft s.r.o. Questa pagina documenta cosa fa, come riconoscerlo e come tenerlo lontano dal Suo sito.

Ultimo aggiornamento: 23 agosto 2026

In breve

User-agent
LohiSoftBot/1.0
Indirizzi IP di origine
79.139.58.98, 79.139.58.121
Budget di scansione
Massimo 20 pagine per sito
Nomi host del crawler
*.bot.lohisoft.com
Contatto
message@lohisoft.com

Chi gestisce il crawler

Operatore:
LohiSoft s.r.o.

A cosa serve LohiSoftBot

LohiSoftBot/1.0 crea l'indice di ricerca proprio di LohiSoft.

Non raccoglie dati di addestramento per modelli di IA e non copia contenuti a fini di ripubblicazione.

Cosa memorizza

Per ogni pagina, il crawler memorizza esclusivamente quanto segue:

  • Il titolo della pagina
  • La meta description
  • I titoli h1–h3
  • L'URL
  • Il testo dei link che puntano alla pagina

Cosa non memorizza

Il contenuto testuale della pagina non viene memorizzato.

L'indice indica la direzione, non risponde: un risultato di ricerca rimanda sempre alla pagina originale.

Quante richieste invia

Al massimo 20 pagine per sito.

Buone pratiche di scansione

  • Rispetta il file robots.txt come specificato dalla RFC 9309.
  • Invia una sola richiesta per host alla volta, con un ritardo tra le richieste.
  • In caso di risposte HTTP 429 e 5xx, rallenta rispettando l'header Retry-After.
  • Non aggira mai login, paywall o protezioni anti-bot.

Come bloccarlo

Aggiunga quanto segue al Suo robots.txt:

User-agent: LohiSoftBot
Disallow: /

Può inoltre richiedere l'esclusione immediata scrivendo a message@lohisoft.com. Rimuoveremo quindi il dominio dall'elenco di scansione.

message@lohisoft.com

Identificare e verificare il crawler

Stringa user-agent

Attualmente in uso
LohiSoftBot/1.0 (+message@lohisoft.com)
In fase di implementazione
LohiSoftBot/1.0 (+https://lohisoft.com/bot)

La forma precedente, basata sull'e-mail, viene gradualmente sostituita dalla forma basata sull'URL. Entrambe sono legittime, quindi è normale vedere l'una o l'altra durante la transizione.

Indirizzi IP di origine

Il crawler recupera le pagine esclusivamente da questi indirizzi IPv4 fissi:

  • 79.139.58.98
  • 79.139.58.121

Non effettua alcuna richiesta tramite IPv6.

Elenco leggibile da macchina per le regole di firewall e WAF:

https://lohisoft.com/bot/ips.json

Fornito in formato application/json via HTTPS, senza autenticazione né reindirizzamenti.

DNS inverso con conferma diretta (FCrDNS)

Questo è il metodo consigliato per verificare il crawler. È indipendente dall'elenco di IP sopra riportato, quindi rimane valido anche se spostiamo il crawler su un'altra macchina.

  1. Esegui una risoluzione inversa sull'indirizzo IP da cui proviene la richiesta. Il nome host restituito deve terminare con .bot.lohisoft.com
  2. Esegui una risoluzione diretta su quel nome host. Deve risolvere esattamente allo stesso indirizzo IP.
  3. Se uno dei due passaggi non corrisponde, la richiesta non proviene da noi ed è corretto bloccarla.

Verifica la corrispondenza con il suffisso .bot.lohisoft.com, non con il dominio nudo .lohisoft.com: quest'ultimo copre anche il nostro server web e il nostro server di posta, mentre .bot.lohisoft.com copre esclusivamente i crawler.

Nomi host del crawler

79.139.58.98
crawler1.bot.lohisoft.com
79.139.58.121
crawler2.bot.lohisoft.com

Esempio

$ dig +short -x 79.139.58.98
crawler1.bot.lohisoft.com.

$ dig +short crawler1.bot.lohisoft.com
79.139.58.98

Domande?

Se qualcosa non Le è chiaro, o desidera escludere il Suo dominio dalla scansione, ci scriva.

LohiSoft s.r.o.

message@lohisoft.com