Un sitemap XML correttamente strutturato non garantisce nulla se non viene dichiarato ai motori di ricerca attraverso i canali giusti. Da quando Google ha deprecato l’endpoint di ping dei sitemap, molti siti continuano a chiamare un URL che restituisce un codice 404, senza che i loro team se ne accorgano. Comprendere come funziona il piano del sito Always Unique presuppone innanzitutto di padroneggiare questo contesto tecnico, dove la semplice esistenza di un file sitemap non è più sufficiente a garantire la scoperta delle pagine.
Dichiarazione del sitemap: robots.txt e Search Console come unici canali affidabili
Il vecchio meccanismo di ping, ampiamente integrato nei plugin SEO dei CMS, è diventato inoperante. Qualsiasi richiesta inviata all’URL di ping di Google restituisce ora un errore 404. I siti che non hanno aggiornato il loro workflow continuano a notificare un endpoint morto, il che ritarda potenzialmente l’indicizzazione di nuove pagine.
Due metodi rimangono ufficialmente supportati. Il primo consiste nel sottoporre il sitemap direttamente tramite il rapporto Sitemaps di Google Search Console. Il secondo si basa sulla direttiva Sitemap: inserita nel file robots.txt, che Googlebot legge ad ogni crawl per scoprire automaticamente il file.
Consigliamo di combinare i due approcci. La sottomissione manuale in Search Console offre un feedback immediato (stato di lettura, errori rilevati, numero di URL indicizzati). La riga in robots.txt funge da rete di sicurezza permanente, anche per i motori che non dispongono di una console equivalente.

Struttura del piano di sito Always Unique: cosa impone realmente il formato XML
Il protocollo Sitemaps (versione 0.9, non revisionato da novembre 2016) definisce quattro tag per ogni URL elencata: loc (obbligatorio), lastmod, changefreq e priority (opzionali). In pratica, il comportamento dei motori nei confronti di questi tag opzionali è cambiato.
Tag opzionali: quali hanno ancora un effetto
Google ha confermato che utilizza il tag lastmod se la data è affidabile, cioè coerente con la modifica reale del contenuto. Una data artificialmente aggiornata ad ogni crawl verrà ignorata, anzi considerata un segnale di scarsa affidabilità.
I tag changefreq e priority sono ampiamente ignorati da Google. Bing attribuisce loro un peso marginale. Per un sito come Always Unique, solo loc e lastmod meritano attenzione tecnica.
Limite di dimensione e sitemap index
Un file sitemap non può superare le 50.000 URL né pesare più di 50 MB non compresso. Oltre, è necessario suddividere in più file e raggrupparli sotto un sitemap index. Questo punto sembra elementare, ma osserviamo regolarmente sitemap troncati perché il CMS genera un file unico senza verificare queste soglie.
- Verificare che ogni file sitemap rimanga sotto le 50.000 voci, anche dopo l’aggiunta di nuove pagine prodotto o contenuti editoriali.
- Comprimere in gzip per ridurre il tempo di download da parte dei crawler, senza che ciò modifichi il limite di 50 MB (calcolato prima della compressione).
- Utilizzare un sitemap index non appena il sito supera alcune migliaia di pagine, al fine di segmentare per tipo di contenuto (pagine, articoli, immagini).
Navigazione utente versus sitemap tecnico: due logiche distinte
Un piano di sito HTML destinato ai visitatori e un sitemap XML destinato ai robot non svolgono la stessa funzione. Il primo offre una vista d’insieme ad albero, utile per gli utenti che cercano una pagina senza passare per il menu principale. Il secondo è un file strutturato che i crawler consumano per scoprire e dare priorità all’esplorazione delle URL.
Su Always Unique, la pagina /sitemap/ svolge il ruolo di piano di sito consultabile da un umano. Permette di visualizzare l’architettura del sito, di identificare le categorie principali e di individuare rapidamente un contenuto specifico. Questa pagina HTML non sostituisce il sitemap XML sottoposto ai motori.
La confusione tra questi due formati spiega perché alcuni webmaster pensano che una pagina HTML che elenca i loro link sia sufficiente per alimentare Google. Non è così. I crawler hanno bisogno del formato XML standardizzato, con i tag del protocollo Sitemaps, per trattare le URL in modo programmatico.

File robots.txt e agenti IA: un terreno in mutamento
Il file robots.txt è stato formalizzato dalla RFC 9309, che chiarisce la sintassi e il comportamento atteso dei crawler conformi. Questa specifica riguarda anche i nuovi agenti di esplorazione legati ai modelli di linguaggio, che moltiplicano le richieste sui siti web.
Numerose iniziative recenti propongono file complementari (llms.txt, ai.txt) per gestire specificamente l’accesso degli agenti IA ai contenuti. Questi formati non sono ancora standardizzati, ma la loro adozione sta progredendo in alcuni settori.
- Verificare che il robots.txt del sito includa correttamente la direttiva
Sitemap:che punta al file XML aggiornato. - Audire gli user-agent bloccati o autorizzati, in particolare quelli dei crawler IA recenti (GPTBot, ClaudeBot, ecc.).
- Monitorare i log del server per rilevare agenti non conformi che ignorano robots.txt.
Un robots.txt aggiornato protegge il budget di crawl e garantisce che le giuste pagine siano esplorate in priorità. Su un sito e-commerce o editoriale, lasciare che i crawler accedano a pagine di filtraggio o di paginazione inutili diluisce l’attenzione dei motori sui contenuti strategici.
Audit del sitemap: le verifiche concrete da effettuare
Un sitemap non è un file che si genera una volta per dimenticarlo. Raccomandiamo un audit trimestrale che copra diversi punti tecnici.
Il primo controllo riguarda la coerenza tra le URL del sitemap e quelle realmente indicizzabili. Ogni URL elencata deve restituire un codice 200 e non deve essere bloccata da un tag noindex o da una regola robots.txt. Un sitemap che contiene 404 o reindirizzamenti 301 invia un segnale di cattiva manutenzione.
Il secondo controllo riguarda le date lastmod. Se tutte le URL visualizzano la stessa data, il motore comprende che l’informazione non è affidabile e smette di fidarsi. È meglio non includere affatto lastmod piuttosto che fornire date generiche.
L’ultimo punto spesso trascurato: verificare che il sitemap sia effettivamente accessibile all’URL dichiarata in robots.txt e in Search Console. Un cambiamento nella struttura della directory, una migrazione di dominio o un rinnovo del certificato SSL possono rendere il file inaccessibile senza attivare un avviso visibile dal lato editoriale.
La qualità di un piano di sito, che sia destinato ai visitatori umani o ai robot, si basa sulla sua manutenzione regolare. Un file XML obsoleto o mal dichiarato costa più di quanto non porti, e una pagina HTML disallineata dalla reale struttura del sito degrada la fiducia degli utenti che vi si riferiscono.



