Skip to content

Ontdek hoe je gemakkelijk kunt navigeren met de Always Unique sitemap

Een correct gestructureerde XML-sitemap garandeert niets als deze niet via de juiste kanalen aan zoekmachines wordt aangegeven. Sinds Google…

Femme naviguant facilement sur un plan de site web depuis un ordinateur portable dans un bureau à domicile

Een correct gestructureerde XML-sitemap garandeert niets als deze niet via de juiste kanalen aan zoekmachines wordt verklaard. Sinds Google de ping-eindpunt van sitemaps heeft gedevalueerd, blijven veel sites een URL aanroepen die een 404-code retourneert, zonder dat hun teams dit opmerken. Begrijpen hoe de sitemap van Always Unique werkt, vereist eerst een beheersing van deze technische context, waarin het simpele bestaan van een sitemapbestand niet langer voldoende is om de ontdekking van pagina’s te waarborgen.

Declaratie van de sitemap: robots.txt en Search Console als de enige betrouwbare schakels

Het oude pingmechanisme, dat breed geïntegreerd was in de SEO-plugins van CMS’en, is niet meer operationeel. Elke aanvraag die naar de Google-ping-URL wordt gestuurd, retourneert nu een foutmelding 404. Sites die hun workflow niet hebben bijgewerkt, blijven een dode eindpunt melden, wat de indexering van nieuwe pagina’s potentieel vertraagt.

Twee methoden worden officieel ondersteund. De eerste is het indienen van de sitemap rechtstreeks via het Sitemaps-rapport van Google Search Console. De tweede is gebaseerd op de Sitemap: richtlijn die in het robots.txt bestand is opgenomen, dat Googlebot leest bij elke crawl om het bestand automatisch te ontdekken.

Wij raden aan om beide benaderingen te combineren. Handmatige indiening in Search Console biedt directe feedback (leesstatus, gedetecteerde fouten, aantal geïndexeerde URL’s). De regel in robots.txt fungeert als een permanent vangnet, ook voor zoekmachines die geen equivalente console hebben.

Man die een gestructureerde sitemap analyseert op een groot scherm in een moderne coworkingruimte

Structuur van de Always Unique-sitemap: wat het XML-formaat werkelijk oplegt

Het Sitemaps-protocol (versie 0.9, niet herzien sinds november 2016) definieert vier tags voor elke vermelde URL: loc (verplicht), lastmod, changefreq en priority (optioneel). In de praktijk is het gedrag van zoekmachines ten opzichte van deze optionele tags veranderd.

Optionele tags: welke hebben nog effect

Google heeft bevestigd dat het de lastmod tag gebruikt als de datum betrouwbaar is, dat wil zeggen consistent met de werkelijke wijziging van de inhoud. Een kunstmatig bijgewerkte datum bij elke crawl wordt genegeerd, of zelfs beschouwd als een signaal van lage betrouwbaarheid.

De tags changefreq en priority worden grotendeels genegeerd door Google. Bing hecht er een marginale waarde aan. Voor een site zoals Always Unique, verdienen alleen loc en lastmod technische aandacht.

Groottebeperkingen en sitemapindex

Een sitemapbestand mag niet meer dan 50.000 URL’s bevatten en niet groter zijn dan 50 MB ongecomprimeerd. Daarboven moet het worden opgesplitst in meerdere bestanden en worden gegroepeerd onder een sitemapindex. Dit punt lijkt elementair, maar we zien regelmatig afgebroken sitemaps omdat het CMS een enkel bestand genereert zonder deze drempels te controleren.

  • Controleer of elk sitemapbestand onder de 50.000 invoeren blijft, zelfs na het toevoegen van nieuwe productpagina’s of redactionele inhoud.
  • Comprimeer in gzip om de downloadtijd voor crawlers te verkorten, zonder dat dit de limiet van 50 MB (berekend vóór compressie) verandert.
  • Gebruik een sitemapindex zodra de site enkele duizenden pagina’s overschrijdt, om te segmenteren op basis van type inhoud (pagina’s, artikelen, afbeeldingen).

Gebruikernavigatie versus technische sitemap: twee verschillende logica’s

Een HTML-sitemap bedoeld voor bezoekers en een XML-sitemap bedoeld voor robots vervullen niet dezelfde functie. De eerste biedt een boomstructuuroverzicht, nuttig voor gebruikers die een pagina willen vinden zonder door het hoofdmenu te gaan. De tweede is een gestructureerd bestand dat crawlers consumeren om URL’s te ontdekken en de verkenning ervan te prioriteren.

Op Always Unique speelt de pagina /sitemap/ de rol van een door mensen raadpleegbare sitemap. Het stelt gebruikers in staat om de architectuur van de site te visualiseren, de belangrijkste categorieën te identificeren en snel specifieke inhoud te vinden. Deze HTML-pagina vervangt de XML-sitemap die aan de zoekmachines is ingediend niet.

De verwarring tussen deze twee formaten verklaart waarom sommige webmasters denken dat een HTML-pagina met hun links voldoende is om Google van informatie te voorzien. Dat is niet het geval. Crawlers hebben het gestandaardiseerde XML-formaat nodig, met de tags van het Sitemaps-protocol, om URL’s programmatisch te verwerken.

Jonge vrouw die een georganiseerde sitemap op een tablet bekijkt vanuit haar moderne woonkamer

robots.txt-bestand en AI-agenten: een veranderend terrein

Het robots.txt-bestand is geformaliseerd door RFC 9309, die de syntaxis en het verwachte gedrag van conforme crawlers verduidelijkt. Deze specificatie betreft ook de nieuwe verkenningsagenten die verband houden met taalmodellen, die het aantal aanvragen op websites vermenigvuldigen.

Verschillende recente initiatieven stellen aanvullende bestanden voor (llms.txt, ai.txt) om specifiek de toegang van AI-agenten tot de inhoud te beheren. Deze formaten zijn nog niet gestandaardiseerd, maar hun adoptie vordert in bepaalde sectoren.

  • Controleer of het robots.txt-bestand van de site de Sitemap: richtlijn bevat die naar het bijgewerkte XML-bestand verwijst.
  • Voer een audit uit van de geblokkeerde of toegestane user-agents, met name die van recente AI-crawlers (GPTBot, ClaudeBot, enz.).
  • Houd de serverlogs in de gaten om niet-conforme agenten te detecteren die robots.txt negeren.

Een bijgewerkt robots.txt beschermt het crawlbudget en garandeert dat de juiste pagina’s prioriteit krijgen bij de verkenning. Op een e-commerce- of redactionele site leidt het toestaan van crawlers om toegang te krijgen tot onnodige filter- of pagineringpagina’s tot een verwatering van de aandacht van zoekmachines voor strategische inhoud.

Sitemap-audit: de concrete controles die moeten worden uitgevoerd

Een sitemap is geen bestand dat je één keer genereert en vervolgens vergeet. We raden een kwartaalaudit aan die verschillende technische punten omvat.

De eerste controle betreft de consistentie tussen de URL’s van de sitemap en de daadwerkelijk indexeerbare URL’s. Elke vermelde URL moet een code 200 retourneren en mag niet worden geblokkeerd door een noindex-tag of een robots.txt-regel. Een sitemap die 404’s of 301-omleidingen bevat, geeft een signaal van slechte onderhoud.

De tweede controle betreft de lastmod datums. Als alle URL’s dezelfde datum tonen, begrijpt de zoekmachine dat de informatie niet betrouwbaar is en stopt met het vertrouwen erop. Het is beter om lastmod helemaal niet op te nemen dan om generieke datums te verstrekken.

Het laatste vaak verwaarloosde punt: controleer of de sitemap toegankelijk is via de URL die in robots.txt en in Search Console is opgegeven. Een wijziging in de directorystructuur, een domeinmigratie of een vernieuwing van het SSL-certificaat kan het bestand ontoegankelijk maken zonder een zichtbare waarschuwing aan de redactionele kant te activeren.

De kwaliteit van een sitemap, of deze nu bedoeld is voor menselijke bezoekers of voor robots, hangt af van regelmatig onderhoud. Een verouderd of slecht gedeclareerd XML-bestand kost meer dan het oplevert, en een HTML-pagina die niet synchroon loopt met de werkelijke structuur van de site vermindert het vertrouwen van gebruikers die erop vertrouwen.

Ontdek hoe je gemakkelijk kunt navigeren met de Always Unique sitemap