Eine korrekt strukturierte XML-Sitemap garantiert nichts, wenn sie nicht über die richtigen Kanäle bei den Suchmaschinen angemeldet wird. Seit Google den Ping-Endpunkt für Sitemaps abgeschafft hat, rufen viele Websites weiterhin eine URL auf, die einen 404-Code zurückgibt, ohne dass ihre Teams es bemerken. Um zu verstehen, wie die Sitemap von Always Unique funktioniert, muss man zunächst diesen technischen Kontext beherrschen, in dem die bloße Existenz einer Sitemap-Datei nicht mehr ausreicht, um die Entdeckung der Seiten zu gewährleisten.
Einreichung der Sitemap: robots.txt und Search Console als einzige zuverlässige Übertragungswege
Der alte Ping-Mechanismus, der weitgehend in die SEO-Plugins der CMS integriert war, ist nicht mehr funktionsfähig. Jede Anfrage an die Google-Ping-URL gibt jetzt einen 404-Fehler zurück. Websites, die ihren Workflow nicht aktualisiert haben, benachrichtigen weiterhin über einen toten Endpunkt, was potenziell die Indizierung neuer Seiten verzögert.
Offiziell werden zwei Methoden unterstützt. Die erste besteht darin, die Sitemap direkt über den Sitemaps-Bericht von Google Search Console einzureichen. Die zweite basiert auf der Sitemap:-Anweisung, die in die robots.txt-Datei eingefügt wird, die Googlebot bei jedem Crawl liest, um die Datei automatisch zu entdecken.
Wir empfehlen, beide Ansätze zu kombinieren. Die manuelle Einreichung in der Search Console bietet sofortiges Feedback (Lese-Status, erkannte Fehler, Anzahl der indizierten URLs). Die Zeile in robots.txt fungiert als permanentes Sicherheitsnetz, auch für Suchmaschinen, die über keine entsprechende Konsole verfügen.

Struktur der Always Unique Sitemap: was das XML-Format tatsächlich vorschreibt
Das Sitemap-Protokoll (Version 0.9, seit November 2016 nicht überarbeitet) definiert vier Tags für jede aufgelistete URL: loc (obligatorisch), lastmod, changefreq und priority (optional). In der Praxis hat sich das Verhalten der Suchmaschinen gegenüber diesen optionalen Tags geändert.
Optionale Tags: welche haben noch einen Effekt
Google hat bestätigt, dass es das Tag lastmod verwendet, wenn das Datum zuverlässig ist, das heißt, mit der tatsächlichen Änderung des Inhalts übereinstimmt. Ein künstlich bei jedem Crawl aktualisiertes Datum wird ignoriert oder sogar als Signal geringer Zuverlässigkeit betrachtet.
Die Tags changefreq und priority werden von Google weitgehend ignoriert. Bing räumt ihnen ein marginales Gewicht ein. Für eine Website wie Always Unique verdienen nur loc und lastmod technische Aufmerksamkeit.
Größenbeschränkung und Sitemap-Index
Eine Sitemap-Datei darf 50.000 URLs nicht überschreiten und nicht mehr als 50 MB unkomprimiert wiegen. Darüber hinaus muss sie in mehrere Dateien aufgeteilt und unter einem Sitemap-Index zusammengefasst werden. Dieser Punkt scheint elementar, aber wir beobachten regelmäßig abgeschnittene Sitemaps, weil das CMS eine einzige Datei generiert, ohne diese Schwellenwerte zu überprüfen.
- Überprüfen, dass jede Sitemap-Datei unter 50.000 Einträgen bleibt, selbst nach Hinzufügen neuer Produktseiten oder redaktioneller Inhalte.
- In gzip komprimieren, um die Download-Zeit für die Crawler zu reduzieren, ohne dass dies die 50-MB-Grenze (berechnet vor der Kompression) ändert.
- Einen Sitemap-Index verwenden, sobald die Website einige Tausend Seiten überschreitet, um nach Inhaltstyp (Seiten, Artikel, Bilder) zu segmentieren.
Nutzer-Navigation versus technische Sitemap: zwei unterschiedliche Logiken
Eine HTML-Sitemap, die für Besucher gedacht ist, und eine XML-Sitemap, die für Roboter gedacht ist, erfüllen nicht dieselbe Funktion. Die erste bietet eine baumartige Übersicht, die nützlich ist für Benutzer, die eine Seite suchen, ohne über das Hauptmenü zu gehen. Die zweite ist eine strukturierte Datei, die von den Crawlern konsumiert wird, um URLs zu entdecken und die Erkundung zu priorisieren.
Auf Always Unique spielt die Seite /sitemap/ die Rolle einer für Menschen durchsuchbaren Sitemap. Sie ermöglicht es, die Architektur der Website zu visualisieren, die Hauptkategorien zu identifizieren und schnell einen bestimmten Inhalt zu finden. Diese HTML-Seite ersetzt nicht die XML-Sitemap, die den Suchmaschinen übermittelt wird.
Die Verwirrung zwischen diesen beiden Formaten erklärt, warum einige Webmaster denken, dass eine HTML-Seite, die ihre Links auflistet, ausreicht, um Google zu füttern. Das ist nicht der Fall. Die Crawler benötigen das standardisierte XML-Format mit den Tags des Sitemap-Protokolls, um die URLs programmatisch zu verarbeiten.

robots.txt-Datei und KI-Agenten: ein sich veränderndes Terrain
Die robots.txt-Datei wurde durch die RFC 9309 formalisiert, die die Syntax und das erwartete Verhalten konformer Crawler klärt. Diese Spezifikation betrifft auch die neuen Crawling-Agenten, die mit Sprachmodellen verbunden sind und die Anfragen auf Websites vervielfachen.
Mehrere aktuelle Initiativen schlagen ergänzende Dateien (llms.txt, ai.txt) vor, um den Zugriff von KI-Agenten auf Inhalte spezifisch zu verwalten. Diese Formate sind noch nicht standardisiert, aber ihre Akzeptanz nimmt in bestimmten Sektoren zu.
- Überprüfen, dass die robots.txt der Website die
Sitemap:-Anweisung enthält, die auf die aktuelle XML-Datei verweist. - Die blockierten oder erlaubten User-Agents auditiert, insbesondere die der neuen KI-Crawler (GPTBot, ClaudeBot usw.).
- Die Server-Logs überwachen, um nicht konforme Agenten zu erkennen, die robots.txt ignorieren.
Eine aktuelle robots.txt schützt das Crawl-Budget und stellt sicher, dass die richtigen Seiten prioritär erkundet werden. Auf einer E-Commerce- oder redaktionellen Website verringert es die Aufmerksamkeit der Suchmaschinen auf strategische Inhalte, wenn die Crawler auf unnötige Filter- oder Paginierungsseiten zugreifen können.
Audit der Sitemap: die konkreten Überprüfungen, die durchgeführt werden müssen
Eine Sitemap ist keine Datei, die man einmal generiert und dann vergisst. Wir empfehlen ein vierteljährliches Audit, das mehrere technische Punkte abdeckt.
Die erste Kontrolle betrifft die Konsistenz zwischen den URLs der Sitemap und den tatsächlich indexierbaren. Jede aufgelistete URL muss einen 200-Code zurückgeben und darf nicht durch ein noindex-Tag oder eine robots.txt-Regel blockiert sein. Eine Sitemap, die 404 oder 301-Weiterleitungen enthält, sendet ein Signal schlechter Wartung.
Die zweite Kontrolle betrifft die lastmod-Daten. Wenn alle URLs dasselbe Datum anzeigen, versteht die Suchmaschine, dass die Information nicht zuverlässig ist und hört auf, ihr zu vertrauen. Es ist besser, lastmod überhaupt nicht einzuschließen, als generische Daten bereitzustellen.
Der letzte oft vernachlässigte Punkt: Überprüfen, dass die Sitemap unter der in robots.txt und in der Search Console angegebenen URL tatsächlich zugänglich ist. Eine Änderung der Verzeichnisstruktur, eine Domainmigration oder eine Erneuerung des SSL-Zertifikats können die Datei unzugänglich machen, ohne dass eine sichtbare Warnung auf der redaktionellen Seite ausgelöst wird.
Die Qualität einer Sitemap, sei sie für menschliche Besucher oder für Roboter gedacht, hängt von ihrer regelmäßigen Wartung ab. Eine veraltete oder schlecht deklarierte XML-Datei kostet mehr, als sie einbringt, und eine HTML-Seite, die nicht mit der tatsächlichen Struktur der Website synchronisiert ist, verringert das Vertrauen der Benutzer, die sich darauf beziehen.



