Skip to content

Descubra como navegar facilmente com o mapa do site Always Unique

Um sitemap XML corretamente estruturado não garante nada se não for declarado aos motores de busca pelos canais adequados. Desde que o Google…

Femme naviguant facilement sur un plan de site web depuis un ordinateur portable dans un bureau à domicile

Um sitemap XML corretamente estruturado não garante nada se não for declarado aos motores de busca pelos canais adequados. Desde que o Google depreciou o endpoint de ping dos sitemaps, muitos sites continuam a chamar uma URL que retorna um código 404, sem que suas equipes percebam. Compreender como funciona o sitemap Always Unique pressupõe, primeiro, dominar esse contexto técnico, onde a simples existência de um arquivo sitemap não é mais suficiente para garantir a descoberta das páginas.

Declaração do sitemap: robots.txt e Search Console como os únicos canais confiáveis

O antigo mecanismo de ping, amplamente integrado nos plugins de SEO dos CMS, tornou-se inoperante. Qualquer solicitação enviada para a URL de ping do Google agora retorna um erro 404. Os sites que não atualizaram seu fluxo de trabalho continuam a notificar um endpoint morto, o que potencialmente atrasa a indexação de novas páginas.

Duas métodos permanecem oficialmente suportados. O primeiro consiste em enviar o sitemap diretamente através do relatório Sitemaps do Google Search Console. O segundo se baseia na diretiva Sitemap: inserida no arquivo robots.txt, que o Googlebot lê a cada rastreamento para descobrir automaticamente o arquivo.

Recomendamos combinar as duas abordagens. A submissão manual no Search Console oferece um retorno imediato (status de leitura, erros detectados, número de URLs indexadas). A linha no robots.txt atua como uma rede de segurança permanente, incluindo para motores que não possuem um console equivalente.

Homem analisando um sitemap estruturado em uma grande tela em um espaço de coworking moderno

Estrutura do sitemap Always Unique: o que o formato XML realmente impõe

O protocolo Sitemaps (versão 0.9, não revisado desde novembro de 2016) define quatro tags para cada URL listada: loc (obrigatória), lastmod, changefreq e priority (opcionais). Na prática, o comportamento dos motores em relação a essas tags opcionais mudou.

Tags opcionais: quais ainda têm efeito

O Google confirmou que usa a tag lastmod se a data for confiável, ou seja, consistente com a modificação real do conteúdo. Uma data artificialmente atualizada a cada rastreamento será ignorada, ou até considerada um sinal de baixa confiabilidade.

As tags changefreq e priority são amplamente ignoradas pelo Google. O Bing lhes atribui um peso marginal. Para um site como o Always Unique, apenas loc e lastmod merecem atenção técnica.

Limite de tamanho e sitemap index

Um arquivo sitemap não pode exceder 50.000 URLs nem pesar mais de 50 MB não compactados. Além disso, é necessário dividir em vários arquivos e agrupá-los sob um sitemap index. Este ponto parece elementar, mas observamos regularmente sitemaps truncados porque o CMS gera um único arquivo sem verificar esses limites.

  • Verificar se cada arquivo sitemap permanece abaixo de 50.000 entradas, mesmo após a adição de novas páginas de produtos ou conteúdos editoriais.
  • Compactar em gzip para reduzir o tempo de download pelos crawlers, sem que isso modifique o limite de 50 MB (calculado antes da compressão).
  • Utilizar um sitemap index assim que o site ultrapassar alguns milhares de páginas, a fim de segmentar por tipo de conteúdo (páginas, artigos, imagens).

Navegação do usuário versus sitemap técnico: duas lógicas distintas

Um sitemap HTML destinado aos visitantes e um sitemap XML destinado aos robôs não desempenham a mesma função. O primeiro oferece uma visão geral em árvore, útil para os usuários que buscam uma página sem passar pelo menu principal. O segundo é um arquivo estruturado que os crawlers consomem para descobrir e priorizar a exploração das URLs.

No Always Unique, a página /sitemap/ desempenha o papel de sitemap consultável por um humano. Ela permite visualizar a arquitetura do site, identificar as categorias principais e localizar rapidamente um conteúdo específico. Esta página HTML não substitui o sitemap XML enviado aos motores.

A confusão entre esses dois formatos explica por que alguns webmasters pensam que uma página HTML listando seus links é suficiente para alimentar o Google. Não é o caso. Os crawlers precisam do formato XML padronizado, com as tags do protocolo Sitemaps, para processar as URLs de forma programática.

Jovem mulher consultando um sitemap organizado em um tablet em sua sala contemporânea

Arquivo robots.txt e agentes de IA: um terreno em mutação

O arquivo robots.txt foi formalizado pela RFC 9309, que esclarece a sintaxe e o comportamento esperado dos crawlers conformes. Esta especificação também se aplica aos novos agentes de exploração relacionados aos modelos de linguagem, que multiplicam as solicitações nos sites.

Várias iniciativas recentes propõem arquivos complementares (llms.txt, ai.txt) para gerenciar especificamente o acesso dos agentes de IA ao conteúdo. Esses formatos ainda não estão padronizados, mas sua adoção avança em alguns setores.

  • Verificar se o robots.txt do site inclui a diretiva Sitemap: apontando para o arquivo XML atualizado.
  • Auditar os user-agents bloqueados ou autorizados, especialmente aqueles dos crawlers de IA recentes (GPTBot, ClaudeBot, etc.).
  • Monitorar os logs do servidor para detectar agentes não conformes que ignoram o robots.txt.

Um robots.txt atualizado protege o orçamento de rastreamento e garante que as páginas corretas sejam exploradas em prioridade. Em um site de e-commerce ou editorial, permitir que os crawlers acessem páginas de filtragem ou paginação desnecessárias dilui a atenção dos motores sobre os conteúdos estratégicos.

Auditoria do sitemap: as verificações concretas a serem realizadas

Um sitemap não é um arquivo que se gera uma vez para esquecer. Recomendamos uma auditoria trimestral cobrindo vários pontos técnicos.

O primeiro controle diz respeito à coerência entre as URLs do sitemap e aquelas realmente indexáveis. Cada URL listada deve retornar um código 200 e não deve ser bloqueada por uma tag noindex ou uma regra robots.txt. Um sitemap que contém 404 ou redirecionamentos 301 envia um sinal de má manutenção.

O segundo controle diz respeito às datas lastmod. Se todas as URLs exibem a mesma data, o motor entende que a informação não é confiável e para de confiar nela. É melhor não incluir lastmod do que fornecer datas genéricas.

O último ponto frequentemente negligenciado: verificar se o sitemap está realmente acessível na URL declarada no robots.txt e no Search Console. Uma mudança na estrutura de diretórios, uma migração de domínio ou uma renovação de certificado SSL podem tornar o arquivo inacessível sem disparar um alerta visível do lado editorial.

A qualidade de um sitemap, seja destinado a visitantes humanos ou robôs, depende de sua manutenção regular. Um arquivo XML obsoleto ou mal declarado custa mais do que traz, e uma página HTML desincronizada da árvore real do site degrada a confiança dos usuários que a consultam.

Descubra como navegar facilmente com o mapa do site Always Unique