Este guia cobre como um crawler decide o que visitar, os principais que passam pelo seu site além do Google e como controlar o que eles acessam.
O que é um crawler?
O nome vem do verbo em inglês "to crawl", rastejar, porque o programa se move pela web de link em link, como alguém percorrendo um labirinto sem mapa prévio. Ele começa por um conjunto de páginas conhecidas, lê o conteúdo, extrai os links encontrados ali e visita cada um deles, repetindo o processo indefinidamente.
Também é chamado de spider, bot ou robô de busca, dependendo de quem descreve. Todos se referem ao mesmo tipo de programa: automatizado, que não clica em nada por decisão própria além de seguir links, e que roda em escala muito maior do que qualquer navegação humana conseguiria.
Como um crawler decide o que visitar?
Quatro fatores, entre outros, pesam na decisão de um crawler moderno:
- Links recebidos. Uma página com mais links apontando para ela, de fontes variadas, tende a ser visitada com mais frequência. Uma página citada em vários posts do blog espera menos que uma linkada só no rodapé.
- Sitemap. Um sitemap bem estruturado informa diretamente ao crawler quais páginas existem, reduzindo a dependência de descobrir tudo só seguindo links.
- Frequência de atualização. Páginas que mudam com frequência tendem a ser revisitadas mais vezes do que páginas estáticas que não mudam há anos.
- Permissão declarada. O arquivo robots.txt do site diz explicitamente quais áreas o crawler pode ou não acessar, e um crawler que segue as regras respeita essa instrução antes de decidir visitar.
Vale notar que "poder visitar" e "escolher visitar" são coisas diferentes. Um crawler com permissão para acessar uma página ainda pode decidir não priorizá-la, se ela parecer pouco relevante ou raramente muda.
Quais são os principais crawlers que visitam um site?
Além do Googlebot, vários outros passam por um site com frequência, cada um com propósito diferente:
Crawler | Empresa | Propósito |
|---|---|---|
Googlebot | alimentar o índice de busca | |
Bingbot | Microsoft | alimentar o índice do Bing |
GPTBot | OpenAI | coletar conteúdo para treinar modelos |
PerplexityBot | Perplexity | alimentar o índice usado nas respostas com citação |
ClaudeBot | Anthropic | coletar conteúdo para treinar os modelos Claude |
Fonte: documentação pública de cada empresa sobre seus robôs (Google Search Central, OpenAI, Perplexity, Anthropic), consultada em setembro de 2026.
A distinção importa na hora de configurar o robots.txt: bloquear um crawler de treinamento de IA não afeta o rastreamento do Googlebot, e vice-versa. Cada regra no arquivo precisa mirar o robô certo pelo nome exato dele.
O que é orçamento de rastreamento?
Orçamento de rastreamento é o limite de páginas que um crawler está disposto a visitar num site dentro de um período, definido por dois fatores: a capacidade do servidor de responder rápido sem sobrecarregar, e o quanto o buscador considera aquele site relevante o suficiente para gastar mais tempo rastreando.
Sites pequenos raramente sentem esse limite na prática, porque têm poucas páginas para rastrear. Sites grandes, com milhares ou milhões de páginas, precisam se preocupar com isso: se o orçamento não for suficiente para cobrir tudo, páginas menos relevantes podem nunca ser visitadas, ou ser visitadas com pouca frequência.
Como controlar o que um crawler acessa?
Três ferramentas resolvem a maior parte do controle:
O arquivo robots.txt. Fica na raiz do site e declara, por robô, quais áreas podem ou não ser acessadas. É a primeira coisa que um crawler bem-comportado verifica antes de rastrear qualquer página.
A tag noindex. Diferente do robots.txt, que impede o acesso, a tag noindex permite o acesso mas instrui o buscador a não incluir aquela página específica no índice.
O sitemap.xml. Funciona ao contrário das duas anteriores: em vez de restringir, ele aponta ativamente quais páginas existem e merecem ser visitadas, o que ajuda especialmente sites grandes ou recém-lançados.
Por que um crawler ignora uma página mesmo com permissão?
Permissão técnica e prioridade de visita são coisas diferentes, e essa distinção explica boa parte das dúvidas sobre página que "devia estar sendo rastreada e não está".
Página órfã, sem nenhum link interno apontando para ela. Um crawler descobre conteúdo principalmente seguindo links. Uma página que só existe porque foi enviada manualmente no sitemap, sem nenhum link de outra página do site levando até ela, é rastreada com menos prioridade do que uma página bem conectada à estrutura do site.
Conteúdo muito parecido com algo que já foi rastreado. Se o crawler já visitou dezenas de páginas quase idênticas dentro do mesmo site, a prioridade de visitar mais uma parecida cai, porque o retorno esperado daquela visita é baixo.
Profundidade de cliques a partir da home. Uma página que exige muitos cliques a partir da página inicial para ser alcançada tende a ser rastreada com menos frequência do que uma página perto da home, porque a estrutura de links sinaliza menor importância relativa.
Histórico do domínio como um todo. Um domínio novo, ou um domínio com histórico de conteúdo de baixa qualidade, tende a receber visitas mais espaçadas até construir um histórico que justifique rastreamento mais frequente.
Servidor lento afeta o comportamento do crawler?
Afeta, e de um jeito que poucos sites monitoram. Um crawler ajusta a velocidade com que faz requisições ao servidor conforme a resposta que recebe: se o servidor demora para responder ou retorna erro com frequência, o crawler reduz o ritmo de visitas para não sobrecarregar ainda mais o site, o que na prática reduz o orçamento de rastreamento efetivo disponível.
Isso cria um ciclo que pode passar despercebido: site lento recebe menos visita de crawler, o que atrasa a descoberta de conteúdo novo, o que é frequentemente confundido com "o Google não gosta do meu site" quando o problema real é desempenho do servidor. Monitorar o relatório de estatísticas de rastreamento no Search Console, que mostra tempo médio de resposta do servidor ao longo do tempo, ajuda a identificar esse tipo de problema antes que ele afete a indexação de conteúdo novo.
Mais dúvidas práticas sobre crawler
Um site novo demora mais para ser rastreado pela primeira vez? Costuma demorar mais, sim, porque o crawler ainda não tem histórico daquele domínio para decidir a prioridade de visita. Enviar o sitemap logo após o lançamento e garantir pelo menos um link externo apontando para o site ajudam a acelerar essa primeira descoberta.
Um site pode bloquear todos os crawlers de uma vez? Pode, com uma regra no robots.txt que mira todos os robôs ao mesmo tempo, mas isso também bloqueia o rastreamento para busca, o que tira o site inteiro da possibilidade de aparecer em qualquer buscador. Essa configuração só faz sentido para ambientes que realmente não deveriam ser públicos, como um site de teste em desenvolvimento, nunca para um site que depende de tráfego de busca.
Vale a pena pagar para um crawler visitar meu site com mais frequência? Não existe forma de pagar diretamente por rastreamento mais frequente nos grandes buscadores. O caminho legítimo para aumentar a frequência é indireto: publicar com regularidade, manter o servidor rápido e ganhar mais links de qualidade apontando para o site, sinais que naturalmente levam o crawler a visitar com mais atenção ao longo do tempo.
Conclusão
Crawler é o programa que descobre e lê conteúdo na web seguindo links, e cada empresa de busca ou de IA mantém o seu próprio, com nome e regra específicos. Controlar o que cada um acessa é uma questão de configurar robots.txt, noindex e sitemap corretamente, não de bloquear tudo por precaução. O próximo passo é conferir o robots.txt do seu site e confirmar que ele libera os crawlers que você quer e restringe só o que realmente precisa ser restrito.




