Pular para o conteúdo
iLoveSEOCriar conta

Crawler: o que é e como ele decide o que rastrear no seu site

Crawler é um programa automatizado que visita páginas na web seguindo links, de uma página para outra, para descobrir e ler conteúdo. Buscadores usam crawlers para construir seu índice, e cada empresa de busca ou de IA mantém o seu próprio, com nome e comportamento diferentes. Este guia é sobre o conceito de crawler em geral; para o robô específico do Google, veja o guia de [Googlebot](https://iloveseo.com.br/blog/googlebot).

Ilustração retrô de uma aranha mecânica de lata andando por uma teia de fios esticados entre vários quadros pendurados na parede

Este guia cobre como um crawler decide o que visitar, os principais que passam pelo seu site além do Google e como controlar o que eles acessam.

O que é um crawler?

O nome vem do verbo em inglês "to crawl", rastejar, porque o programa se move pela web de link em link, como alguém percorrendo um labirinto sem mapa prévio. Ele começa por um conjunto de páginas conhecidas, lê o conteúdo, extrai os links encontrados ali e visita cada um deles, repetindo o processo indefinidamente.

Também é chamado de spider, bot ou robô de busca, dependendo de quem descreve. Todos se referem ao mesmo tipo de programa: automatizado, que não clica em nada por decisão própria além de seguir links, e que roda em escala muito maior do que qualquer navegação humana conseguiria.

Como um crawler decide o que visitar?

Quatro fatores, entre outros, pesam na decisão de um crawler moderno:

  • Links recebidos. Uma página com mais links apontando para ela, de fontes variadas, tende a ser visitada com mais frequência. Uma página citada em vários posts do blog espera menos que uma linkada só no rodapé.
  • Sitemap. Um sitemap bem estruturado informa diretamente ao crawler quais páginas existem, reduzindo a dependência de descobrir tudo só seguindo links.
  • Frequência de atualização. Páginas que mudam com frequência tendem a ser revisitadas mais vezes do que páginas estáticas que não mudam há anos.
  • Permissão declarada. O arquivo robots.txt do site diz explicitamente quais áreas o crawler pode ou não acessar, e um crawler que segue as regras respeita essa instrução antes de decidir visitar.

Vale notar que "poder visitar" e "escolher visitar" são coisas diferentes. Um crawler com permissão para acessar uma página ainda pode decidir não priorizá-la, se ela parecer pouco relevante ou raramente muda.

Quais são os principais crawlers que visitam um site?

Além do Googlebot, vários outros passam por um site com frequência, cada um com propósito diferente:

Crawler

Empresa

Propósito

Googlebot

Google

alimentar o índice de busca

Bingbot

Microsoft

alimentar o índice do Bing

GPTBot

OpenAI

coletar conteúdo para treinar modelos

PerplexityBot

Perplexity

alimentar o índice usado nas respostas com citação

ClaudeBot

Anthropic

coletar conteúdo para treinar os modelos Claude

Fonte: documentação pública de cada empresa sobre seus robôs (Google Search Central, OpenAI, Perplexity, Anthropic), consultada em setembro de 2026.

A distinção importa na hora de configurar o robots.txt: bloquear um crawler de treinamento de IA não afeta o rastreamento do Googlebot, e vice-versa. Cada regra no arquivo precisa mirar o robô certo pelo nome exato dele.

O que é orçamento de rastreamento?

Orçamento de rastreamento é o limite de páginas que um crawler está disposto a visitar num site dentro de um período, definido por dois fatores: a capacidade do servidor de responder rápido sem sobrecarregar, e o quanto o buscador considera aquele site relevante o suficiente para gastar mais tempo rastreando.

Sites pequenos raramente sentem esse limite na prática, porque têm poucas páginas para rastrear. Sites grandes, com milhares ou milhões de páginas, precisam se preocupar com isso: se o orçamento não for suficiente para cobrir tudo, páginas menos relevantes podem nunca ser visitadas, ou ser visitadas com pouca frequência.

Como controlar o que um crawler acessa?

Três ferramentas resolvem a maior parte do controle:

O arquivo robots.txt. Fica na raiz do site e declara, por robô, quais áreas podem ou não ser acessadas. É a primeira coisa que um crawler bem-comportado verifica antes de rastrear qualquer página.

A tag noindex. Diferente do robots.txt, que impede o acesso, a tag noindex permite o acesso mas instrui o buscador a não incluir aquela página específica no índice.

O sitemap.xml. Funciona ao contrário das duas anteriores: em vez de restringir, ele aponta ativamente quais páginas existem e merecem ser visitadas, o que ajuda especialmente sites grandes ou recém-lançados.

Por que um crawler ignora uma página mesmo com permissão?

Permissão técnica e prioridade de visita são coisas diferentes, e essa distinção explica boa parte das dúvidas sobre página que "devia estar sendo rastreada e não está".

Página órfã, sem nenhum link interno apontando para ela. Um crawler descobre conteúdo principalmente seguindo links. Uma página que só existe porque foi enviada manualmente no sitemap, sem nenhum link de outra página do site levando até ela, é rastreada com menos prioridade do que uma página bem conectada à estrutura do site.

Conteúdo muito parecido com algo que já foi rastreado. Se o crawler já visitou dezenas de páginas quase idênticas dentro do mesmo site, a prioridade de visitar mais uma parecida cai, porque o retorno esperado daquela visita é baixo.

Profundidade de cliques a partir da home. Uma página que exige muitos cliques a partir da página inicial para ser alcançada tende a ser rastreada com menos frequência do que uma página perto da home, porque a estrutura de links sinaliza menor importância relativa.

Histórico do domínio como um todo. Um domínio novo, ou um domínio com histórico de conteúdo de baixa qualidade, tende a receber visitas mais espaçadas até construir um histórico que justifique rastreamento mais frequente.

Servidor lento afeta o comportamento do crawler?

Afeta, e de um jeito que poucos sites monitoram. Um crawler ajusta a velocidade com que faz requisições ao servidor conforme a resposta que recebe: se o servidor demora para responder ou retorna erro com frequência, o crawler reduz o ritmo de visitas para não sobrecarregar ainda mais o site, o que na prática reduz o orçamento de rastreamento efetivo disponível.

Isso cria um ciclo que pode passar despercebido: site lento recebe menos visita de crawler, o que atrasa a descoberta de conteúdo novo, o que é frequentemente confundido com "o Google não gosta do meu site" quando o problema real é desempenho do servidor. Monitorar o relatório de estatísticas de rastreamento no Search Console, que mostra tempo médio de resposta do servidor ao longo do tempo, ajuda a identificar esse tipo de problema antes que ele afete a indexação de conteúdo novo.

Mais dúvidas práticas sobre crawler

Um site novo demora mais para ser rastreado pela primeira vez? Costuma demorar mais, sim, porque o crawler ainda não tem histórico daquele domínio para decidir a prioridade de visita. Enviar o sitemap logo após o lançamento e garantir pelo menos um link externo apontando para o site ajudam a acelerar essa primeira descoberta.

Um site pode bloquear todos os crawlers de uma vez? Pode, com uma regra no robots.txt que mira todos os robôs ao mesmo tempo, mas isso também bloqueia o rastreamento para busca, o que tira o site inteiro da possibilidade de aparecer em qualquer buscador. Essa configuração só faz sentido para ambientes que realmente não deveriam ser públicos, como um site de teste em desenvolvimento, nunca para um site que depende de tráfego de busca.

Vale a pena pagar para um crawler visitar meu site com mais frequência? Não existe forma de pagar diretamente por rastreamento mais frequente nos grandes buscadores. O caminho legítimo para aumentar a frequência é indireto: publicar com regularidade, manter o servidor rápido e ganhar mais links de qualidade apontando para o site, sinais que naturalmente levam o crawler a visitar com mais atenção ao longo do tempo.

Conclusão

Crawler é o programa que descobre e lê conteúdo na web seguindo links, e cada empresa de busca ou de IA mantém o seu próprio, com nome e regra específicos. Controlar o que cada um acessa é uma questão de configurar robots.txt, noindex e sitemap corretamente, não de bloquear tudo por precaução. O próximo passo é conferir o robots.txt do seu site e confirmar que ele libera os crawlers que você quer e restringe só o que realmente precisa ser restrito.

Perguntas frequentes

Todo crawler respeita o robots.txt?

Crawlers de empresas sérias e conhecidas costumam respeitar, porque isso faz parte da convenção que sustenta a própria internet aberta. Existem crawlers maliciosos, usados para coletar dado sem permissão, que ignoram essas regras, mas eles não representam os grandes buscadores nem as principais empresas de IA.

Meu site pequeno precisa se preocupar com orçamento de rastreamento?

Raramente, e a documentação do Google reserva o tema para sites grandes ou com conteúdo que muda todo dia. Em site pequeno, o que parece limite de orçamento quase sempre é outra coisa: página órfã sem link interno, servidor lento ou bloqueio esquecido no robots.txt, que são os três pontos a conferir antes de pensar em orçamento.

Como sei quais crawlers estão visitando meu site?

Os logs de acesso do servidor registram cada visita de crawler, identificado pelo user agent que ele declara. Ferramentas de análise de log ajudam a visualizar isso sem precisar ler linha por linha manualmente.

Bloquear um crawler de IA no robots.txt afeta minha posição na busca?

Não afeta o Googlebot nem o rastreamento para busca, porque são robôs diferentes com regras próprias no arquivo. A decisão de bloquear um crawler de treinamento de IA é sobre uso de conteúdo para treinar modelos, não sobre aparecer nos resultados de busca.

Um crawler consegue preencher formulário ou fazer login num site?

Os crawlers usados por buscadores e por empresas de IA para indexação não preenchem formulário nem fazem login, porque o objetivo é ler conteúdo público, não interagir com o site. Existem outros tipos de automação, usados para teste de software ou para fins maliciosos, que fazem esse tipo de interação, mas eles não são os robôs discutidos neste guia.

Existe diferença entre crawler e scraper?

Existe, embora as duas palavras às vezes sejam usadas como sinônimo. Crawler descreve o programa que navega de link em link para descobrir conteúdo, geralmente a serviço de um índice de busca. Scraper descreve um programa focado em extrair dado específico de páginas já conhecidas, sem necessariamente navegar seguindo links, usado tanto para fins legítimos quanto para coleta sem permissão.

Voltar para o blog