Rastreador de sites
Rastreie seu site e descubra as páginas dele
Quase ninguém sabe quantas páginas o próprio site realmente tem. Páginas ficam órfãs depois de uma migração, uma série paginada é mais longa do que alguém lembra, uma seção inteira vive atrás de um link que ninguém atualizou. Um rastreador responde a isso percorrendo o site do jeito que um buscador percorre: começa em um endereço, segue o que encontra e mantém registro de tudo que viu.
De onde o rastreador tira suas páginas
Cinco fontes alimentam a fila, e cada URL descoberta registra qual delas a produziu: o endereço que você enviou, os sitemaps XML (incluindo os índices de sitemap, seguidos até os filhos), as declarações do robots.txt, a navegação e o rodapé do site, e os links comuns dentro das páginas já lidas. Uma página alcançável por vários desses caminhos é uma página com que ninguém precisa se preocupar; uma que aparece só num sitemap e em nenhum outro lugar geralmente é.
A ordem é decidida, não é acidental
Quando um site tem mais URLs do que o plano permite, quais páginas são lidas importa mais do que quantas. Cada URL recebe uma prioridade a partir de fatos observáveis: a profundidade em que está, onde o link foi encontrado, o texto âncora dele, quantas páginas internas distintas apontam para ela e se o caminho parece uma série paginada. O resultado é repetível: o mesmo site rastreado duas vezes escolhe as mesmas páginas, e dá para explicar por que cada uma foi escolhida.
Cada página que não foi lida é nomeada, com o motivo
Descobertas, na fila, baixadas, renderizadas, analisadas, bloqueadas, desafiadas e com falha são contadas separadamente, e as URLs que ainda esperavam quando o rastreamento parou também são contadas. Uma página recusada pelo robots.txt, retida atrás de um login, respondendo com um desafio anti-bot, estourando o tempo ou redirecionando para fora do site é registrada com esse motivo exato em vez de ser descartada em silêncio. Um relatório de rastreamento que só mostra o que funcionou está falando de um site diferente do seu.
As URLs são comparadas, não apenas coletadas
Os parâmetros de rastreamento de campanha são removidos antes de comparar dois endereços, então uma página que chega com uma dúzia de tags de campanha é uma página e não uma dúzia. Subdomínios do mesmo domínio registrável contam como parte do site, o que evita que um subdomínio de idioma ou de loja seja confundido com o site de outra pessoa. Depois são comparados o esquema, a variante www, a barra final e as maiúsculas em tudo que foi realmente baixado.
Rastreador ou scanner: qual você quer
O rastreador responde por onde este site pode ser percorrido e quanto dele alcançamos. O scanner responde do que ele é feito: os recursos, as imagens, os cookies, os rastreadores e as tecnologias que as páginas carregam. Um desenha o mapa do terreno, o outro inventaria o que está em cima dele. Quase todo mundo que chega aqui querendo um retrato completo acaba usando os dois, nessa ordem.
O que o rastreamento informa sobre alcance
Cada uma delas é uma verificação real, e todas falam sobre se suas páginas conseguem sequer ser encontradas e lidas.
Coerência da navegação
Compara a navegação de cada página rastreada e confere se as páginas principais estão ligadas a partir dela.
Sitemap XML
Existe um sitemap XML publicado e legível.
robots.txt
Existe um arquivo robots.txt publicado.
Mapa do site em HTML (visitantes)
Procura um mapa do site legível por pessoas. NÃO é o sitemap.xml, auditado pelas verificações de SEO.
Indexação
As páginas analisadas não estão bloqueadas para indexação por uma meta robots.
Consistência das URLs
Compara esquema, variante www, barra final, maiúsculas e parâmetros entre as URLs realmente baixadas.
Respostas de erro
As páginas rastreadas responderam sem erro de servidor.
Cobertura das medições de velocidade
Quanto do inventário de recursos pôde ser medido de fato dentro do limite da análise.
O rastreamento respeita o robots.txt e para no limite de páginas do seu plano, então lê uma parte definida do seu site em vez de tudo, e diz qual parte. Ele nunca faz login, nunca resolve um CAPTCHA e nunca contorna proteção anti-bot: uma página que precisa de sessão real é informada como não analisada, com o motivo.
Digite o endereço do seu site e o VeriFixScan analisa na hora. Sem cadastro, sem instalar nada e sem mexer no seu site.
Perguntas frequentes
- O que é um rastreador de sites?
- Um programa que começa em um endereço, lê a página, segue os links e as entradas de sitemap que encontra, e repete. É assim que um buscador descobre o que um site tem, e é assim que você descobre quais das suas páginas são realmente alcançáveis.
- Como rastreio meu próprio site?
- Você envia seu endereço e o rastreamento começa por ali. Não há arquivo para subir nem nada para instalar: as páginas são lidas por HTTP exatamente como são servidas a qualquer pessoa.
- Ele consegue escanear todas as páginas de um site?
- Ele descobre o que é alcançável a partir do seu endereço de entrada, dos seus sitemaps, do seu robots.txt e da sua navegação, dentro do limite de páginas do seu plano. Uma página sem nenhum link apontando para ela e ausente de todo sitemap não pode ser descoberta por nenhum rastreador, nem pelo nosso, e os números de cobertura dizem até onde o rastreamento chegou de fato.
- O rastreador segue sitemaps e robots.txt?
- Os dois, e por motivos diferentes. Sitemaps e declarações do robots.txt são lidos como fontes de URLs; depois as regras do robots.txt são obedecidas, então um caminho não permitido é registrado como bloqueado em vez de baixado.
- Ele rastreia subdomínios?
- Subdomínios do mesmo domínio registrável são tratados como parte do seu site, então um subdomínio de loja ou de idioma é seguido em vez de descartado como externo. Domínios de terceiros nunca são rastreados.
- Ele rastreia sites de outras pessoas?
- Ele rastreia o endereço que você envia. Links apontando para outros domínios são verificados como links, então um link morto é informado, mas essas páginas não são rastreadas nem analisadas.
- O que acontece quando uma página não pode ser lida?
- O rastreamento segue em frente na hora e registra o motivo: robots não permitido, exige login, proteção anti-bot, um 403, um 429, tempo esgotado, um erro de rede ou um redirecionamento para fora do site. O resto da análise é concluído e informado com essas páginas listadas.
- Qual a diferença entre rastrear e escanear?
- Rastrear descobre e alcança páginas; escanear inventaria o que essas páginas contêm. Esta página cobre o primeiro, o scanner de sites cobre o segundo, e uma auditoria completa roda os dois sobre o mesmo rastreamento.
- Posso rastrear meu site de graça?
- A análise gratuita rastreia uma amostra do seu site sem conta. Um limite de páginas maior, e portanto um rastreamento mais profundo, vem com um plano.
