6 min de leituraEngenharia

Crawlers de IA e Links Curtos: O Que os Bots Realmente Fazem

Crawlers de treinamento, buscadores em tempo real e bots de busca acessam seus redirecionamentos. Quais seguem um 301, quanto custam a sua contagem de cliques, e quais deixar passar.

Marius Voß
DevRel · edge infra
Três classes de agente automatizado acessando um link curto, com o crawler de treinamento, o buscador em tempo real e o indexador de busca sendo tratados de forma diferente

Três tipos diferentes de agente automatizado acessam seus links, e cada um quer algo diferente. Um está coletando texto para treinar um modelo. Um está buscando uma página agora mesmo porque uma pessoa fez uma pergunta. Um está construindo um índice de busca. Eles chegam com User-Agents diferentes, respeitam regras diferentes e merecem respostas diferentes.

Um domínio de redirecionamento é um alvo incomum para apontá-los, porque não tem conteúdo. Cada requisição é uma consulta e um cabeçalho Location, então um crawler de treinamento não ganha nada útil e um buscador em tempo real ganha apenas um salto extra a caminho da página que queria. Essa assimetria é o que torna a decisão de política direta assim que você separa as classes. Se você está olhando para o lado de marketing disso em vez da parte técnica, answer engine optimization cobre o que realmente faz uma página ser citada.

Três Classes, Não Uma

Crawlers de treinamento. Estes coletam conteúdo para treinar modelos. A OpenAI documenta seus bots com um User-Agent separado para cada função, e a Anthropic documenta seu crawler e as regras que ele segue no mesmo espírito. O Google trata o equivalente através de um token de robots em vez de um crawler distinto, o que sua visão geral de crawlers descreve ao lado dos agentes de busca.

Buscadores em tempo real. Estes atuam quando uma pessoa pergunta algo a um assistente e o assistente decide ler uma página. A Perplexity documenta essa divisão explicitamente, com um agente para indexação e outro para a requisição acionada pelo usuário. Essa distinção importa mais do que qualquer outro ponto deste artigo: uma busca em tempo real é uma pessoa, a apenas um passo de distância.

Indexadores de busca. A classe mais antiga, e aquela cujo comportamento em relação a redirecionamentos é mais bem compreendido. Eles seguem um redirecionamento permanente, atribuem o conteúdo ao destino e tratam o domínio curto como uma placa de sinalização.

Mesma infraestrutura, três propósitos. Uma regra genérica para todos eles quase sempre é a decisão errada.

O Que Acontece Quando Um Deles Acessa um Redirecionamento

A mecânica não tem nada de especial. O agente requisita a URL curta, o redirecionamento responde com um 301 ou 302 e um cabeçalho Location, e o agente o segue, se é que segue redirecionamentos. A semântica HTTP para redirecionamento não mudou por causa disso, e não há tratamento especial para agentes de IA em nenhum lugar do padrão.

Duas consequências decorrem disso. O domínio curto vê uma requisição que não é uma pessoa, então ela entra nos seus dados de clique a menos que algo a filtre. E o destino vê o que quer que o agente faça em seguida, o que, para um buscador em tempo real, é uma leitura normal da página.

A parte que as pessoas erram é em qual host as regras vivem. A RFC 9309 define o robots.txt como delimitado a uma autoridade: esquema, host e porta. As regras em example.com/robots.txt governam example.com e nada mais. Seu domínio de redirecionamento é um host diferente, então precisa do seu próprio arquivo, servido por quem quer que responda nesse host. Muitos domínios de link curto não servem robots.txt algum, o que os agentes interpretam como ausência de restrições.

Uma pergunta feita em um assistente de IA levando a uma busca em tempo real de um link curto, o salto de redirecionamento e a leitura da página de destino

O Que Isso Faz com Sua Contagem de Cliques

Tráfego automatizado é um problema de medição antes de ser um problema de política.

Qualquer link publicamente acessível vai acumular acessos de crawlers. Links postados em fóruns públicos, documentação e perfis sociais atraem muito mais do que links enviados para uma lista privada, e o efeito se acumula ao longo de meses, enquanto um link de campanha fica ativo por apenas duas semanas.

O Elido descarta agentes automatizados conhecidos antes do clique ser registrado, e não depois, então o painel mostra pessoas. Esse é o comportamento que você quer, e vale a pena verificar em qualquer ferramenta que você use, porque um contador bruto trata uma varredura de crawler como um pico de tráfego. O que vale a pena medir em analytics de links curtos cobre a distinção entre filtrado e bruto, e cliques versus sessões do GA4 cobre do que é feita a diferença restante.

Uma observação prática: a filtragem é baseada em assinatura, então um agente novo é invisível até que sua assinatura seja conhecida. Se um link mostra um platô súbito e constante de requisições idênticas, olhe o User-Agent antes de olhar a campanha.

O Que Colocar no robots.txt de um Domínio de Redirecionamento

Uma posição curta e defensável para um host que serve apenas redirecionamentos.

Permita os buscadores em tempo real. Essas requisições existem porque alguém fez uma pergunta que sua página pode responder, e bloqueá-las tira você da resposta sem tirar você dos dados de treinamento com os quais você estava preocupado. Esta é a linha mais consequente do arquivo.

Decida sobre os crawlers de treinamento por princípio, e não por efeito, porque um domínio de redirecionamento não contém nada para treinar. Se sua organização tem uma posição sobre treinamento de modelos, aplique-a aqui por consistência e não espere mudança mensurável de nenhuma forma.

Deixe os indexadores de busca em paz, a menos que você tenha um motivo. Eles seguem o redirecionamento e atribuem o crédito ao destino, que é o que você quer.

E lembre-se do que o robots.txt não faz. Ele é um pedido, não um controle de acesso, e não tem efeito sobre se o redirecionamento funciona para uma pessoa. Uma linha Disallow não quebra seus links; ela pede a um agente compatível que não os busque. Qualquer coisa que ignore o robots.txt é um problema diferente, com ferramentas diferentes.

Está rodando links em um domínio que você possui e quer controlar? Os domínios personalizados do Elido permitem que você sirva esse host, o que é o pré-requisito para que qualquer uma dessas regras se aplique.

Quatro classes de agente automatizado, o que cada uma quer de um link curto, e a política adequada para cada uma

Não por si só. Um agente que segue o redirecionamento lê o destino e cita o que encontrou lá, exatamente como um crawler de busca faz.

O que custa é atrito no salto. Uma cadeia de dois ou três redirecionamentos antes do conteúdo, uma resolução que depende de JavaScript, uma resposta lenta, ou um destino que responde com um interstitial. Cada um desses é uma chance de a busca ser abandonada, e uma busca abandonada é uma página que não entrou na resposta.

A regra que eu daria a uma equipe de conteúdo: publique URLs canônicas dentro do conteúdo, onde um modelo as lê como o endereço da coisa, e use links curtos para distribuição, onde um humano os lê. Dessa forma a citação aponta para sua página e o rastreamento continua funcionando nos canais onde você precisa dele. Links de comércio agêntico cobre o caso em que o agente está realizando uma transação em vez de ler.

Medindo o Tráfego Que Volta

Parte dele é visível. Assistentes que enviam um referrer aparecem como uma linha de referência normal, e um deles anexa um parâmetro de campanha próprio, razão pela qual chatgpt.com às vezes aparece nos relatórios como origem. O restante chega como tráfego direto, porque uma interface de chat não tem obrigação de se identificar.

Trate a parcela visível como um piso, não como um total. Se os referenciamentos de IA importam o suficiente para serem relatados, a versão honesta é uma tendência direcional a partir das origens que você consegue ver, mais uma nota de que o número real é maior. Quem apresenta um percentual preciso de referenciamento de IA está apresentando apenas a parte que conseguiu medir.

Leia a Série Fundamental

Este artigo está no cluster de engenharia. Links curtos como Terraform é o conteúdo fundamental para gerenciar infraestrutura de links como código, e answer engine optimization cobre o lado de conteúdo de ser citado.

Relacionados no Blog

Perguntas frequentes

Os crawlers de IA seguem links curtos?

Geralmente sim. Um redirecionamento é uma resposta HTTP comum, e agentes bem-comportados o seguem até o destino, que é onde o conteúdo que eles buscavam realmente está. O salto aparece nos seus logs como uma requisição no domínio curto, e o destino vê a visita que vem em seguida.

O robots.txt do meu site principal cobre meu domínio de link curto?

Não. As regras do robots.txt se aplicam por host, então um arquivo servido em example.com não diz nada sobre go.example.com. Um domínio de redirecionamento precisa do seu próprio robots.txt, servido por quem quer que responda às requisições nesse host, ou os agentes vão tratá-lo como irrestrito.

Devo bloquear crawlers de IA nos meus links curtos?

Não há nada em um domínio de redirecionamento que valha a pena para treinamento, então bloquear crawlers de treinamento custa pouco. Bloquear os buscadores acionados pelo usuário é uma decisão diferente: essas requisições acontecem porque uma pessoa perguntou algo a um assistente, e uma busca bloqueada significa que sua página não entra na resposta.

Os bots de IA inflam minha contagem de cliques?

Eles inflam os números brutos. Qualquer ferramenta que publique totais de requisições sem filtro vai mostrar tráfego automatizado misturado com pessoas, e links públicos atraem mais desse tráfego do que links privados. Filtrar agentes conhecidos antes de contar é a solução, e vale a pena verificar se o seu encurtador faz isso por padrão.

Posso ver o tráfego que veio de um assistente de IA?

Parcialmente. Alguns assistentes enviam um referrer que você consegue ler, e alguns anexam um parâmetro de campanha próprio, então uma parte do tráfego é identificável nas análises. O restante chega como direto, porque uma interface de chat não é obrigada a informar ao seu site de onde o visitante veio.

Usar um link curto prejudica minhas chances de ser citado?

Não de forma relevante, desde que o redirecionamento seja rápido e resolva para uma página que o agente consiga ler. O que prejudica é uma cadeia de saltos, um link que exige JavaScript para resolver, ou um destino que responde lentamente. Publique URLs canônicas no próprio conteúdo e reserve os links curtos para distribuição.

Experimente Elido

Cole uma URL, obtenha um link curto

Sem cadastro. O link vive 30 dias. Cadastre-se para mantê-lo para sempre.

Grátis, sem necessidade de registo · 2 por dia

Experimente o Elido

Encurtador de URL hospedado na UE: domínios personalizados, análises profundas e API aberta. Plano gratuito - sem cartão de crédito.

Tags
ai crawlers
gptbot
robots.txt
redirect
bot traffic
ai referral traffic

Continuar lendo