На ваши ссылки заходят три разных вида автоматических агентов, и всем им нужно разное. Один собирает текст для обучения модели. Другой прямо сейчас забирает страницу, потому что человек задал вопрос. Третий строит поисковый индекс. Они приходят с разными user agent, соблюдают разные правила и заслуживают разных ответов.
Домен для редиректов - необычная цель для них, ведь на нём нет контента. Каждый запрос - это поиск и заголовок Location, так что краулер для обучения не получает ничего полезного, а живой фетчер получает один лишний переход на пути к нужной странице. Именно эта асимметрия делает решение о политике простым, как только вы разделяете классы. Если вас интересует маркетинговая сторона вопроса, а не техническая, статья answer engine optimization рассказывает о том, что на самом деле приводит к цитированию страницы.
Три класса, а не один
Краулеры для обучения. Они собирают контент для обучения моделей. OpenAI документирует своих ботов с отдельным user agent под каждую задачу, а Anthropic документирует своего краулера и правила, которым он следует, в том же духе. Google решает эквивалентную задачу через токен robots, а не отдельного краулера, что описано в обзоре краулеров Google наряду с поисковыми агентами.
Живые фетчеры. Они срабатывают, когда человек спрашивает ассистента о чём-то, и ассистент решает прочитать страницу. Perplexity явно документирует это разделение: один агент для индексации, другой - для запроса, инициированного пользователем. Это различие важнее любого другого момента в этом посте: живой фетч - это человек, только на один шаг в стороне.
Поисковые индексаторы. Самый старый класс, чьё поведение в отношении редиректов изучено лучше всего. Они следуют по постоянному редиректу, приписывают контент месту назначения и относятся к короткому домену как к указателю.
Одна и та же инфраструктура, три разные цели. Единое правило для всех них почти всегда оказывается неверным решением.
Что происходит, когда агент попадает на редирект
Механика ничем не примечательна. Агент запрашивает короткий URL, редирект отвечает 301 или 302 и заголовком Location, и агент следует по нему, если вообще следует редиректам. HTTP-семантика редиректов для этого не менялась, и нигде в стандарте нет особой обработки для AI-агентов.
Отсюда следуют два последствия. Короткий домен видит запрос, который не является человеком, и он попадает в ваши данные о кликах, если что-то его не отфильтрует. А место назначения видит то, что агент делает дальше, - для живого фетчера это обычное чтение страницы.
Обычно ошибаются в том, на каком хосте живут правила. RFC 9309 определяет robots.txt как область действия конкретного authority: схема, хост и порт. Правила на example.com/robots.txt управляют example.com и больше ничем. Ваш домен для редиректов - это другой хост, поэтому ему нужен собственный файл, отдаваемый тем, что отвечает на этом хосте. Многие короткие домены вообще не отдают robots.txt, а агенты читают это как отсутствие ограничений.
Что это делает с вашими счётчиками кликов
Автоматический трафик - это прежде всего проблема измерения, а не проблема политики.
Любая публично доступная ссылка будет накапливать обращения краулеров. Ссылки, опубликованные на публичных форумах, в документации и в социальных профилях, притягивают их гораздо больше, чем ссылки, разосланные приватному списку, и эффект накапливается месяцами, тогда как ссылка для кампании живёт всего две недели.
Elido отбрасывает известных автоматических агентов до того, как клик будет записан, а не после, поэтому дашборд показывает людей. Именно такого поведения стоит добиваться, и его стоит проверить в любом инструменте, которым вы пользуетесь, потому что сырой счётчик воспринимает волну краулера как всплеск трафика. Что стоит измерять в аналитике коротких ссылок разбирает разницу между фильтрованными и сырыми данными, а клики против сессий GA4 объясняет, из чего состоит оставшийся разрыв.
Одно практическое замечание: фильтрация основана на сигнатурах, поэтому новый агент невидим, пока его сигнатура не станет известна. Если ссылка вдруг показывает ровное плато из идентичных запросов, посмотрите на user agent, прежде чем смотреть на кампанию.
Что писать в robots.txt на домене для редиректов
Краткая, обоснованная позиция для хоста, который занимается только редиректами.
Разрешите живых фетчеров. Такие запросы существуют потому, что кто-то задал вопрос, на который может ответить ваша страница, и блокировка убирает вас из ответа, но не убирает из обучающих данных, о которых вы беспокоились. Это самая значимая строка во всём файле.
Решение по краулерам для обучения принимайте из принципа, а не из ожидаемого эффекта, потому что на домене для редиректов нет ничего, на чём можно обучаться. Если у вашей организации есть позиция по обучению моделей, примените её здесь для последовательности и не ждите заметных изменений в любом случае.
Не трогайте поисковые индексаторы, если у вас нет причины. Они следуют по редиректу и приписывают заслугу месту назначения - именно этого вы и хотите.
И помните, чего robots.txt не делает. Это просьба, а не контроль доступа, и он никак не влияет на то, работает ли редирект для человека. Строка Disallow не ломает ваши ссылки - она просит добросовестного агента не забирать их. Всё, что игнорирует robots.txt, - это другая проблема с другими инструментами.
Запускаете ссылки на домене, который вам принадлежит и который вы хотите контролировать? Пользовательские домены Elido позволяют вам обслуживать этот хост, что и является предпосылкой для того, чтобы любые из этих правил вообще применялись.
Стоит ли короткая ссылка вам цитирования?
Сама по себе - нет. Агент, который следует по редиректу, читает место назначения и цитирует то, что там нашёл, - точно так же, как это делает поисковый краулер.
Дорого обходится трение в самом переходе. Цепочка из двух-трёх редиректов до контента, разрешение, зависящее от JavaScript, медленный ответ или место назначения, отвечающее промежуточной страницей. Каждый из этих случаев - это шанс, что фетч будет заброшен, а заброшенный фетч - это страница, которая не попала в ответ.
Правило, которое я бы дал контент-команде: публикуйте канонические URL прямо в контенте, где модель читает их как адрес объекта, а короткие ссылки используйте для дистрибуции, где их читает человек. Тогда цитирование указывает на вашу страницу, а трекинг по-прежнему работает на тех каналах, где он вам нужен. Ссылки для агентной коммерции разбирают случай, когда агент совершает транзакцию, а не читает.
Измерение трафика, который возвращается
Часть его видна. Ассистенты, отправляющие referrer, отображаются как обычная строка перехода, а один из них добавляет собственный параметр кампании, из-за чего chatgpt.com иногда появляется в отчётах как источник. Остальное приходит как прямой трафик, потому что интерфейс чата не обязан себя идентифицировать.
Относитесь к видимой доле как к нижней границе, а не к итогу. Если AI-переходы достаточно важны, чтобы о них отчитываться, честная версия - это направленный тренд по источникам, которые вы можете видеть, плюс оговорка, что реальная цифра выше. Любой, кто предъявляет точный процент AI-переходов, предъявляет лишь ту часть, которую смог измерить.
Читайте опорную серию
Этот пост входит в кластер engineering. Короткие ссылки как Terraform - опорная статья об управлении инфраструктурой ссылок как кодом, а answer engine optimization разбирает контентную сторону цитирования.
Ещё по теме в блоге
Частые вопросы
Следуют ли AI-краулеры по коротким ссылкам?
В целом да. Редирект - это обычный HTTP-ответ, и корректно ведущие себя агенты следуют по нему к месту назначения, где и находится контент, за которым они пришли. Переход отображается в ваших логах как запрос на коротком домене, а место назначения видит визит, который следует за ним.
Распространяется ли robots.txt моего основного сайта на короткий домен?
Нет. Правила robots действуют для конкретного хоста, поэтому файл, отдаваемый на example.com, ничего не говорит о go.example.com. Домену для редиректов нужен собственный robots.txt, отдаваемый тем, что отвечает на запросы этого хоста, - иначе агенты будут считать его неограниченным.
Стоит ли блокировать AI-краулеры на моих коротких ссылках?
На домене для редиректов нет ничего, на чём стоило бы обучаться, поэтому блокировка краулеров для обучения обходится вам почти даром. Блокировка фетчеров, запускаемых пользователем, - совсем другое решение: такие запросы происходят потому, что человек о чём-то спросил ассистента, и заблокированный фетч означает, что ваша страница не попадёт в ответ.
Завышают ли AI-боты мои счётчики кликов?
Они завышают сырые счётчики. Любой инструмент, публикующий нефильтрованные итоги по запросам, покажет автоматический трафик, перемешанный с людьми, а публичные ссылки притягивают его больше, чем приватные. Фильтрация известных агентов до подсчёта - это и есть решение, и стоит проверить, делает ли ваш сервис сокращения это по умолчанию.
Могу ли я увидеть трафик, пришедший от AI-ассистента?
Частично. Некоторые ассистенты отправляют referrer, который можно прочитать, а некоторые добавляют собственный параметр кампании, поэтому часть трафика идентифицируется в аналитике. Остальное приходит как прямой трафик, потому что интерфейс чата не обязан сообщать вашему сайту, откуда пришёл посетитель.
Вредит ли использование короткой ссылки моим шансам быть процитированным?
Не существенно, пока редирект быстрый и разрешается в страницу, которую агент может прочитать. Вредит цепочка переходов, ссылка, для разрешения которой требуется JavaScript, или место назначения, отвечающее медленно. Публикуйте канонические URL в самом контенте и оставляйте короткие ссылки для дистрибуции.
Попробуйте Elido
Вставьте URL - получите короткую ссылку
Без регистрации. Ссылка живёт 30 дней. Зарегистрируйтесь, чтобы оставить её навсегда.
Бесплатно, без регистрации · 2 в день