Многие владельцы сайтов считают, что Google просто знает про их страницы. На деле между публикацией текста и появлением его в поиске стоит целая цепочка технических шагов. Понимание этой цепочки помогает быстро находить причину, когда страницы упорно не попадают в выдачу.
Робот Google, он же Googlebot, - это программа, которая ходит по ссылкам и скачивает содержимое страниц. Она работает круглосуточно и обходит миллиарды адресов, но ресурсы у неё не бесконечные. Для каждого сайта выделяется свой лимит внимания, и чем меньше на сайте мусора, тем больше внимания достаётся важным страницам.
Три этапа: обход, индексация, ранжирование
Сначала идёт обход. Робот получает список адресов из карты сайта, из внешних ссылок и из внутренних ссылок на уже известных страницах. Затем он загружает страницу так же, как это делает браузер, включая выполнение скриптов. Если сервер отвечает медленно или отдаёт ошибку, робот отложит визит и вернётся позже.
Дальше идёт индексация. Google разбирает содержимое страницы, определяет её тему, язык, основные ключевые фразы и решает, стоит ли добавлять её в свой индекс. Страницы с копированным или очень коротким текстом на этом этапе часто отсеиваются. Именно поэтому сайт может быть полностью доступен роботу, но всё равно не показываться в поиске.
Последний этап - ранжирование. Когда человек вводит запрос, Google выбирает из индекса подходящие страницы и сортирует их по сотням сигналов: релевантность текста, скорость загрузки, удобство на мобильных, ссылки с других сайтов, поведение пользователей. Здесь уже начинается обычная работа по SEO.
Что чаще всего мешает роботу
- Закрытые в robots.txt разделы, которые на самом деле нужно показывать
- Тег noindex, случайно оставшийся после разработки сайта
- Страницы, на которые нет ни одной внутренней ссылки
- Медленный сервер, который отдаёт таймауты при нагрузке
- Контент, подгружаемый скриптами без запасного HTML-варианта
- Дубли страниц без указания основной версии через canonical
Отдельная типичная ситуация в Эстонии - многоязычные сайты. Если версии на эстонском, русском и английском не связаны между собой атрибутом hreflang, робот может посчитать их дублями и выбрать для показа не тот язык, который ожидает посетитель.
Как проверить, видит ли робот ваш сайт
Самый прямой инструмент - Google Search Console. В отчёте об индексировании видно, сколько страниц в индексе, сколько исключено и по какой причине. Инструмент проверки URL показывает, когда робот заходил на конкретную страницу и как он её увидел. Если отображаемый роботом HTML заметно отличается от того, что видит человек, это повод разобраться с рендерингом.
Полезная привычка - проверять новые важные страницы вручную сразу после публикации. Отправьте адрес на переобход через Search Console, убедитесь, что заголовок и описание распознаны верно, и через несколько дней проверьте, появилась ли страница в поиске по точной фразе из текста.
Чем понятнее структура сайта, тем меньше усилий требуется роботу. Логичное меню, рабочая карта сайта, отсутствие лишних технических адресов и быстрый сервер решают большую часть проблем с индексацией ещё до того, как они появятся.