robots.txt - это обычный текстовый файл, который лежит в корне сайта по адресу вида example.ee/robots.txt. Поисковый робот запрашивает его первым, до всех остальных страниц, и читает как список рекомендаций: куда заходить можно, а куда не стоит тратить время. Файл видят все, включая конкурентов, поэтому прятать в нём что-то секретное бессмысленно.
Главное недоразумение вокруг этого файла звучит так: если закрыть страницу в robots.txt, она пропадёт из поиска. Это неверно. Запрет в robots.txt мешает роботу прочитать содержимое страницы, но не мешает показать её в выдаче, если на неё ведут ссылки. В результате появляется странный результат без описания и с подписью о том, что информация недоступна. Чтобы страница действительно исчезла из индекса, нужен мета-тег noindex, а доступ роботу при этом надо оставить открытым, иначе он просто не увидит указание.
Что писать внутри
Структура простая. Строка User-agent называет робота, к которому относятся правила, а звёздочка означает всех сразу. Дальше идут строки Disallow с путями, куда заходить не надо, и Allow с исключениями из запретов. Отдельной строкой указывается адрес карты сайта.
- Закрывайте служебные разделы: административную панель, страницы входа, внутренний поиск по сайту
- Закрывайте страницы корзины, оформления заказа и личного кабинета в интернет-магазине
- Закрывайте адреса с бесконечными параметрами сортировки и фильтров, если их сотни
- Не закрывайте папки со стилями, скриптами и картинками: без них Google не поймёт, как выглядит страница
- Обязательно укажите строку Sitemap с полным адресом карты сайта
Последний пункт про стили и скрипты стоит подчеркнуть. Раньше эти файлы часто закрывали, чтобы сэкономить ресурсы робота. Сегодня Google рендерит страницы почти как браузер, и если стили недоступны, он видит текст без вёрстки. Такая страница выглядит неадаптивной и теряет позиции на мобильной выдаче.
Самая дорогая ошибка
Две строки, которые закрывают весь сайт, выглядят безобидно: User-agent со звёздочкой и Disallow с одним слешем. Их ставят на тестовой версии сайта, чтобы черновик не попал в поиск, а потом забывают убрать при переносе на боевой домен. Симптом всегда одинаковый: сайт запущен, всё работает, но в Google его нет вообще, даже по названию компании.
Поэтому после каждого обновления сайта откройте адрес /robots.txt в браузере и просто прочитайте, что там написано. Это занимает пятнадцать секунд. Дополнительно в Google Search Console есть отчёт по индексированию, где перечислены страницы, заблокированные в robots.txt: если в нём внезапно оказались товары или услуги, значит правило написано слишком широко.
Когда файл вообще не нужен
Небольшому сайту на десять-двадцать страниц без личного кабинета и корзины скрывать нечего. В этом случае достаточно минимального файла, который разрешает всё и указывает карту сайта. Пустой robots.txt лучше отсутствующего: когда файла нет, сервер отдаёт ошибку 404, и хотя роботы это переживают спокойно, в отчётах инструментов аудита появляется лишнее предупреждение.
И последнее: robots.txt не защита. Если раздел нельзя показывать посторонним, его закрывают паролем на уровне сервера, а не строкой в текстовом файле. Список запрещённых путей в robots.txt скорее подсказывает любопытному человеку, где искать интересное.