Дублированный контент - это ситуация, когда одинаковый или почти одинаковый текст доступен по нескольким адресам. Google не наказывает за это штрафом, вопреки распространённому мнению, но делает кое-что не менее неприятное: сам выбирает, какую версию показывать, и часто выбирает не ту. Внутренние ссылки, вес и поведенческие сигналы при этом размазываются между копиями, и ни одна не набирает достаточно, чтобы попасть в топ.
Технические дубли
Самая частая причина не имеет отношения к текстам. Один и тот же материал открывается по разным техническим вариантам адреса, и для робота это разные страницы.
- Версии с www и без www, работающие одновременно
- Адреса на http и https без склейки
- Адрес со слешем на конце и без него
- Главная страница, доступная и по домену, и по /index.php
- Адреса с параметрами сортировки, фильтров и utm-меток
- Страницы пагинации, повторяющие описание категории целиком
- Версии для печати и адреса, оставшиеся от прежней структуры сайта
Проверяется это за минуту: вбейте в браузер каждый вариант адреса и посмотрите, есть ли редирект на основную версию. Если все варианты открываются самостоятельно и отдают код 200, дубли у вас есть. Лечится настройкой постоянного редиректа 301 на выбранный основной вариант плюс тегом canonical на каждой странице.
Содержательные дубли
Второй тип встречается в интернет-магазинах и на сайтах услуг. В магазине это карточки товаров с описанием от производителя: точно такой же текст стоит ещё у двадцати продавцов, и Google выбирает из них крупнейшего. На сайтах услуг это страницы под города, скопированные с заменой одного слова: «ремонт в Таллинне», «ремонт в Тарту», «ремонт в Нарве» при идентичном содержимом.
Здесь редиректы не помогут, потому что страницы нужны разные. Помогает уникализация. Для товара это несколько своих абзацев: чем этот вариант отличается от соседнего, кому подходит, что кладут в коробку, фотографии не из каталога поставщика. Для города - реальная местная специфика: сроки выезда, адрес, конкретные выполненные объекты, отзывы жителей именно этого города. Если написать такое нечего, честнее сделать одну сильную страницу вместо пяти пустых: она соберёт весь вес и будет показываться по всем городам сразу.
Как найти и закрыть
В Google Search Console откройте отчёт об индексировании и найдите строки о страницах, исключённых как дубли, и о страницах с альтернативной канонической версией. Там прямо перечислено, какие адреса Google склеил и какой выбрал главным. Если его выбор расходится с вашим, значит сигналы противоречивы: скорее всего, canonical указывает на одно, а внутренние ссылки ведут на другое.
Есть и способ без всяких сервисов. Возьмите из середины любой страницы предложение слов на десять, заключите его в кавычки и поищите в Google с оператором site: и вашим доменом. Если в результатах больше одного адреса, дубль найден. Приём грубый, но за пять минут показывает масштаб проблемы и не требует ни доступов, ни подписок.
Порядок действий такой: выбрать канонический адрес, поставить на него редирект со всех технических вариантов, прописать canonical, проследить, чтобы внутренние ссылки и карта сайта вели именно туда. Важно, чтобы сигналы не спорили между собой: страница, закрытая в robots.txt, не сможет сообщить роботу свой canonical, потому что робот её просто не прочитает. После этого дождаться переобхода, он занимает от нескольких дней до пары недель. Отдельно стоит проверять сайт после любой смены CMS или шаблона: дубли почти всегда появляются в момент переезда, а не постепенно.