Дубли страниц на сайте: как найти и убрать

Сайт вроде бы в порядке: тексты написаны, структура выстроена, техзадание закрыто. Позиции стоят на месте. В Вебмастере при этом висит «исключено из поиска», и там пара сотен адресов, о которых вы не подозревали.

Чаще всего это дубли. Одна страница открывается по десятку адресов, поисковая система выбирает главную сама и регулярно берёт не ту, которую вы продвигали.

Разбираем по шагам: что считается дублем, откуда они берутся, как найти их в Яндекс Вебмастере и Search Console, чем убирать каждый тип и почему закрывать дубли в robots.txt — плохая идея.

Что поисковая система считает дублем

Коротко. Дубль — страница того же сайта с тем же содержимым, доступная по другому адресу. Робот сравнивает текст страниц, а их адреса для него только идентификаторы.

Формулировка Яндекса короткая: дублями считаются страницы в рамках одного сайта с одинаковым содержимым, доступные по разным адресам. Ключевое слово — содержимое. Две страницы могут отличаться картинкой в шапке и порядком блоков, но при совпадающем тексте попадут в одну кучу.

Полный дубль — когда содержимое совпадает целиком: главная открывается и по site.ru, и по site.ru/index.php. Частичный — когда совпадает основная часть: описание товара в двух категориях, страницы пагинации с одинаковыми заголовком и описанием, карточки с разным размером и общим текстом.

Отдельно Яндекс оговаривает: региональные поддомены с одинаковым контентом дублями не признаются. Если у вас kaluga.site.ru и tula.site.ru с общим прайсом, паниковать не о чем.

РАЗНЫЕ АДРЕСАsite.ru/uslugisite.ru/uslugi/www.site.ru/uslugi/site.ru/uslugi/index.phpsite.ru/uslugi/?utm_source=vkОдин и тот жетекст страницыВ поиске остаётся одинКакой — решает робот

Пять написаний одного адреса — это пять страниц с точки зрения робота

Откуда дубли берутся у обычного сайта

Коротко. Руками их почти никто не делает. Дубли создаёт сервер, движок сайта и метки, которые дописываются к ссылкам в рекламе и рассылках.

Набор источников от проекта к проекту повторяется до скуки и делится надвое.

Нет времени разбираться самому? Разберём ваш сайт по 20+ SEO-параметрам и покажем точки роста — бесплатно и без обязательств.

Получить аудит

Технические дубли. Сервер отдаёт страницу со слешем на конце и без него, с www и без www, по http и по https, а главная вдобавок открывается как site.ru/index.php. Источники перемножаются, и одна главная спокойно набирает восемь адресов. Сюда же метки в ссылках, пагинация, версии для печати и архивы движка.

Естественные дубли. Так Яндекс называет те, что рождаются из структуры сайта, а не из чьей-то ошибки: карточка товара привязана к двум разделам каталога и доступна по двум путям.

Источник дубляКак выглядитЧем закрывается
Слеш на конце/uslugi и /uslugi/301 на выбранный формат
www и без wwwwww.site.ru и site.ru301 на главное зеркало
http и httpshttp://site.ru и https://site.ru301 на https
Главная и index.phpsite.ru и site.ru/index.php301 на короткий адрес
UTM-метки, коллтрекинг/uslugi/?utm_source=vkClean-param, canonical
Сортировка и фильтры/catalog/?sort=priceClean-param, настройка GET-параметров
Товар в двух разделахдва пути к одной карточкеcanonical на основной адрес

Совет. Начните с самой дешёвой проверки: откройте главную по четырём вариантам написания адреса руками. Если хоть один отдаёт код 200 вместо переадресации, дубль уже есть.

Чем дубли вредят на практике

Коротко. Штрафа за дубли нет ни у Яндекса, ни у Google. Вред косвенный: в поиск выходит не тот адрес, сигналы делятся между копиями, робот тратит обход на мусор.

Google формулирует прямо: дублирующийся контент внутри сайта не нарушает правил и поводом для санкций не служит. Претензии начинаются там, где чужой материал копируют массово.

Настоящая механика вреда другая. Google пишет, что дубли размывают силу сигналов ранжирования, деля их между адресами. Простыми словами: вы полгода собирали ссылки и поведенческие на страницу услуги, а в поиск вышел её адрес с меткой из рассылки, у которого истории нет.

Второй эффект — выбор остаётся за роботом. Пока главный адрес не назван, поисковая система определяет его сама и может передумать при следующем обходе: сегодня в выдаче одна версия, через месяц другая, позиции скачут. Сценарий разобран в материале почему упали позиции сайта.

Третий эффект — расход краулингового бюджета: пока робот перебирает триста адресов фильтра, новые карточки стоят в очереди.

  • В выдаче показывается адрес с UTM-меткой вместо чистого
  • Ссылки и поведенческие делятся между копиями
  • Продвигаемая страница пропадает из поиска, хотя с ней всё в порядке
  • Одинаковые заголовки в выдаче: посетитель не понимает, куда кликать

Заодно дубли маскируют другие проблемы: пока в отчётах шумят сотни лишних адресов, реальные ошибки теряются. Типовые причины застоя мы собрали в разборе почему сайт не в топе.

Как найти дубли в Яндекс Вебмастере

Коротко. Смотреть надо в четыре места: «Страницы в поиске» с фильтром по статусу «Дубль», диагностику, отчёт по одинаковым заголовкам и настройку GET-параметров.

Панель Яндекса сама показывает, какие страницы робот счёл дублями, и не требует ни платных сервисов, ни навыков. Если сайт не подтверждён, это дело десяти минут — порядок в инструкции как добавить сайт в Яндекс Вебмастер.

Учтите деталь: 28 января 2026 года меню сервиса перегруппировали, показатели качества и отзывы уехали в «Оптимизацию сайта». Ищете отчёт по старой памяти и не находите — он переехал в соседний раздел.

  1. Страницы в поискеОткройте вкладку «Исключённые страницы» и отфильтруйте список по статусу «Дубль». В выгруженном архиве такие строки помечены статусом DUPLICATE.
  2. Диагностика сайтаКогда дублей с параметрами много, там появляется сообщение «Найдены страницы-дубли с GET-параметрами» с примерами адресов и рекомендацией добавить Clean-param.
  3. Заголовки и описанияОтчёт группирует страницы с одинаковыми title и description. Указатель на частичные дубли: совпадающий заголовок почти всегда означает совпадающее наполнение.
  4. Настройка GET-параметровИнструмент появился в декабре 2025 года в разделе «Индексирование». Робот выводит найденные параметры, а вы отмечаете, какие из них меняют содержимое страницы.

Последний пункт стоит открыть, даже если вы уверены в своём robots.txt: список собран роботом по факту обхода, и там всплывают метки, о которых владелец не знал — следы старой CRM, коллтрекинга, чужих виджетов. Правила панели и директива Clean-param работают вместе, а при противоречии робот выполнит то, которое запрещает индексировать адрес.

Search Console, поиск по сайту и краулеры

Коротко. В Search Console дубли видны в отчёте об индексировании по трём формулировкам. Остальное добирается запросом site: в поиске и краулером.

Google сообщает о дублях иначе. В отчёте об индексировании есть три статуса, которые стоит запомнить:

  • «Вариант страницы с тегом canonical» — порядок, дубль корректно указывает на основную версию
  • «Страница является копией. Канонический вариант не выбран пользователем» — главный адрес не назван, Google выбрал сам
  • «Страница является копией. Канонические версии, выбранные Google и пользователем, не совпадают» — вы указали одну страницу, робот согласился с другой

Третья формулировка полезнее всех: ваш rel=canonical робот прочитал и отверг. Причина обычно в том, что страницы слишком разные по содержанию либо на «неглавную» версию ведёт больше внутренних ссылок. Какой адрес Google считает каноническим, покажет инструмент проверки URL. Чем поиск Google отличается от Яндекса, мы описали в статье продвижение сайта в Google.

Дальше способы без панелей. Запрос вида site:вашсайт.ru покажет, что попало в индекс: по списку часто видно версии для печати и адреса с параметрами. Второй приём — взять кусок текста страницы в кавычках. Если поиск отдаст несколько ваших адресов, дубль найден.

Полнее всего отработает краулер — программа, которая обходит сайт как робот и складывает адреса в таблицу. Смотреть надо на совпадающие title, description и h1 плюс на число адресов, ведущих к одному тексту. Порядок технического аудита расписан в инструкции как сделать SEO-аудит самостоятельно, а пробежаться по базовым пунктам помогает интерактивный чек-лист проверки сайта.

Чем убирать: 301, canonical, Clean-param, noindex

Коротко. Инструмент выбирается по типу дубля. 301 — когда второй адрес никому не нужен, canonical — когда обе страницы должны открываться, Clean-param — когда мусор сидит в параметрах.

Наборы у поисковых систем похожие, акценты разные. Google оценивает силу сигналов так: 301 и rel=canonical — сильные, адрес в sitemap.xml — слабый. Сочетание способов повышает шанс, что каноническим станет ваш вариант.

Тип дубляЧем убиратьПочему так
Слеш, www, http, index.php301-редиректВторой адрес не нужен никому
Товар в двух разделахrel=canonicalОбе страницы должны открываться у посетителя
UTM-метки, коллтрекингClean-param, настройка GET-параметровЯндекс склеивает адреса без обхода каждого
Фильтры и сортировкаClean-param, canonicalЧасть фильтров — готовые посадочные под запросы
Версия для печатиnoindex или canonicalСтраница нужна человеку, поиску — нет
ПагинацияУникальные title и descriptionСодержание страниц разное, склейка вредна
Корзина, кабинет, поискDisallow в robots.txtИндексировать там нечего

Про Clean-param полезно знать четыре вещи. Директиву понимает только Яндекс. Регистр символов учитывается. Длина правила ограничена 500 знаками. Размещать её можно в любом месте robots.txt, но если для робота Яндекса заведена своя секция, все правила собираются в неё.

Приятная деталь: самые частые метки Яндекс отбрасывает сам — utm_source, utm_medium, utm_campaign, плюс ysclid и yrclid, которые он же и дописывает к ссылкам. Прописывать их не нужно. Правило для сортировки выглядит так:

User-agent: Yandex
Clean-param: sort&order /catalog/

У Google аналога больше нет: инструмент «Параметры URL» закрыли весной 2022 года, объяснив это тем, что робот научился разбираться с параметрами сам. Остаются rel=canonical, редиректы и аккуратные внутренние ссылки.

Последний пункт недооценивают чаще всего. Когда в меню и карте сайта вы ссылаетесь на страницу то со слешем, то без него, поисковик получает противоречивые сигналы от вас же. Единый формат ссылок закрывает половину проблемы.

Типовые дубли в WordPress и Битриксе

Коротко. У каждого движка свой набор дублей по умолчанию. В WordPress их плодят архивы, теги и вложения, в Битриксе — фильтры, пагинация и index.php.

WordPress отдаёт rel=canonical на записи и страницы из коробки, так что базовая канонизация обычно работает. Сложности начинаются с разделов, которые движок создаёт автоматически.

  • Теги: страница тега часто повторяет анонсы рубрики
  • Архивы по датам и авторам: на сайте с одним автором это точная копия ленты блога
  • Страницы вложений: под каждую картинку создаётся отдельный адрес
  • Адреса с replytocom, если включены древовидные комментарии
  • Два SEO-плагина сразу: каждый выводит свой canonical

Лечится это в настройках SEO-плагина: архивы автора и дат закрываются от индексации, вложения перенаправляются на запись, теги либо отключаются, либо превращаются в посадочные с собственным текстом.

У Битрикса набор другой. Раздел открывается и как /catalog/, и как /catalog/index.php. Пагинация дописывает параметр PAGEN_1. Умный фильтр порождает адрес на каждую комбинацию галочек. Товар из двух разделов доступен по двум путям.

Канонический адрес для карточки товара Битрикс умеет отдавать сам, но настройку надо включить и проверить в шаблонах компонентов. Фильтры закрывают через Clean-param и robots.txt, оставляя открытыми комбинации, под которые есть спрос: логику отбора мы описали в разборе SEO для интернет-магазина. Какой движок брать под проект, сравнивали в материале WordPress или Битрикс, а разработку сайтов ведём на обеих платформах.

Чего делать не надо

Коротко. Главная ошибка — закрыть дубли в robots.txt вместо канонизации. Робот перестанет их видеть, но накопленные сигналы никуда не перейдут, они просто пропадут.

Логика кажется здравой: адреса лишние, закроем директивой Disallow, робот их не увидит, проблема решена. На деле Disallow запрещает обход, и передать показатели закрытых страниц не выйдет.

Яндекс говорит напрямую: чтобы страницы склеились и сигналы перешли на главную версию, нужен 301-редирект или rel=canonical. Google просит не использовать robots.txt для канонизации вообще — робот физически не прочитает отметку canonical, если вход закрыт.

Disallow в robots.txt

«спрячем и забудем»

  • Робот не заходит на страницу
  • Отметку canonical он тоже не увидит
  • Вес и поведенческие остаются на нём
  • Адрес может висеть в выдаче без описания

301 или rel=canonical

«склеим и передадим»

  • Робот видит связь между адресами
  • Сигналы переходят на главную версию
  • В поиске остаётся выбранный вами адрес
  • Посетитель по старой ссылке попадает куда надо

Схожая история с noindex. Google не советует его для выбора канонической страницы внутри сайта: тег полностью убирает страницу из поиска, тогда как требовалась склейка. Оставьте noindex для служебных разделов — корзины, кабинета, страницы благодарности.

Ещё три ошибки из практики. Ставить canonical на страницу, содержание которой сильно расходится с канонической: Яндекс пишет, что может проигнорировать указание и показать неканоническую версию. Схлопывать пагинацию на первую страницу: товары с дальних вылетят из индекса. Чистить дубли вручную, не устранив причину: движок сгенерирует их заново.

Осторожно. Disallow сильнее Clean-param: адрес под запретом правила склейки не затронут, робот туда не пойдёт. Прописали Clean-param и держите те же адреса закрытыми — работать не будет ни то ни другое.

Устройство robots.txt и sitemap.xml целиком — тема отдельная, разбирали её в статье robots.txt и sitemap.xml.

Как проверить, что помогло

Коротко. Мгновенного эффекта ждать не стоит. Сначала робот должен переобойти изменённые адреса, и только после этого отчёты начнут меняться.

Порядок такой. Проверьте, что редиректы отдают код 301: временная переадресация 302 сигналы не передаёт. Убедитесь, что rel=canonical стоит в head и ведёт на абсолютный адрес. Отправьте страницы на переобход в Вебмастере и запросите индексирование в Search Console.

Дальше остаётся смотреть на цифры. В Вебмастере изменения обычно отражаются в течение недели после переобхода: число исключённых со статусом «Дубль» снижается, а сообщение из диагностики уходит само.

301
код переадресации, который передаёт сигналы
500
знаков — предел длины одного правила Clean-param
1 неделя
срок обновления отчётов после переобхода
дек. 2025
в Вебмастере появилась «Настройка GET-параметров»

Контрольная проверка через месяц: снова открыть главную по четырём вариантам адреса, прогнать сайт краулером, заглянуть в отчёт по одинаковым заголовкам. Если в списках те же адреса, правило не сработало. Чаще всего виноват конфликт настроек: canonical указывает на одну страницу, редирект ведёт на другую, robots.txt закрывает обе.

Работа по дублям разовая и недорогая на фоне эффекта. Хуже всего, когда её откладывают годами и списывают провал на сложную нишу. Хотите узнать, сколько лишних адресов у вас в индексе — оставьте заявку на бесплатный экспресс-аудит: покажем список дублей, причину каждого и порядок устранения. Мы ведём SEO-продвижение и Яндекс.Директ одной командой с разработчиками, так что правки не придётся пересылать между подрядчиками.

← Все статьи Получить бесплатный аудит
Бесплатный аудит