robots.txt в WordPress часто используют как универсальную «заглушку» для всего подряд. Это плохая идея: файл нужен не для скрытия контента от индексации, а для управления обходом. Если закрыть им не то, можно случайно ухудшить сканирование важных страниц, а если не закрыть ничего — поисковик продолжит тратить краулинговый бюджет на служебные URL.
Ниже разберём, какие технические страницы действительно имеет смысл ограничивать, как собрать рабочий robots.txt без лишних директив и как проверить, что он не мешает индексации.
Какие страницы WordPress обычно стоит закрыть в robots.txt
Сначала полезно разделить задачи. robots.txt подходит для URL, которые не должны массово обходиться роботами: служебные файлы, внутренние поисковые страницы, некоторые параметры и технические каталоги. Но он не заменяет noindex и не решает проблему дублей сам по себе.
Что обычно имеет смысл ограничить
/wp-admin/— административная часть сайта;/wp-login.php— форма входа;- внутренний поиск WordPress, если он создаёт мусорные URL;
- служебные endpoints, если они не нужны в поиске;
- файлы и каталоги, которые не должны обходиться роботами, но доступны по прямой ссылке.
При этом /wp-content/uploads/ обычно не закрывают целиком: изображения и PDF часто нужны в поиске и в выдаче по картинкам. Если закрыть uploads без разбора, можно потерять полезный трафик и усложнить диагностику медиа.
Диагностика: что именно мешает индексации или тратит обход
Перед правкой robots.txt стоит посмотреть, какие URL реально создаёт сайт. На практике проблемы чаще всего такие: внутренний поиск плодит страницы с параметрами, в индексе появляются служебные URL, а в логах заметно, что бот ходит по бесполезным адресам.
Проверяем текущий robots.txt
Откройте /robots.txt в браузере и посмотрите, есть ли там уже правила от темы, SEO-плагина или хостинга. В WordPress этот файл часто виртуальный, то есть генерируется на лету. Если вы редактируете физический файл в корне, убедитесь, что он действительно используется, а не перекрывается виртуальной версией.
Смотрим, какие URL создаёт поиск и фильтры
Если на сайте есть поиск по адресу вроде /?s=..., проверьте, не индексируются ли такие страницы. Аналогично с параметрами сортировки, пагинации служебных списков и тестовыми URL. Важно: если страница уже попала в индекс, одного robots.txt может быть мало — для удаления из индекса обычно нужен noindex или корректный canonical.
Рабочий вариант robots.txt для типового WordPress
Ниже — базовый шаблон, который можно адаптировать под конкретный сайт. Он не пытается закрыть всё подряд и не ломает доступ к важным ресурсам.
User-agent: *
Disallow: /wp-admin/
Disallow: /wp-login.php
Disallow: /?s=
Disallow: /search/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xmlЗдесь есть несколько важных моментов. Allow: /wp-admin/admin-ajax.php нужен, потому что этот файл часто используется фронтендом, плагинами и темой. Если его закрыть без причины, можно получить поломку форм, фильтров или динамических блоков.
Строка Sitemap помогает роботам быстрее находить карту сайта. Указывайте только актуальный адрес карты, который реально отдаёт 200 OK.
Как добавить robots.txt в WordPress без ручного редактирования ядра
Не нужно править файлы ядра WordPress. Есть два нормальных пути: через SEO-плагин или через физический файл в корне сайта. Если у вас уже стоит плагин, который умеет управлять robots.txt, лучше использовать его, чтобы не держать логику в двух местах.
Вариант 1: через плагин
Многие SEO-плагины позволяют редактировать robots.txt из админки. Это удобно, если сайт ведётся не только разработчиком. Но есть риск, что кто-то случайно добавит конфликтующие правила или перезапишет файл при обновлении настроек.
Вариант 2: физический файл в корне
Если нужен полный контроль, создайте robots.txt в корне сайта рядом с wp-config.php. Убедитесь, что сервер отдаёт именно этот файл, а не виртуальный вариант WordPress. После загрузки проверьте ответ через браузер или curl.
curl -I https://example.com/robots.txtВ ответе должен быть 200 OK. Если вместо этого вы видите редиректы, 403 или HTML-страницу, значит файл отдается не так, как ожидается.
Когда robots.txt не решает задачу
Это частая ошибка: закрывают URL в robots.txt и ждут, что они исчезнут из индекса. Но если поисковик уже знает адрес, он может продолжать показывать его без содержимого страницы. Для удаления дублей, параметров и служебных страниц обычно нужны другие инструменты.
| Подход | Когда использовать | Ограничение |
|---|---|---|
| robots.txt | Чтобы ограничить обход служебных URL | Не гарантирует удаление из индекса |
| noindex | Чтобы убрать страницу из поиска | Страница должна быть доступна для обхода |
| canonical | Чтобы указать основную версию страницы | Не подходит для полного скрытия |
Если у вас уже есть дубли страниц, параметры сортировки или служебные архивы, robots.txt — только часть решения. Для индексации важнее правильно расставить noindex и canonical, а не просто запретить обход.
Пошаговая настройка без лишних рисков
- Соберите список URL, которые не должны обходиться роботами: логин, админка, внутренний поиск, служебные каталоги.
- Проверьте, не используются ли эти URL фронтендом, AJAX-запросами или плагинами.
- Добавьте минимальный набор правил в robots.txt.
- Не закрывайте целые каталоги с контентом, если не уверены в последствиях.
- Укажите актуальную карту сайта.
- Проверьте файл через браузер и инструменты для вебмастеров.
Проверка результата после внедрения
После изменения robots.txt важно не просто открыть файл в браузере, а проверить поведение поисковых систем и сайта в целом.
Что проверить вручную
/robots.txtоткрывается с кодом ответа 200;- в файле нет конфликтующих директив для одного и того же URL;
- админка и логин не закрыли нужные фронтенд-запросы;
- карта сайта указана корректно;
- внутренний поиск не создаёт лишние индексируемые страницы.
Что проверить в Search Console
Посмотрите отчёты по сканированию и индексированию. Если после правки robots.txt важные страницы перестали обходиться, это обычно видно по снижению количества просканированных URL или по сообщениям о блокировке ресурсов. Если же цель была убрать служебные страницы, проверьте, уменьшается ли их появление в отчётах со временем.
curl https://example.com/robots.txt
curl -I https://example.com/wp-login.php
curl -I https://example.com/wp-admin/admin-ajax.phpЭти запросы помогают понять, что именно доступно роботу и не сломали ли вы нужные точки входа.
Частые ошибки и как их исправить
Закрывают весь сайт одной строкой
Иногда в robots.txt случайно попадает Disallow: /. После этого робот перестаёт обходить сайт почти полностью. Исправление простое: убрать правило и заново отправить файл на проверку. Но если страницы уже выпали из обхода, восстановление может занять время.
Путают robots.txt и noindex
Если нужно убрать страницу из поиска, robots.txt не всегда подходит. Страница может остаться в индексе как URL без контента. Для таких случаев используйте noindex на самой странице или на уровне шаблона.
Закрывают CSS и JS без необходимости
Раньше это делали чаще, но сейчас закрытие ресурсов может мешать рендерингу и диагностике. Если поисковик не видит стили и скрипты, он хуже понимает страницу. Не закрывайте /wp-content/ целиком без чёткой причины.
Оставляют конфликтующие правила от плагина и ручного файла
Если SEO-плагин генерирует robots.txt, а вы ещё и загрузили физический файл, легко получить путаницу. Проверьте, какой вариант реально отдаётся сервером, и оставьте один источник правды.
Практические советы по безопасности и производительности
robots.txt не защищает от атак и не скрывает админку от злоумышленников. Он лишь подсказывает роботам, куда не ходить. Для безопасности используйте нормальную защиту входа, сложные пароли, ограничение попыток авторизации и обновления ядра, тем и плагинов.
Если цель — снизить нагрузку, сначала смотрите на реальные источники запросов: внутренний поиск, бесконечные параметры, мусорные архивы, боты, которые игнорируют robots.txt. Иногда полезнее закрыть проблемный URL на уровне сервера или настроить кэш, чем бесконечно править директивы.
Для сайтов, где техническая чистка и управление дублями уже стали регулярной задачей, удобно держать под рукой инструменты вроде Clearfy Pro: он помогает централизованно управлять частью SEO-настроек и служебных элементов WordPress. Но даже с плагином всё равно нужно понимать, что именно вы закрываете и зачем.
Если после правки robots.txt вы видите, что важные страницы перестали сканироваться, откатите изменения и проверьте файл по шагам: сначала доступность, потом директивы, потом влияние на индексацию. В таких задачах лучше минимальная конфигурация, чем «идеальный» файл с десятком спорных правил.