Перейти к содержанию
🚀
Основы SEO
Урок 16 из 16 · Технические основы
БЕСПЛАТНО +30 XP

robots.txt: обход, а не индексирование

robots.txt управляет обходом сайта, а не его индексированием. Разница не academic: одной строкой в этом файле можно обнулить видимость сайта, а попытка убрать им страницу из поиска обычно не работает — и документация объясняет почему.

Урок построен по спецификации Google: введение в robots.txt и как Google интерпретирует файл. Второй документ читают редко, а в нём описано поведение, с которым сталкиваются все: кэширование, ответы сервера и лимиты.

📊
Алекс, стажёр · Среда, 09:15
Открываю Google Search Console. Трафик: 0. Страниц в индексе: 0 из 847. Это невозможно: вчера sitemap был чистый, сервер отвечал 200, а сегодня Google будто не может зайти на сайт.
😤
Генеральный директор · 09:18
«АЛЕКС. ТРАФИК ПРОПАЛ. ПОЧЕМУ ИНДЕКСИРУЕТСЯ НОЛЬ СТРАНИЦ ИЗ 847?!»
🤦
Алекс · 09:21
Открываю /robots.txt. Причина на первой строке правил.
User-agent: *
Disallow: /

# временно закрыть сайт от ботов
# не забыть вернуть перед релизом

Что делает robots.txt

robots.txt — текстовый файл в корне хоста: https://example.com/robots.txt. Он говорит добросовестным роботам, какие адреса можно и нельзя сканировать. Основная его задача, как её формулирует документация, — не перегружать сайт запросами.

Ключевая фраза оттуда же: это не механизм, чтобы убрать страницу из Google. Для этого есть noindex или защита паролем.

Разница между обходом и индексированием — то, на чём спотыкаются чаще всего. Disallow запрещает роботу зайти на страницу. Но если на неё ссылаются с других сайтов, Google может проиндексировать сам адрес, не заходя на него: в выдаче появится ссылка без описания. Это прямо описано в документации и означает простую вещь — закрыв страницу от обхода, вы не убрали её из поиска, а лишь лишили Google возможности понять, что на ней.

Из этого же следует главная ловушка: если страница закрыта в robots.txt, робот не увидит на ней noindex. Два запрета, поставленные вместе, гасят друг друга. Термины — в глоссарии: robots.txt и noindex.

Базовый синтаксис

User-agent: *
Disallow: /admin/
Disallow: /cart/
Allow: /
СтрокаЧто означаетКомментарий
User-agent: *Правила для всех роботовДля отдельного робота можно указать Googlebot, Googlebot-Image и т.д.
Disallow: /admin/Не обходить все URL, начинающиеся с /admin/Путь чувствителен к регистру: /Private/ и /private/ разные.
Allow: /Разрешить обход остального сайтаЧаще всего эту строку можно не писать, но для новичка она делает намерение очевидным.
Sitemap: https://example.com/sitemap.xmlПодсказать путь к XML-карте сайтаЭту строку можно размещать отдельно от групп правил.

Границы файла и лимиты

Три вещи из спецификации, которые экономят часы отладки.

ПравилоЧто это значит на практике
Файл действует на свой протокол, хост и портrobots.txt для https://example.com не управляет обходом http://example.com и поддомена shop.example.com — у каждого свой файл
Google учитывает не больше 500 КиБВсё, что за этим пределом, игнорируется. Огромный файл с тысячами строк — признак того, что правила пора обобщить
Пути чувствительны к регистру/Private/ и /private/ — разные правила

Синтаксис целиком, с примерами директив и порядком применения правил, описан в руководстве по созданию файла.

Опасные строки

User-agent: *
Disallow: /

Эта комбинация закрывает от обхода весь сайт. Иногда её ставят на dev-версии и забывают убрать при релизе. Для SEO это один из самых быстрых способов обнулить видимость.

User-agent: *
Disallow:

Пустой Disallow означает: ничего не запрещено. Это не ошибка, но выглядит двусмысленно для неопытного человека. Для публичного сайта часто проще оставить только sitemap или явно документировать намерение комментарием.

User-agent: *
Disallow: /*?sort=
Disallow: /*?filter=

Паттерны помогают ограничивать мусорные параметры, но их нужно проверять на реальных URL. Одна широкая маска может случайно закрыть полезные фильтры, страницы пагинации или листинги, которые должны получать трафик.

Что происходит, когда файл недоступен

Про это не думают, пока не случится. А случается регулярно: сервер лёг, деплой сломал маршрут, CDN отдал ошибку. Поведение Google описано в спецификации и отличается для разных ответов.

Ответ сервераЧто делает Google
4xx, кроме 429Считает, что файла нет вовсе, и ограничений на обход нет. Ответ 404 на robots.txt — нормальная ситуация, а не проблема
5xxПервые 12 часов прекращает обход сайта, продолжая запрашивать файл. Дальше до 30 дней использует последнюю удачную версию
РедиректПроходит не меньше пяти переходов, затем считает это ответом 404
⚠️ Строка про 5xx — самая недооценённая. Сервер, который час отдаёт ошибку на /robots.txt, останавливает обход всего сайта, а не только этого файла.

И ещё одно, из-за чего кажется, что правка не сработала: Google кэширует содержимое файла обычно до суток. Убрав ошибочный Disallow: /, вы не увидите эффекта мгновенно — это нормально, а не повод править файл ещё раз.

Правило для noindex

Если цель — убрать страницу из поиска, не начинайте с Disallow. Оставьте страницу доступной для обхода и поставьте:

<meta name="robots" content="noindex">

Для файлов, у которых нет HTML — PDF, изображений — используется заголовок X-Robots-Tag. Оба способа и их синтаксис описаны в документации о мета-теге robots, а общий порядок удаления страницы — в руководстве о блокировке индексирования.

Последовательность важна: сначала дайте Google увидеть noindex и убрать адрес из индекса, и только потом, если нужно, ограничивайте обход. В обратном порядке страница останется в выдаче — без описания и без возможности это исправить.

Как проверить файл

Проверка занимает пять минут и делается тремя способами, от быстрого к точному.

  1. Откройте /robots.txt в браузере. Файл отдаётся с кодом 200? Нет ли в нём Disallow: / для боевого сайта?
  2. Посмотрите отчёт robots.txt в Search Console: какую версию файла Google видит сейчас и когда получил её. Здесь же видны ошибки разбора.
  3. Проверьте конкретный адрес через инструмент проверки URL. Если причина — «Заблокировано в файле robots.txt», вы нашли проблему. Массово это делает аудит URL.

Сколько страниц выпало из индекса и почему, показывает отчёт об индексировании; расхождение между тем, что есть на сайте, и тем, что видит поиск, — разрыв охвата. Термины — в глоссарии: краулинговый бюджет и покрытие индекса.

Нормальный robots.txt для небольшого сайта

User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /search

Sitemap: https://example.com/sitemap.xml
Перед релизом проверь:

файл доступен по /robots.txt и отдаёт 200;
нет случайного Disallow: / для боевого сайта;
важные шаблоны открыты для Googlebot;
sitemap указан полным URL;
в GSC URL Inspection нет причины «Blocked by robots.txt» для нужных страниц.

Практика: проверьте свой robots.txt

Пять шагов, десять минут:

  1. Откройте https://ваш-домен/robots.txt. Прочитайте файл целиком — обычно это двадцать строк, и половина из них давно не нужна.
  2. Выпишите каждую строку Disallow и ответьте, что именно она закрывает. Если ответа нет, строка кандидат на удаление.
  3. Проверьте, не закрыты ли CSS, JS и изображения. Без них Google хуже понимает страницу — посмотрите её глазами робота через анализатор страницы.
  4. Убедитесь, что ни одна страница с noindex не закрыта в robots.txt одновременно. Это самая частая пара ошибок, и она оставляет страницу в выдаче навсегда.
  5. Проверьте поддомены: у каждого свой файл. Обход всего сайта покажет краулер, а состояние карты сайта — мониторинг sitemap.

Как понять, что с файлом всё в порядке

Признак не в том, что файл «правильный», а в том, что вы можете объяснить каждую его строку. Robots.txt — редкий случай, когда короткий файл лучше подробного: чем меньше правил, тем меньше способов случайно закрыть нужное.

Проверить себя можно тремя вопросами. Знаете ли вы, что закрывает каждая строка в вашем файле? Понимаете ли разницу между «не обходить» и «не индексировать»? Заметили бы вы Disallow: /, попавший на прод, в тот же день?

Чего ждать не стоит: что robots.txt уберёт страницу из поиска или защитит закрытый раздел. Файл публичный — любой может его открыть, — и перечисленные в нём пути видны всем. Секретные каталоги в нём не прячут, а рекламируют.

Что дальше

Это последний урок курса «Основы SEO». Если начинали не с начала, стоит вернуться к Google Search Console: почти каждая проверка из этого урока делается там. Предыдущий урок, про платформы и инструменты, — здесь.

😌
Алекс · 09:45
Убрал Disallow: /, оставил закрытыми только служебные разделы и добавил sitemap. Теперь Google снова сможет обойти важные страницы.
🎯
Задание к уроку
Проверьте понимание и получите +20 XP
← SEO-платформы: факты против оценок
Урок 16 из 16
Перейти к заданию →