403 в ответ Googlebot — это не сработавшая защита, а страница, уходящая из индекса. Google формулирует это прямо в отчёте об индексировании: код 403 означает, что агент передал учётные данные и получил отказ, но «Googlebot никогда не передаёт учётные данные, поэтому сервер возвращает эту ошибку неправильно». Страница не будет проиндексирована.
Этим 403 отличается от большинства проблем обхода. Почти никогда это не осознанное решение по конкретной странице. Это правило фаервола, фильтр ботов или ограничение частоты, под которое Googlebot попал случайно, — а владелец сайта узнаёт об этом через недели, когда трафик уже ушёл.
Что Google делает с ответом 403
Документация по обходу обрабатывает всё семейство 4xx одинаково, с одним исключением: «Все ошибки 4xx, кроме 429, обрабатываются одинаково: сканеры Google сообщают следующей системе обработки, что контента не существует». Для поиска из этого следуют два последствия, записанные в том же документе:
- «конвейер индексирования удаляет URL из индекса, если он был проиндексирован ранее»;
- «Любой контент, который Google получает с URL, возвращающих код 4xx, игнорируется» — то есть что бы ни было написано на вашей странице ошибки, как контент это не читается.
Ни отсрочки, ни промежуточного состояния в документации нет. Страница, отвечающая 403, для Google — исчезнувшая страница. Остальное семейство 4xx ведёт себя так же: 401, 404, 410 и 411 заканчиваются одним и тем же, поэтому и чинится всё одинаково, какой бы из них ни отдавал сервер.
403 не замедляет обход — и в этом главная ошибка
Большинство 403 для Googlebot появились потому, что кто-то хотел меньше ботового трафика. Документация отвечает ровно на это: «Не используйте коды 401 и 403 для ограничения частоты сканирования. Коды 4xx, кроме 429, не влияют на частоту сканирования».
То есть блокировка не делает ничего с нагрузкой и делает всё с индексом. Задокументированный сигнал о перегрузке — 429: сканеры Google «воспринимают его как сигнал о перегрузке сервера», и обрабатывается он как ошибка сервера, а не как отсутствие страницы. Если цель — разгрузить сервер, ответ 429, а 403 — это ущерб.
Почему в браузере страница открывается, а Googlebot её не видит
Именно поэтому 403 трудно заметить: вы открываете URL, и он работает. Правила, которые его порождают, почти всегда условные, и условие — почти никогда не «этот URL».
| Что срабатывает | Почему под это попадает Googlebot |
|---|---|
| Правило WAF или антибот-защиты | Правило ловит user-agent или шаблон запросов, а трафик сканера выглядит ровно так, как шаблон, против которого правило писали. |
| Ограничение частоты по user-agent | Googlebot запрашивает много URL за короткое время — именно та форма, которую простое правило считает злоупотреблением. |
| Геоблокировка | Google сканирует преимущественно с американских адресов. Белый список стран без них блокирует сканер, а не аудиторию. |
| Защита от хотлинка и проверка referer | У запросов сканера нет referer, поэтому правило, которое его требует, отказывает. |
| Забытая авторизация со стейджа | Basic auth или белый список IP переживает запуск: главная открыта, разделы глубже — нет. |
| Пейвол или закрытый раздел | Осознанно, но тогда этих URL не должно быть ни в sitemap, ни во внутренних ссылках. |
Вторая ловушка: правило может блокировать запросы, которые называют себя Googlebot, тогда как настоящего сканера можно проверить. Google документирует два способа подтвердить, что запрос действительно пришёл от его сканеров: обратный DNS-запрос или сверка IP с опубликованными диапазонами Googlebot. Фильтрация только по строке user-agent блокирует настоящий сканер и пропускает поддельный.
Как найти все 403 на своём сайте
Три проверки по порядку, от самой широкой к самой точной. Ни одна не требует платного инструмента.
- Просканируйте сайт и прочитайте колонку статусов. Краул покажет, какие URL отвечают 403 прямо сейчас, включая те, о которых Search Console ещё не сообщила, потому что не перезапрашивала их. Наш сканер сайта выводит код ответа для каждого найденного URL.
- Проверьте конкретный список URL. Если раздел уже под подозрением — каталог, фильтры, постраничная навигация, — вставьте список в проверку редиректов и статусов и читайте коды пачкой, а не по одному.
- Посмотрите, что уже записала Search Console. В отчёте об индексировании есть статус с точной формулировкой «Доступ заблокирован (ошибка 403)». Наш инструмент проблем индексации группирует такие URL, чтобы было видно: это шаблон, папка или весь сайт.
Чтобы доказать, что конкретный URL отказывает именно Googlebot, а не вам, запустите живую проверку в инструменте проверки URL. Он запрашивает страницу как Google и показывает фактически полученный ответ — это закрывает спор «у меня открывается» одним кликом.
Как чинить — по причинам
Починка — это не «отдавать 200 всему подряд». Это привести ответ в соответствие с назначением URL.
| Ситуация | Правильный ответ |
|---|---|
| Страница должна быть в поиске | Пропустить сканер. Проверять запрос по-настоящему, а не фильтровать по user-agent. |
| Сервер действительно перегружен | 429, а не 403: это задокументированный сигнал перегрузки, и обрабатывается он как ошибка сервера. |
| Страницу вообще не надо обходить | Запретить в robots.txt, чтобы сканер не тратил на неё запросы. |
| Страницы больше нет | 410 или 404 — оба убирают её из индекса и оба говорят правду. |
| Контент переехал | 301 на новый адрес. |
| Раздел закрыт намеренно | 403 оставить, но убрать URL из sitemap и из внутренних ссылок. |
После исправления отправьте на переобход несколько затронутых URL, а не все: сканер вернётся сам, когда страницы начнут отвечать нормально. Остальные решения по кодам ответа собраны в нашем справочнике HTTP-статусов.
За чем следить после исправления
403, который держался неделями, не отыгрывается в день починки. Страницы должны быть переобойдены, обработаны и переиндексированы, и сроков на это документация Google не называет. Следить можно за формой: число в статусе «Доступ заблокирован (ошибка 403)» должно падать, а показы по затронутым URL вернутся раньше кликов. Если за пару недель число не сдвинулось вообще — правило всё ещё срабатывает для сканера, хотя для вас уже нет, и это возвращает к проверке подлинности выше. Отчёты для всего этого — в инструментах Search Console.