Перейти к содержанию
← Все статьи Google 403 Forbidden: почему Googlebot не пускают и как это чинить

Google 403 Forbidden: почему Googlebot не пускают и как это чинить

Ответ 403 роботу убирает страницу из индекса и при этом не снижает частоту обхода. Разбираем по документации Google, как найти такие URL и что отдавать вместо 403.

403 в ответ Googlebot — это не сработавшая защита, а страница, уходящая из индекса. Google формулирует это прямо в отчёте об индексировании: код 403 означает, что агент передал учётные данные и получил отказ, но «Googlebot никогда не передаёт учётные данные, поэтому сервер возвращает эту ошибку неправильно». Страница не будет проиндексирована.

Этим 403 отличается от большинства проблем обхода. Почти никогда это не осознанное решение по конкретной странице. Это правило фаервола, фильтр ботов или ограничение частоты, под которое Googlebot попал случайно, — а владелец сайта узнаёт об этом через недели, когда трафик уже ушёл.

Что Google делает с ответом 403

Документация по обходу обрабатывает всё семейство 4xx одинаково, с одним исключением: «Все ошибки 4xx, кроме 429, обрабатываются одинаково: сканеры Google сообщают следующей системе обработки, что контента не существует». Для поиска из этого следуют два последствия, записанные в том же документе:

  • «конвейер индексирования удаляет URL из индекса, если он был проиндексирован ранее»;
  • «Любой контент, который Google получает с URL, возвращающих код 4xx, игнорируется» — то есть что бы ни было написано на вашей странице ошибки, как контент это не читается.

Ни отсрочки, ни промежуточного состояния в документации нет. Страница, отвечающая 403, для Google — исчезнувшая страница. Остальное семейство 4xx ведёт себя так же: 401, 404, 410 и 411 заканчиваются одним и тем же, поэтому и чинится всё одинаково, какой бы из них ни отдавал сервер.

403 не замедляет обход — и в этом главная ошибка

Большинство 403 для Googlebot появились потому, что кто-то хотел меньше ботового трафика. Документация отвечает ровно на это: «Не используйте коды 401 и 403 для ограничения частоты сканирования. Коды 4xx, кроме 429, не влияют на частоту сканирования».

То есть блокировка не делает ничего с нагрузкой и делает всё с индексом. Задокументированный сигнал о перегрузке — 429: сканеры Google «воспринимают его как сигнал о перегрузке сервера», и обрабатывается он как ошибка сервера, а не как отсутствие страницы. Если цель — разгрузить сервер, ответ 429, а 403 — это ущерб.

Почему в браузере страница открывается, а Googlebot её не видит

Именно поэтому 403 трудно заметить: вы открываете URL, и он работает. Правила, которые его порождают, почти всегда условные, и условие — почти никогда не «этот URL».

Что срабатываетПочему под это попадает Googlebot
Правило WAF или антибот-защитыПравило ловит user-agent или шаблон запросов, а трафик сканера выглядит ровно так, как шаблон, против которого правило писали.
Ограничение частоты по user-agentGooglebot запрашивает много URL за короткое время — именно та форма, которую простое правило считает злоупотреблением.
ГеоблокировкаGoogle сканирует преимущественно с американских адресов. Белый список стран без них блокирует сканер, а не аудиторию.
Защита от хотлинка и проверка refererУ запросов сканера нет referer, поэтому правило, которое его требует, отказывает.
Забытая авторизация со стейджаBasic auth или белый список IP переживает запуск: главная открыта, разделы глубже — нет.
Пейвол или закрытый разделОсознанно, но тогда этих URL не должно быть ни в sitemap, ни во внутренних ссылках.

Вторая ловушка: правило может блокировать запросы, которые называют себя Googlebot, тогда как настоящего сканера можно проверить. Google документирует два способа подтвердить, что запрос действительно пришёл от его сканеров: обратный DNS-запрос или сверка IP с опубликованными диапазонами Googlebot. Фильтрация только по строке user-agent блокирует настоящий сканер и пропускает поддельный.

Как найти все 403 на своём сайте

Три проверки по порядку, от самой широкой к самой точной. Ни одна не требует платного инструмента.

  1. Просканируйте сайт и прочитайте колонку статусов. Краул покажет, какие URL отвечают 403 прямо сейчас, включая те, о которых Search Console ещё не сообщила, потому что не перезапрашивала их. Наш сканер сайта выводит код ответа для каждого найденного URL.
  2. Проверьте конкретный список URL. Если раздел уже под подозрением — каталог, фильтры, постраничная навигация, — вставьте список в проверку редиректов и статусов и читайте коды пачкой, а не по одному.
  3. Посмотрите, что уже записала Search Console. В отчёте об индексировании есть статус с точной формулировкой «Доступ заблокирован (ошибка 403)». Наш инструмент проблем индексации группирует такие URL, чтобы было видно: это шаблон, папка или весь сайт.

Чтобы доказать, что конкретный URL отказывает именно Googlebot, а не вам, запустите живую проверку в инструменте проверки URL. Он запрашивает страницу как Google и показывает фактически полученный ответ — это закрывает спор «у меня открывается» одним кликом.

Как чинить — по причинам

Починка — это не «отдавать 200 всему подряд». Это привести ответ в соответствие с назначением URL.

СитуацияПравильный ответ
Страница должна быть в поискеПропустить сканер. Проверять запрос по-настоящему, а не фильтровать по user-agent.
Сервер действительно перегружен429, а не 403: это задокументированный сигнал перегрузки, и обрабатывается он как ошибка сервера.
Страницу вообще не надо обходитьЗапретить в robots.txt, чтобы сканер не тратил на неё запросы.
Страницы больше нет410 или 404 — оба убирают её из индекса и оба говорят правду.
Контент переехал301 на новый адрес.
Раздел закрыт намеренно403 оставить, но убрать URL из sitemap и из внутренних ссылок.

После исправления отправьте на переобход несколько затронутых URL, а не все: сканер вернётся сам, когда страницы начнут отвечать нормально. Остальные решения по кодам ответа собраны в нашем справочнике HTTP-статусов.

За чем следить после исправления

403, который держался неделями, не отыгрывается в день починки. Страницы должны быть переобойдены, обработаны и переиндексированы, и сроков на это документация Google не называет. Следить можно за формой: число в статусе «Доступ заблокирован (ошибка 403)» должно падать, а показы по затронутым URL вернутся раньше кликов. Если за пару недель число не сдвинулось вообще — правило всё ещё срабатывает для сканера, хотя для вас уже нет, и это возвращает к проверке подлинности выше. Отчёты для всего этого — в инструментах Search Console.

FAQ по статье

Короткие ответы на частые вопросы по теме статьи.

Что означает ошибка Google 403 Forbidden?
Сервер понял запрос и отказался его выполнять. Применительно к Googlebot Google пишет, что такой ответ возвращается неправильно: Googlebot никогда не передаёт учётные данные, поэтому 403 не может быть ответом на неудачную авторизацию, которой не было.
Удаляет ли 403 страницу из Google?
Да. В документации по обходу сказано, что при ответе 4xx конвейер индексирования удаляет URL из индекса, если он был проиндексирован ранее, а любой контент, полученный с таким кодом, игнорируется.
Можно ли ограничить частоту обхода с помощью 403?
Нет, и Google говорит об этом прямо: не используйте 401 и 403 для ограничения частоты сканирования, потому что коды 4xx, кроме 429, на неё не влияют. Задокументированный сигнал о перегрузке — 429.
Почему страница открывается у меня, но отдаёт 403 роботу?
Правило, которое его порождает, условное — по user-agent, частоте запросов, стране или отсутствию referer. Ваш браузер под условие не попадает, а сканер попадает. Живая проверка URL показывает ответ, который Google получил на самом деле.
Как проверить, что запрос действительно от Googlebot?
Google документирует два способа: обратный DNS-запрос по IP или сверка IP с опубликованными диапазонами Googlebot. Фильтрация только по строке user-agent блокирует настоящий сканер и пропускает любого, кто им притворяется.
Через сколько страницы вернутся после исправления?
Сроков Google не публикует. Сначала страницы нужно переобойти и обработать, поэтому показы возвращаются раньше кликов. Если за пару недель число 403 в отчёте об индексировании не упало, правило всё ещё срабатывает для сканера.