Перейти до вмісту
← Усі статті Google 403 Forbidden: чому Googlebot не пускають і як це лагодити

Google 403 Forbidden: чому Googlebot не пускають і як це лагодити

Відповідь 403 роботу прибирає сторінку з індексу і при цьому не знижує частоту обходу. Розбираємо за документацією Google, як знайти такі URL.

403 у відповідь Googlebot — це не спрацьований захист, а сторінка, яка йде з індексу. Google формулює це прямо у звіті про індексування: код 403 означає, що агент передав облікові дані й отримав відмову, але «Googlebot ніколи не передає облікові дані, тому сервер повертає цю помилку неправильно». Сторінку не буде проіндексовано.

Цим 403 відрізняється від більшості проблем обходу. Майже ніколи це не усвідомлене рішення щодо конкретної сторінки. Це правило фаєрвола, фільтр ботів або обмеження частоти, під яке Googlebot потрапив випадково, — а власник сайту дізнається про це за тижні, коли трафік уже пішов.

Що Google робить з відповіддю 403

Документація з обходу обробляє всю родину 4xx однаково, з одним винятком: «Усі помилки 4xx, крім 429, обробляються однаково: сканери Google повідомляють наступній системі обробки, що контенту не існує». Для пошуку з цього випливають два наслідки, записані в тому ж документі:

  • «конвеєр індексування видаляє URL з індексу, якщо його було проіндексовано раніше»;
  • «Будь-який контент, який Google отримує з URL, що повертають код 4xx, ігнорується» — тобто що б не було написано на вашій сторінці помилки, як контент це не читається.

Ні відстрочки, ні проміжного стану в документації немає. Сторінка, яка відповідає 403, для Google — зникла сторінка. Решта родини 4xx поводиться так само: 401, 404, 410 і 411 закінчуються тим самим, тому й лагодиться все однаково, який би з них не віддавав сервер.

403 не сповільнює обхід — і в цьому головна помилка

Більшість 403 для Googlebot з'явилися тому, що хтось хотів менше ботового трафіку. Документація відповідає саме на це: «Не використовуйте коди 401 і 403 для обмеження частоти сканування. Коди 4xx, крім 429, не впливають на частоту сканування».

Тобто блокування не робить нічого з навантаженням і робить усе з індексом. Задокументований сигнал про перевантаження — 429: сканери Google «сприймають його як сигнал про перевантаження сервера», і обробляється він як помилка сервера, а не як відсутність сторінки. Якщо мета — розвантажити сервер, відповідь 429, а 403 — це шкода.

Чому в браузері сторінка відкривається, а Googlebot її не бачить

Саме тому 403 важко помітити: ви відкриваєте URL, і він працює. Правила, які його породжують, майже завжди умовні, і умова — майже ніколи не «цей URL».

Що спрацьовуєЧому під це потрапляє Googlebot
Правило WAF або антибот-захистуПравило ловить user-agent або шаблон запитів, а трафік сканера виглядає саме так, як шаблон, проти якого правило писали.
Обмеження частоти за user-agentGooglebot запитує багато URL за короткий час — саме та форма, яку просте правило вважає зловживанням.
ГеоблокуванняGoogle сканує переважно з американських адрес. Білий список країн без них блокує сканер, а не аудиторію.
Захист від хотлінку і перевірка refererУ запитів сканера немає referer, тому правило, яке його вимагає, відмовляє.
Забута авторизація зі стейджаBasic auth або білий список IP переживає запуск: головна відкрита, розділи глибше — ні.
Пейвол або закритий розділУсвідомлено, але тоді цих URL не повинно бути ні в sitemap, ні у внутрішніх посиланнях.

Друга пастка: правило може блокувати запити, які називають себе Googlebot, тоді як справжнього сканера можна перевірити. Google документує два способи підтвердити, що запит дійсно прийшов від його сканерів: зворотний DNS-запит або звірка IP з опублікованими діапазонами Googlebot. Фільтрація лише за рядком user-agent блокує справжній сканер і пропускає підроблений.

Як знайти всі 403 на своєму сайті

Три перевірки по порядку, від найширшої до найточнішої. Жодна не потребує платного інструмента.

  1. Проскануйте сайт і прочитайте колонку статусів. Краул покаже, які URL відповідають 403 прямо зараз, включно з тими, про які Search Console ще не повідомила, бо не перезапитувала їх. Наш сканер сайту виводить код відповіді для кожного знайденого URL.
  2. Перевірте конкретний список URL. Якщо розділ уже під підозрою — каталог, фільтри, посторінкова навігація, — вставте список у перевірку редиректів і статусів і читайте коди пачкою, а не по одному.
  3. Подивіться, що вже записала Search Console. У звіті про індексування є статус із точним формулюванням «Доступ заблоковано (помилка 403)». Наш інструмент проблем індексації групує такі URL, щоб було видно: це шаблон, папка чи весь сайт.

Щоб довести, що конкретний URL відмовляє саме Googlebot, а не вам, запустіть живу перевірку в інструменті перевірки URL. Він запитує сторінку як Google і показує фактично отриману відповідь — це закриває суперечку «у мене відкривається» одним кліком.

Як лагодити — за причинами

Лагодження — це не «віддавати 200 усьому підряд». Це привести відповідь у відповідність до призначення URL.

СитуаціяПравильна відповідь
Сторінка має бути в пошукуПропустити сканер. Перевіряти запит по-справжньому, а не фільтрувати за user-agent.
Сервер справді перевантажений429, а не 403: це задокументований сигнал перевантаження, і обробляється він як помилка сервера.
Сторінку взагалі не треба обходитиЗаборонити в robots.txt, щоб сканер не витрачав на неї запити.
Сторінки більше немає410 або 404 — обидва прибирають її з індексу і обидва кажуть правду.
Контент переїхав301 на нову адресу.
Розділ закрито навмисно403 залишити, але прибрати URL із sitemap і з внутрішніх посилань.

Після виправлення надішліть на переобхід кілька зачеплених URL, а не всі: сканер повернеться сам, коли сторінки почнуть відповідати нормально. Решта рішень щодо кодів відповіді зібрана в нашому довіднику HTTP-статусів.

За чим стежити після виправлення

403, який тримався тижнями, не відіграється в день полагодження. Сторінки потрібно переобійти, обробити і переіндексувати, і строків на це документація Google не називає. Стежити можна за формою: число у статусі «Доступ заблоковано (помилка 403)» має падати, а покази за зачепленими URL повернуться раніше за кліки. Якщо за пару тижнів число не зрушило взагалі — правило досі спрацьовує для сканера, хоча для вас уже ні, і це повертає до перевірки справжності вище. Звіти для всього цього — в інструментах Search Console.

FAQ до статті

Короткі відповіді на часті питання за темою статті.

Що означає помилка Google 403 Forbidden?
Сервер зрозумів запит і відмовився його виконувати. Щодо Googlebot Google пише, що така відповідь повертається неправильно: Googlebot ніколи не передає облікові дані, тому 403 не може бути відповіддю на невдалу авторизацію, якої не було.
Чи видаляє 403 сторінку з Google?
Так. У документації з обходу сказано, що за відповіді 4xx конвеєр індексування видаляє URL з індексу, якщо його було проіндексовано раніше, а будь-який контент, отриманий із таким кодом, ігнорується.
Чи можна обмежити частоту обходу за допомогою 403?
Ні, і Google каже про це прямо: не використовуйте 401 і 403 для обмеження частоти сканування, бо коди 4xx, крім 429, на неї не впливають. Задокументований сигнал про перевантаження — 429.
Чому сторінка відкривається в мене, але віддає 403 роботу?
Правило, яке його породжує, умовне — за user-agent, частотою запитів, країною або відсутністю referer. Ваш браузер під умову не потрапляє, а сканер потрапляє. Жива перевірка URL показує відповідь, яку Google отримав насправді.
Як перевірити, що запит справді від Googlebot?
Google документує два способи: зворотний DNS-запит за IP або звірка IP з опублікованими діапазонами Googlebot. Фільтрація лише за рядком user-agent блокує справжній сканер і пропускає будь-кого, хто ним прикидається.
За скільки сторінки повернуться після виправлення?
Строків Google не публікує. Спершу сторінки треба переобійти й обробити, тому покази повертаються раніше за кліки. Якщо за пару тижнів число 403 у звіті про індексування не впало, правило досі спрацьовує для сканера.