Перейти до вмісту
📊
Аналітика, алгоритми й аудит
Урок 11 з 15 · SEO-аудит
БЕЗКОШТОВНО +50 XP

Аудит краулінгу та індексації

Аудит краулінгу та індексації — це перевірка того, чи можуть пошукові роботи дійти до важливих сторінок і отримати від них потрібне. Це перший блок будь-якого аудиту, бо він відповідає на найдешевше й найважливіше питання: чи відповідає сторінка вимогам, за якими Google її взагалі розглядає. Нижче — що означають коди відповіді в термінах Google, що перевіряти в краулері та у звіті про індексування і які висновки з цього робити. Структура перевірок — практика, а відповіді на «що буде з кодом N» взято з документації.

Основа — довідка Google про коди HTTP і мережеві помилки, перенаправлення та звіт про індексування сторінок. Загальний порядок аудиту — в уроці про систему аудиту.

🕷️
Краулер закінчив обхід
«Частина адрес віддає 404, на кількох важливих сторінках стоїть noindex, а ланцюжки перенаправлень довші, ніж треба. Робота на місяць, якщо розставити пріоритети.»

Що означають коди відповіді для Google

КодЯк чинить GoogleЩо робити
200передає отримане в індексацію; індексувати може, але не зобовʼязанийнорма; але якщо на сторінці повідомлення про помилку, буде soft 404
301, 308йде за перенаправленням; ціль — сильний сигнал обробкизамінити внутрішні посилання на кінцеву адресу
302, 307йде за замовчуванням, але ціль — слабкий сигналпереконатися, що перенаправлення справді тимчасове
4xx (крім 429)не індексує такі URL; уже проіндексовані видаляє; частота обходу поступово знижуєтьсядля видаленого контенту 404 чи 410 нормальні; для важливих сторінок відновити або перенаправити
429сприймається як сигнал перевантаження сервера й вважається серверною помилкоюперевірити навантаження
5xxGoogle тимчасово сповільнює обхід; проіндексовані URL поки зберігаються, але з часом виключаються; стійкі помилки призводять до видалення з індексутерміново розібратися із сервером; після відновлення швидкість обходу зростає поступово

З таблиці випливають три поправки до звичних уявлень:

Що перевіряти в краулері

  • Адреси з 4xx і 5xx. Які з них важливі, звідки на них ведуть посилання. Не кожен 404 — проблема: видалена сторінка нормально віддає 404. Проблема — 404 у сторінки, що має існувати, і внутрішні посилання на неіснуюче;
  • Soft 404. Це коли сервер відповідає 2xx, але вміст сторінки — порожня сторінка чи повідомлення про помилку; Search Console покаже soft 404. Не перенаправляйте багато старих адрес на одну нерелевантну сторінку, наприклад головну: це теж може трактуватися як soft 404;
  • Ланцюжки та цикли перенаправлень. Googlebot за замовчуванням іде до 10 перенаправлень, але краще вести одразу на кінцеву адресу: ланцюжки додають затримку для користувачів. Перевірити — перевіркою редиректів;
  • noindex на важливих сторінках. Критична й легка для здійснення помилка. Щоб noindex спрацював, сторінка не має бути заблокована в robots.txt;
  • Блокування robots.txt. Закриті CSS і JavaScript заважають Google: він гірше аналізує сторінки, що залежать від цих ресурсів. Див. урок про robots.txt і meta robots;
  • Сторінки-сироти. Google знаходить сторінки за посиланнями й з мап сайту. Сторінка без внутрішніх посилань «невидима» не обовʼязково: якщо вона є в мапі сайту, Google дізнається про неї. Але надійніше давати їй звичайні посилання в елементах a з href. Див. урок про мапи сайту;
  • Дублі та канонічні адреси. Варіанти з параметрами, www і без, HTTP і HTTPS: урок про canonical.

Що дивитися в Search Console

У звіті про індексування сторінок видно стан адрес і причини виключення. Не все в ньому — проблема: статус «Дублікат без канонічної сторінки, вибраної користувачем» — не помилка, а робота за задумом. Нові 404 після оновлення CMS чи редизайну видно в тому самому звіті; масово розібрати адреси допоможе аудит URL, а 404 з органічним трафіком — звіт за органічними 404. Внутрішні посилання, які варто додати першими, показує аудит внутрішніх посилань. Обхід усього сайту — краулер.

Про «краулінговий бюджет»: за документацією Google, він має сенс передусім для дуже великих сайтів; для невеликих обмеження обходу зазвичай не причина проблем. Докладніше — в уроці про обходимість.

Чого в документації немає

  • Твердження, що 301 «передає посилальну вагу», а 302 ні;
  • «Сторінки-сироти невидимі для Googlebot»: Google знаходить сторінки й за мапами сайту;
  • «Ланцюжки сповільнюють краулінг» як формули: названо затримку для користувачів і межу в 10 ланок;
  • обовʼязкової кількості проблем чи норми «добрий аудит за 30 хвилин».

Чек-лист

  1. Важливі сторінки віддають 200 і не містять повідомлень про помилку.
  2. Видалений контент віддає 404 чи 410, а не 200 і не перенаправлення на головну.
  3. Ланцюжків і циклів перенаправлень немає; внутрішні посилання ведуть на кінцеві адреси.
  4. На важливих сторінках немає noindex і блокувань у robots.txt.
  5. CSS і JavaScript, потрібні для відображення, відкриті для Google.
  6. У важливих сторінок є звичайні внутрішні посилання й вони є в мапі сайту.
  7. Помилки 5xx і 429 розібрано: вони сповільнюють обхід.

Помилки

  • Вважати будь-який 404 проблемою й лікувати його перенаправленням на головну.
  • Використовувати 401 і 403 для обмеження швидкості обходу.
  • Закривати в robots.txt сторінки, на яких стоїть noindex.
  • Закривати CSS і JavaScript.
  • Залишати внутрішні посилання на адреси з перенаправленням.

Що далі

Далі — контентний аудит: коли сторінки доступні й проіндексовані, перевіряємо, чи дають вони те, що потрібно читачеві.

🎯
Завдання до уроку
Перевірте розуміння та отримайте +20 XP
← Система SEO-аудиту
Урок 11 з 15
Перейти до завдання →