Перейти до вмісту
🚀
Просунуте SEO
Урок 8 з 9 · Майбутнє SEO
БЕЗКОШТОВНО +55 XP

SEO та великі мовні моделі: що відомо з документації

SEO та великі мовні моделі — це питання про те, як вміст вашого сайту використовують ШІ-асистенти й пошукові функції на основі мовних моделей. Поширена назва — «AEO» (оптимізація під пошукові відповіді): це термін галузі, а не постачальників. Головний факт із їхньої власної документації: у кожного постачальника кілька різних роботів — для навчання моделей, для пошуку та для запитів, ініційованих користувачем, і ними можна керувати окремо. Як саме модель добирає джерела для відповіді, постачальники не публікують, тому чесного «рецепта цитування» немає. Нижче — що задокументовано, як цим керувати і що з популярних тверджень («посилання з Вікіпедії = навчальні дані», «5000 згадок проти 200») не підтверджено.

💬
Користувач питає асистента замість пошуку
«Який SEO-інструмент обрати для невеликого бізнесу?» Асистент відповідає одразу. Сайти можуть бути у відповіді посиланнями, а можуть і ні. Що в наших силах: не закрити доступ випадково й робити матеріал, який можна процитувати.

Різні роботи для різних завдань

ПостачальникРоботПризначення (за документацією постачальника)
OpenAI (довідка)OAI-SearchBotпоказує сайти в результатах пошуку ChatGPT; сайти, що відмовилися від нього, не показуються у відповідях пошуку ChatGPT, хоча можуть лишатися навігаційними посиланнями
GPTBotобхід для вмісту, який може використовуватися для навчання моделей; заборона означає, що вміст не має використовуватися для навчання
ChatGPT-Userвідвідування на запит користувача; правила robots.txt можуть не застосовуватися; не визначає, чи зʼявиться вміст у пошуку
Perplexity (довідка)PerplexityBotпоказує й повʼязує сайти в результатах Perplexity; не використовується для обходу під базові моделі
Perplexity-Userдії на запит користувача; оскільки запит ініційований користувачем, зазвичай ігнорує robots.txt
Anthropic (довідка)ClaudeBotзбір вмісту, який може братися до навчання; обмеження означає, що майбутні матеріали виключаються з навчальних наборів
Claude-Userдоступ до сайтів за запитаннями користувача; вимкнення може знизити видимість у пошуку за запитом користувача
Claude-SearchBotпокращує якість результатів пошуку; вимкнення може знизити видимість і точність у результатах
Google (загальні роботи Google)Google-Extendedокремий токен robots.txt без власного user agent (обхід ведеться звичайними роботами Google); керує використанням вмісту для навчання майбутніх моделей Gemini та для привʼязки до джерел у Gemini Apps й інших системах Google; AI Overviews і AI Mode — частина Пошуку (функції ШІ, AI Overviews)

Налаштування незалежні: OpenAI, наприклад, пише, що можна дозволити OAI-SearchBot, щоб зʼявлятися в результатах пошуку, і заборонити GPTBot, щоб вміст не використовувався для навчання. Застосування змін у robots.txt триває близько доби в OpenAI та Perplexity. Anthropic підтримує нестандартну директиву Crawl-delay і поважає заборони в robots.txt.

Як керувати доступом

  1. Вирішіть за призначенням. Хочете зʼявлятися у відповідях асистентів — дозвольте пошукові роботи постачальників (OAI-SearchBot, PerplexityBot, Claude-SearchBot). Не хочете, щоб вміст використовувався для навчання, — забороніть навчальні (GPTBot, ClaudeBot) і Google-Extended.
  2. Памʼятайте про роботів «на запит користувача». ChatGPT-User і Perplexity-User діють на запит людини; правила robots.txt до них можуть не застосовуватися, і закриття звичайних роботів їх не зупинить.
  3. Перевірте інфраструктуру. Файли robots.txt треба розміщувати на кожному піддомені; CDN, WAF і захист від ботів можуть блокувати роботів незалежно від robots.txt — Perplexity прямо радить додавати своїх роботів до дозволених за user agent і публікованими діапазонами IP (robots.txt).
  4. Перевірте за журналами. Подивіться в журналах сервера звернення з названими постачальниками user agent і звірте IP з опублікованими списками: OpenAI та Perplexity публікують діапазони адрес. Обходи вашим краулером перевіряють доступність сторінок так, як їх бачить робот без скриптів.

Що лишається гіпотезою

  • «Моделі знаходять вміст через навчальні дані та RAG». Це спрощення: у постачальників окремі роботи для пошуку, навчання й користувацьких запитів. Як модель добирає джерела для відповіді, ніде не опубліковано.
  • «Вікіпедія й довідники потрапляють до навчальних даних, отже, треба потрапити туди». У документації не сказано; а згадки в публікаціях — частина звичайної роботи з репутацією (тактики здобування посилань), яку не можна перетворювати на схему.
  • «5000 згадок проти 200 — причина відсутності у відповіді». Окрема історія; кореляція не доводить причину (SEO-експерименти).
  • «Переходів майже немає, крім Perplexity». Документації щодо часток немає; OpenAI пише, що сайти показуються в результатах пошуку ChatGPT, а Perplexity — що PerplexityBot показує й повʼязує сайти.

Що переноситься з SEO для Google

Рекомендації Google для функцій ШІ кажуть: спеціальної оптимізації немає, потрібні індексація, показ зі сніпетом, корисний і надійний вміст для людей, важливий вміст у вигляді тексту, структуровані дані, що збігаються з видимим текстом, а спеціальної розмітки чи файлів «для ШІ» не потрібно (функції ШІ). На практиці ті самі основи допомагають і в інших системах: ясні відповіді на конкретні питання, перевірювані факти з джерелами й датами, зрозуміла авторська та редакційна інформація (E-E-A-T, корисний контент). Але це практика: жодного постачальника, окрім Google, ми тут не цитуємо як джерело правил добору відповіді.

Контент, створений за допомогою ШІ

Якщо ви самі використовуєте генеративні моделі, Google вимагає перевіряти точність вручну й додавати цінність: масове створення сторінок без користі для читачів може порушувати політику проти масштабного контенту (посібник щодо генеративного ШІ, політики проти спаму).

Чек-лист

  1. Рішення про доступ ухвалено окремо для пошукових, навчальних і користувацьких роботів.
  2. robots.txt перевірено на кожному піддомені; WAF і CDN не блокують потрібних роботів.
  3. У журналах сервера видно, які роботи приходять; IP звірено з опублікованими діапазонами.
  4. Важливий вміст доступний у вигляді тексту; факти перевірювані, дати й джерела вказано.
  5. Немає «файлів для ШІ» та розмітки «для ШІ» в розрахунку на Google: вона не потрібна.
  6. Гіпотези про цитування перевіряються на власних даних, а не приймаються на віру.

Помилки

  • Закрити пошукових роботів постачальника, думаючи, що закриваєте лише навчання.
  • Вважати, що заборона в robots.txt зупинить запити за ініціативою користувача.
  • Вважати «AEO» набором задокументованих правил.
  • Масово розміщувати згадки заради асистентів замість реальної користі.
  • Забувати про блокування роботів на рівні CDN і WAF.

Що далі

Далі — майбутнє SEO: які зміни в пошуку вже підтверджені документацією, які лишаються прогнозами та як будувати професійні навички, не привʼязуючись до однієї системи.

🎯
Завдання до уроку
Перевірте розуміння та отримайте +20 XP
← AI Overviews: що каже документація Google
Урок 8 з 9
Перейти до завдання →