SEO та великі мовні моделі: що відомо з документації
SEO та великі мовні моделі — це питання про те, як вміст вашого сайту використовують ШІ-асистенти й пошукові функції на основі мовних моделей. Поширена назва — «AEO» (оптимізація під пошукові відповіді): це термін галузі, а не постачальників. Головний факт із їхньої власної документації: у кожного постачальника кілька різних роботів — для навчання моделей, для пошуку та для запитів, ініційованих користувачем, і ними можна керувати окремо. Як саме модель добирає джерела для відповіді, постачальники не публікують, тому чесного «рецепта цитування» немає. Нижче — що задокументовано, як цим керувати і що з популярних тверджень («посилання з Вікіпедії = навчальні дані», «5000 згадок проти 200») не підтверджено.
Різні роботи для різних завдань
| Постачальник | Робот | Призначення (за документацією постачальника) |
|---|---|---|
| OpenAI (довідка) | OAI-SearchBot | показує сайти в результатах пошуку ChatGPT; сайти, що відмовилися від нього, не показуються у відповідях пошуку ChatGPT, хоча можуть лишатися навігаційними посиланнями |
GPTBot | обхід для вмісту, який може використовуватися для навчання моделей; заборона означає, що вміст не має використовуватися для навчання | |
ChatGPT-User | відвідування на запит користувача; правила robots.txt можуть не застосовуватися; не визначає, чи зʼявиться вміст у пошуку | |
| Perplexity (довідка) | PerplexityBot | показує й повʼязує сайти в результатах Perplexity; не використовується для обходу під базові моделі |
Perplexity-User | дії на запит користувача; оскільки запит ініційований користувачем, зазвичай ігнорує robots.txt | |
| Anthropic (довідка) | ClaudeBot | збір вмісту, який може братися до навчання; обмеження означає, що майбутні матеріали виключаються з навчальних наборів |
Claude-User | доступ до сайтів за запитаннями користувача; вимкнення може знизити видимість у пошуку за запитом користувача | |
Claude-SearchBot | покращує якість результатів пошуку; вимкнення може знизити видимість і точність у результатах | |
| Google (загальні роботи Google) | Google-Extended | окремий токен robots.txt без власного user agent (обхід ведеться звичайними роботами Google); керує використанням вмісту для навчання майбутніх моделей Gemini та для привʼязки до джерел у Gemini Apps й інших системах Google; AI Overviews і AI Mode — частина Пошуку (функції ШІ, AI Overviews) |
Налаштування незалежні: OpenAI, наприклад, пише, що можна дозволити OAI-SearchBot, щоб зʼявлятися в результатах пошуку, і заборонити GPTBot, щоб вміст не використовувався для навчання. Застосування змін у robots.txt триває близько доби в OpenAI та Perplexity. Anthropic підтримує нестандартну директиву Crawl-delay і поважає заборони в robots.txt.
Як керувати доступом
- Вирішіть за призначенням. Хочете зʼявлятися у відповідях асистентів — дозвольте пошукові роботи постачальників (
OAI-SearchBot,PerplexityBot,Claude-SearchBot). Не хочете, щоб вміст використовувався для навчання, — забороніть навчальні (GPTBot,ClaudeBot) іGoogle-Extended. - Памʼятайте про роботів «на запит користувача».
ChatGPT-UserіPerplexity-Userдіють на запит людини; правила robots.txt до них можуть не застосовуватися, і закриття звичайних роботів їх не зупинить. - Перевірте інфраструктуру. Файли robots.txt треба розміщувати на кожному піддомені; CDN, WAF і захист від ботів можуть блокувати роботів незалежно від robots.txt — Perplexity прямо радить додавати своїх роботів до дозволених за user agent і публікованими діапазонами IP (robots.txt).
- Перевірте за журналами. Подивіться в журналах сервера звернення з названими постачальниками user agent і звірте IP з опублікованими списками: OpenAI та Perplexity публікують діапазони адрес. Обходи вашим краулером перевіряють доступність сторінок так, як їх бачить робот без скриптів.
Що лишається гіпотезою
- «Моделі знаходять вміст через навчальні дані та RAG». Це спрощення: у постачальників окремі роботи для пошуку, навчання й користувацьких запитів. Як модель добирає джерела для відповіді, ніде не опубліковано.
- «Вікіпедія й довідники потрапляють до навчальних даних, отже, треба потрапити туди». У документації не сказано; а згадки в публікаціях — частина звичайної роботи з репутацією (тактики здобування посилань), яку не можна перетворювати на схему.
- «5000 згадок проти 200 — причина відсутності у відповіді». Окрема історія; кореляція не доводить причину (SEO-експерименти).
- «Переходів майже немає, крім Perplexity». Документації щодо часток немає; OpenAI пише, що сайти показуються в результатах пошуку ChatGPT, а Perplexity — що
PerplexityBotпоказує й повʼязує сайти.
Що переноситься з SEO для Google
Рекомендації Google для функцій ШІ кажуть: спеціальної оптимізації немає, потрібні індексація, показ зі сніпетом, корисний і надійний вміст для людей, важливий вміст у вигляді тексту, структуровані дані, що збігаються з видимим текстом, а спеціальної розмітки чи файлів «для ШІ» не потрібно (функції ШІ). На практиці ті самі основи допомагають і в інших системах: ясні відповіді на конкретні питання, перевірювані факти з джерелами й датами, зрозуміла авторська та редакційна інформація (E-E-A-T, корисний контент). Але це практика: жодного постачальника, окрім Google, ми тут не цитуємо як джерело правил добору відповіді.
Контент, створений за допомогою ШІ
Якщо ви самі використовуєте генеративні моделі, Google вимагає перевіряти точність вручну й додавати цінність: масове створення сторінок без користі для читачів може порушувати політику проти масштабного контенту (посібник щодо генеративного ШІ, політики проти спаму).
Чек-лист
- Рішення про доступ ухвалено окремо для пошукових, навчальних і користувацьких роботів.
- robots.txt перевірено на кожному піддомені; WAF і CDN не блокують потрібних роботів.
- У журналах сервера видно, які роботи приходять; IP звірено з опублікованими діапазонами.
- Важливий вміст доступний у вигляді тексту; факти перевірювані, дати й джерела вказано.
- Немає «файлів для ШІ» та розмітки «для ШІ» в розрахунку на Google: вона не потрібна.
- Гіпотези про цитування перевіряються на власних даних, а не приймаються на віру.
Помилки
- Закрити пошукових роботів постачальника, думаючи, що закриваєте лише навчання.
- Вважати, що заборона в robots.txt зупинить запити за ініціативою користувача.
- Вважати «AEO» набором задокументованих правил.
- Масово розміщувати згадки заради асистентів замість реальної користі.
- Забувати про блокування роботів на рівні CDN і WAF.
Що далі
Далі — майбутнє SEO: які зміни в пошуку вже підтверджені документацією, які лишаються прогнозами та як будувати професійні навички, не привʼязуючись до однієї системи.