Перейти к содержанию
🚀
Основы SEO
Урок 9 из 16 · ИИ и поиск
БЕСПЛАТНО +50 XP

Как работают LLM и что они читают на сайте

Языковые модели работают с сайтом не так, как человек: они не читают страницу подряд, а режут текст на куски, ищут среди них подходящие по смыслу и собирают ответ из найденного. Понимание этого механизма объясняет, почему короткий самодостаточный раздел цитируется чаще, чем длинная статья, — и почему «плотность ключевых слов» здесь не даёт ничего.

Механика моделей — не зона ответственности Google, и документации на неё нет. Зато есть документация на то, что из неё следует для сайта: ИИ-функции в поиске и как работает поиск. На них и будем опираться, когда речь зайдёт о выводах.

🧑‍💻
Алекс · Вторник, 16:00
«Катя спросила: "А как вообще работает ChatGPT? Он что, читает наш сайт?" Алекс отложил мышь — вопрос правильный, но ответ занял у него 30 минут.»

В предыдущем уроке мы разобрали, где появляются ИИ-ответы и что для попадания в них требует Google. Теперь — как именно устроена машина, которая этот ответ собирает. Это знание нужно не ради терминов: оно позволяет отличить осмысленный совет по структуре текста от продажи «секретной разметки».

Модель не «понимает» — она предсказывает следующий токен

Это самое важное предложение урока. Большая языковая модель — не разум и не «искусственный интеллект» в фантастическом смысле. Это нейросеть, обученная на огромном корпусе текста, которая делает одну вещь: предсказывает следующий токен — слово или часть слова. Когда вы вводите «погода в Киеве сегодня», модель не знает погоду. Она подбирает наиболее вероятное продолжение такой фразы.

Размеры современных моделей их разработчики не публикуют, поэтому числа вида «столько-то триллионов параметров», которые ходят по статьям, проверить невозможно. Для работы это и не нужно: практическое значение имеют три свойства, а не размер.

Свойство моделиЧто из него следует для сайта
Обучение закончилось на конкретной датеСвежая информация — цены, новости, обновления — приходит не из обучения, а из поиска по вебу в момент запроса. Это и есть точка входа для вашей страницы
Модель может уверенно выдуматьДолю таких ошибок никто не измерял так, чтобы результат можно было воспроизвести. Но именно из-за них ответы стали ссылаться на источники: ссылка работает как опора
Модель воспроизводит частоеЧем чаще о вас пишут в контексте темы, тем выше шанс оказаться в ответе. Упоминания работают, даже когда ссылки нет

Дата обучения: почему модель не знает вчерашних новостей

У каждой модели есть точка, после которой она не знает ничего: дата окончания сбора обучающих данных. Спросите о событии, случившемся позже, — и без доступа к вебу модель либо признается, либо выдумает.

Конкретные даты по моделям здесь намеренно не перечислены: они меняются с каждым релизом, и любой такой список устаревает быстрее, чем урок. Проверять нужно в первоисточнике — в документации разработчика модели, а ещё проще спросить саму модель и сверить ответ с её карточкой.

Практический вывод один и он не меняется: чтобы модель сослалась на вас в ответе на свежий запрос, ваша страница должна быть найдена в момент запроса. Обучить чужую модель на своём контенте отдельный бизнес не может. Попасть в результаты поиска, по которым модель собирает ответ, — может.

Отсюда же ответ на частый вопрос «закрывать ли сайт от ИИ-ботов». Список агентов Google и то, что каждый из них делает, собраны в документации о краулерах. Закрывая их, вы закрываете и попадание в ответы — решение осмысленное только тогда, когда вы этого действительно хотите.

Retrieval: как ИИ-поиск находит вашу страницу

Все современные ИИ-ответы строятся по одной схеме: сначала поиск, потом генерация. Модель не держит ваш сайт в памяти — она получает найденные фрагменты как контекст и пишет ответ по ним. Отсюда четыре шага:

❓
Запрос
Пользователь спрашивает
→
🔍
Retrieve
Система ищет страницы
→
✂️
Chunk
Режет на кусочки
→
💬
Generate
LLM собирает ответ

На шаге Retrieve система находит релевантные страницы в индексе. На шаге Chunk из каждой страницы выбирается не вся страница, а фрагмент, который точнее отвечает на вопрос. На шаге Generate модель получает эти фрагменты и собирает из них ответ. Ссылки под ответом — это адреса страниц, откуда фрагменты взяты.

Похожим образом устроен и обычный поиск: Google описывает, что ответ может опираться на отдельный фрагмент страницы, а для ИИ-функций — что запрос разветвляется на несколько связанных поисков по подтемам. Подробности — в разделе о ИИ-функциях.

📌 Главное следствие для контента: цитируется не страница, а фрагмент. Если у вас отличная страница на 5000 слов, но в ней нет ни одного самодостаточного куска, который сам по себе отвечает на конкретный вопрос, — брать нечего. Выигрывает текст, собранный из коротких плотных разделов, каждый из которых закрывает свой подвопрос.

Токены и эмбеддинги: как машина сравнивает смысл

Два понятия, которые объясняют, почему «плотность ключевых слов» перестала работать, а полнота раскрытия темы — работает.

ПонятиеЧто этоЧто меняет в тексте
ТокенМинимальная единица текста для модели: слово целиком или его часть. Длинные и редкие слова разбиваются на несколько токеновКонтекстное окно измеряется в токенах — это сколько модель может прочитать за раз. Вода в тексте тратит его впустую
ЭмбеддингФрагмент текста превращается в набор чисел — координаты в смысловом пространстве. «Купить кроссовки» и «приобрести беговую обувь» получают близкие координаты, хотя слова разныеПовторять точную формулировку не нужно: близость считается по смыслу, а не по совпадению строк
Близость векторовМера того, насколько два набора координат смотрят в одну сторону. По ней система выбирает, какой фрагмент ближе к запросуПлотный конкретный абзац даёт отчётливые координаты; размытый — размытые, и проигрывает соседу

Практический смысл двойной. Хорошая новость: не нужно повторять «купить кроссовки» семь раз — синонимы и контекст учитываются. Плохая: текст из общих фраз проигрывает конкретному, даже если формально содержит нужные слова. Посмотреть на свой текст с этой стороны помогают анализ плотности и оценка качества текста.

Фрагменты: как длина раздела влияет на цитирование

Системы поиска режут текст на фрагменты. Размер — всегда компромисс: короткий фрагмент точно попадает в узкий вопрос, но теряет контекст; длинный сохраняет контекст, но содержит лишнее и хуже совпадает с конкретным запросом. Точных размеров ни Google, ни разработчики ассистентов не публикуют, и полагаться на «правильное число токенов» бессмысленно.

Что можно сказать уверенно: раздел, который читается самостоятельно, цитировать легче, чем кусок, вырванный из середины сплошного текста. Отсюда практическое правило — не числовое, а смысловое: каждый раздел должен отвечать на один вопрос целиком, не требуя чтения соседних.

Что вы пишетеКак это читается машиной
Короткий раздел под своим подзаголовком, один вопрос — один ответГотовый самодостаточный фрагмент
Длинный раздел, где ответ собирается из четырёх абзацев подрядЛюбой отдельный кусок неполон, и брать его рискованно
Абзац, начинающийся со слов «как мы говорили выше»Вне страницы не читается вообще

Последняя строка — самая частая ошибка. Ссылки внутри текста на «выше» и «ниже» привязывают абзац к странице и делают его непригодным для цитирования.

Как выглядит страница, которую удобно цитировать

ПараметрОбычная страницаСтраница, которую удобно взять в ответ
Введение«В этой статье мы расскажем… компания основана в 2010…»Прямой ответ на вопрос в первых двух-трёх предложениях
Заголовки«Введение», «Описание», «Заключение»Формулировки вопросов: «Сколько стоит X», «Как настроить Y»
Длина разделаПолторы тысячи слов под одним подзаголовкомРаздел, который читается отдельно и закрывает один подвопрос
Утверждения«Это очень важный фактор» — без опоры«Google показывает FAQ-результаты только для государственных и медицинских сайтов» — со ссылкой на объявление и датой
ПредложенияДлинные, с тремя придаточными и оговоркамиКороткие: «X — это Y, потому что Z»
АвторАноним или «команда экспертов»Имя, чем человек занимается, ссылка на его страницу

Про последнюю строку: имя автора и дату обновления можно продублировать в разметке — поля описаны в схеме для статьи. Это не «разметка для ИИ», которой не существует, а обычные структурированные данные; термин разобран в глоссарии: структурированные данные.

Шесть правил для текста, который удобно цитировать

1. Один раздел — один вопрос

Прочитав только этот раздел, человек должен понять его тему без обращения к остальной странице. Это и есть та самая самодостаточность, ради которой всё остальное. Если раздел разросся и отвечает уже на три вопроса — разделите его подзаголовками.

2. Короткие предложения вместо сложноподчинённых

«SEO — это работа над тем, чтобы страницу находили в поиске» читается лучше, чем «SEO, в широком смысле понимаемое как процесс оптимизации сайтов под поисковые системы, способствующий улучшению их видимости в органической выдаче». Второе предложение размазывает смысл и проигрывает при сравнении с запросом — и человеку читать его тяжелее.

3. Заголовки — формулировки вопросов

Не «Преимущества X», а «Зачем нужен X». Не «Технические характеристики», а «Сколько весит X». Заголовок задаёт тему фрагмента, и чем точнее он совпадает с тем, как человек спрашивает, тем легче этот фрагмент найти. Какие формулировки использует ваша аудитория, видно в анализаторе ИИ-ответов.

4. Числа со ссылкой и датой — и никаких других

Любое утверждение, которое можно подкрепить проверяемым числом, — подкрепляйте. Но именно проверяемым: ссылка, дата, кто измерял. Выдуманная статистика с несуществующим источником — а интернет вокруг этой темы ею полон — работает против вас в тот момент, когда читатель решит проверить.

5. FAQ пишите для людей, а не ради разметки

Блок вопросов в конце полезен: он естественно разбивает тему на короткие самодостаточные ответы. Но разметка FAQPage больше не даёт расширенного результата: в августе 2023 года Google ограничил такие результаты государственными и медицинскими сайтами. Разметку можно оставить, вреда от неё нет, но рассчитывать на неё как на «ускоритель цитирования» не стоит.

6. Не привязывайте абзацы к странице

«Как мы писали выше», «в предыдущем разделе», «см. таблицу ниже» — всё это делает фрагмент нечитаемым вне контекста. Если нужна отсылка, дайте её явно: не «выше», а «в разделе о токенах» или обычной ссылкой.

⚡ Проверка страницы за две минуты: откройте свою главную статью и пройдите по пяти пунктам. Есть ли прямой ответ на главный вопрос в первых двух-трёх предложениях? Каждый ли подзаголовок — формулировка вопроса? Найдётся ли хотя бы один раздел, который можно процитировать целиком и он останется понятным? Есть ли в тексте числа со ссылкой и датой? Указан ли автор? Четыре «да» из пяти — страницу можно брать в ответ. Один-два — переписывать.

Практика: разберите свою страницу на фрагменты

Четыре шага, всё на своём тексте:

  1. Возьмите страницу, которая приносит больше всего показов по отчёту «Эффективность», и выпишите её подзаголовки списком.
  2. Против каждого напишите вопрос, на который этот раздел отвечает. Если вопрос не формулируется или их получается три — раздел нужно делить или переписывать.
  3. Прочитайте каждый раздел отдельно, как будто соседних нет. Отметьте места, где текст опирается на «выше», «ниже» и «как уже говорилось», — это и есть привязка к странице.
  4. Проверьте читаемость текста в анализе читаемости, а полноту раскрытия темы — в охвате сущностей: он покажет подвопросы, которых на странице нет.

Термины — в глоссарии: AI Overviews, E-E-A-T, избранный сниппет, структурированные данные.

Как понять, что страница стала пригодной для цитирования

Проверяемый признак один и он не про ИИ: возьмите любой раздел своей страницы и прочитайте его вслух человеку, который статью не открывал. Если он понял мысль целиком — фрагмент самодостаточен. Если переспросил «а это про что?» — нет.

Второй признак — в данных. Сравните показы и клики страницы до и после переработки за равные периоды. Рост показов при тех же позициях означает, что страница стала попадать в большее число формулировок, а это ровно то, чего добивается разбивка на подвопросы.

Чего ждать не стоит: что структура заменит содержание. Отлично нарезанный текст ни о чём цитировать так же нечего, как и сплошную простыню. Структура помогает найти мысль, а не создаёт её.

Что дальше

Следующий урок — ИИ в создании контента: где машине можно доверить работу, а где это стоит позиций. Предыдущий урок, про ИИ-ответы в выдаче, — здесь.

🧑‍💻
Катя
«Получается, AI не "читает" как человек. Он режет на куски, ищет похожие куски, и из них собирает ответ?»
😌
Алекс
«Именно. Поэтому хороший текст — это не "длинная статья", а несколько коротких самодостаточных разделов, собранных в одну логичную статью. Каждый раздел — потенциальная цитата. А вес ему добавляют проверяемое число со ссылкой и подпись человека, который в теме разбирается.»
🎮 Проверь себя: ответь на вопрос в задании!
🎯
Задание к уроку
Проверьте понимание и получите +20 XP
← AI Overviews и AI Mode в поиске
Урок 9 из 16
Перейти к заданию →