Как работают LLM и что они читают на сайте
Языковые модели работают с сайтом не так, как человек: они не читают страницу подряд, а режут текст на куски, ищут среди них подходящие по смыслу и собирают ответ из найденного. Понимание этого механизма объясняет, почему короткий самодостаточный раздел цитируется чаще, чем длинная статья, — и почему «плотность ключевых слов» здесь не даёт ничего.
Механика моделей — не зона ответственности Google, и документации на неё нет. Зато есть документация на то, что из неё следует для сайта: ИИ-функции в поиске и как работает поиск. На них и будем опираться, когда речь зайдёт о выводах.
В предыдущем уроке мы разобрали, где появляются ИИ-ответы и что для попадания в них требует Google. Теперь — как именно устроена машина, которая этот ответ собирает. Это знание нужно не ради терминов: оно позволяет отличить осмысленный совет по структуре текста от продажи «секретной разметки».
Модель не «понимает» — она предсказывает следующий токен
Это самое важное предложение урока. Большая языковая модель — не разум и не «искусственный интеллект» в фантастическом смысле. Это нейросеть, обученная на огромном корпусе текста, которая делает одну вещь: предсказывает следующий токен — слово или часть слова. Когда вы вводите «погода в Киеве сегодня», модель не знает погоду. Она подбирает наиболее вероятное продолжение такой фразы.
Размеры современных моделей их разработчики не публикуют, поэтому числа вида «столько-то триллионов параметров», которые ходят по статьям, проверить невозможно. Для работы это и не нужно: практическое значение имеют три свойства, а не размер.
| Свойство модели | Что из него следует для сайта |
|---|---|
| Обучение закончилось на конкретной дате | Свежая информация — цены, новости, обновления — приходит не из обучения, а из поиска по вебу в момент запроса. Это и есть точка входа для вашей страницы |
| Модель может уверенно выдумать | Долю таких ошибок никто не измерял так, чтобы результат можно было воспроизвести. Но именно из-за них ответы стали ссылаться на источники: ссылка работает как опора |
| Модель воспроизводит частое | Чем чаще о вас пишут в контексте темы, тем выше шанс оказаться в ответе. Упоминания работают, даже когда ссылки нет |
Дата обучения: почему модель не знает вчерашних новостей
У каждой модели есть точка, после которой она не знает ничего: дата окончания сбора обучающих данных. Спросите о событии, случившемся позже, — и без доступа к вебу модель либо признается, либо выдумает.
Конкретные даты по моделям здесь намеренно не перечислены: они меняются с каждым релизом, и любой такой список устаревает быстрее, чем урок. Проверять нужно в первоисточнике — в документации разработчика модели, а ещё проще спросить саму модель и сверить ответ с её карточкой.
Практический вывод один и он не меняется: чтобы модель сослалась на вас в ответе на свежий запрос, ваша страница должна быть найдена в момент запроса. Обучить чужую модель на своём контенте отдельный бизнес не может. Попасть в результаты поиска, по которым модель собирает ответ, — может.
Отсюда же ответ на частый вопрос «закрывать ли сайт от ИИ-ботов». Список агентов Google и то, что каждый из них делает, собраны в документации о краулерах. Закрывая их, вы закрываете и попадание в ответы — решение осмысленное только тогда, когда вы этого действительно хотите.
Retrieval: как ИИ-поиск находит вашу страницу
Все современные ИИ-ответы строятся по одной схеме: сначала поиск, потом генерация. Модель не держит ваш сайт в памяти — она получает найденные фрагменты как контекст и пишет ответ по ним. Отсюда четыре шага:
На шаге Retrieve система находит релевантные страницы в индексе. На шаге Chunk из каждой страницы выбирается не вся страница, а фрагмент, который точнее отвечает на вопрос. На шаге Generate модель получает эти фрагменты и собирает из них ответ. Ссылки под ответом — это адреса страниц, откуда фрагменты взяты.
Похожим образом устроен и обычный поиск: Google описывает, что ответ может опираться на отдельный фрагмент страницы, а для ИИ-функций — что запрос разветвляется на несколько связанных поисков по подтемам. Подробности — в разделе о ИИ-функциях.
Токены и эмбеддинги: как машина сравнивает смысл
Два понятия, которые объясняют, почему «плотность ключевых слов» перестала работать, а полнота раскрытия темы — работает.
| Понятие | Что это | Что меняет в тексте |
|---|---|---|
| Токен | Минимальная единица текста для модели: слово целиком или его часть. Длинные и редкие слова разбиваются на несколько токенов | Контекстное окно измеряется в токенах — это сколько модель может прочитать за раз. Вода в тексте тратит его впустую |
| Эмбеддинг | Фрагмент текста превращается в набор чисел — координаты в смысловом пространстве. «Купить кроссовки» и «приобрести беговую обувь» получают близкие координаты, хотя слова разные | Повторять точную формулировку не нужно: близость считается по смыслу, а не по совпадению строк |
| Близость векторов | Мера того, насколько два набора координат смотрят в одну сторону. По ней система выбирает, какой фрагмент ближе к запросу | Плотный конкретный абзац даёт отчётливые координаты; размытый — размытые, и проигрывает соседу |
Практический смысл двойной. Хорошая новость: не нужно повторять «купить кроссовки» семь раз — синонимы и контекст учитываются. Плохая: текст из общих фраз проигрывает конкретному, даже если формально содержит нужные слова. Посмотреть на свой текст с этой стороны помогают анализ плотности и оценка качества текста.
Фрагменты: как длина раздела влияет на цитирование
Системы поиска режут текст на фрагменты. Размер — всегда компромисс: короткий фрагмент точно попадает в узкий вопрос, но теряет контекст; длинный сохраняет контекст, но содержит лишнее и хуже совпадает с конкретным запросом. Точных размеров ни Google, ни разработчики ассистентов не публикуют, и полагаться на «правильное число токенов» бессмысленно.
Что можно сказать уверенно: раздел, который читается самостоятельно, цитировать легче, чем кусок, вырванный из середины сплошного текста. Отсюда практическое правило — не числовое, а смысловое: каждый раздел должен отвечать на один вопрос целиком, не требуя чтения соседних.
| Что вы пишете | Как это читается машиной |
|---|---|
| Короткий раздел под своим подзаголовком, один вопрос — один ответ | Готовый самодостаточный фрагмент |
| Длинный раздел, где ответ собирается из четырёх абзацев подряд | Любой отдельный кусок неполон, и брать его рискованно |
| Абзац, начинающийся со слов «как мы говорили выше» | Вне страницы не читается вообще |
Последняя строка — самая частая ошибка. Ссылки внутри текста на «выше» и «ниже» привязывают абзац к странице и делают его непригодным для цитирования.
Как выглядит страница, которую удобно цитировать
| Параметр | Обычная страница | Страница, которую удобно взять в ответ |
|---|---|---|
| Введение | «В этой статье мы расскажем… компания основана в 2010…» | Прямой ответ на вопрос в первых двух-трёх предложениях |
| Заголовки | «Введение», «Описание», «Заключение» | Формулировки вопросов: «Сколько стоит X», «Как настроить Y» |
| Длина раздела | Полторы тысячи слов под одним подзаголовком | Раздел, который читается отдельно и закрывает один подвопрос |
| Утверждения | «Это очень важный фактор» — без опоры | «Google показывает FAQ-результаты только для государственных и медицинских сайтов» — со ссылкой на объявление и датой |
| Предложения | Длинные, с тремя придаточными и оговорками | Короткие: «X — это Y, потому что Z» |
| Автор | Аноним или «команда экспертов» | Имя, чем человек занимается, ссылка на его страницу |
Про последнюю строку: имя автора и дату обновления можно продублировать в разметке — поля описаны в схеме для статьи. Это не «разметка для ИИ», которой не существует, а обычные структурированные данные; термин разобран в глоссарии: структурированные данные.
Шесть правил для текста, который удобно цитировать
1. Один раздел — один вопрос
Прочитав только этот раздел, человек должен понять его тему без обращения к остальной странице. Это и есть та самая самодостаточность, ради которой всё остальное. Если раздел разросся и отвечает уже на три вопроса — разделите его подзаголовками.
2. Короткие предложения вместо сложноподчинённых
«SEO — это работа над тем, чтобы страницу находили в поиске» читается лучше, чем «SEO, в широком смысле понимаемое как процесс оптимизации сайтов под поисковые системы, способствующий улучшению их видимости в органической выдаче». Второе предложение размазывает смысл и проигрывает при сравнении с запросом — и человеку читать его тяжелее.
3. Заголовки — формулировки вопросов
Не «Преимущества X», а «Зачем нужен X». Не «Технические характеристики», а «Сколько весит X». Заголовок задаёт тему фрагмента, и чем точнее он совпадает с тем, как человек спрашивает, тем легче этот фрагмент найти. Какие формулировки использует ваша аудитория, видно в анализаторе ИИ-ответов.
4. Числа со ссылкой и датой — и никаких других
Любое утверждение, которое можно подкрепить проверяемым числом, — подкрепляйте. Но именно проверяемым: ссылка, дата, кто измерял. Выдуманная статистика с несуществующим источником — а интернет вокруг этой темы ею полон — работает против вас в тот момент, когда читатель решит проверить.
5. FAQ пишите для людей, а не ради разметки
Блок вопросов в конце полезен: он естественно разбивает тему на короткие самодостаточные ответы. Но разметка FAQPage больше не даёт расширенного результата: в августе 2023 года Google ограничил такие результаты государственными и медицинскими сайтами. Разметку можно оставить, вреда от неё нет, но рассчитывать на неё как на «ускоритель цитирования» не стоит.
6. Не привязывайте абзацы к странице
«Как мы писали выше», «в предыдущем разделе», «см. таблицу ниже» — всё это делает фрагмент нечитаемым вне контекста. Если нужна отсылка, дайте её явно: не «выше», а «в разделе о токенах» или обычной ссылкой.
Практика: разберите свою страницу на фрагменты
Четыре шага, всё на своём тексте:
- Возьмите страницу, которая приносит больше всего показов по отчёту «Эффективность», и выпишите её подзаголовки списком.
- Против каждого напишите вопрос, на который этот раздел отвечает. Если вопрос не формулируется или их получается три — раздел нужно делить или переписывать.
- Прочитайте каждый раздел отдельно, как будто соседних нет. Отметьте места, где текст опирается на «выше», «ниже» и «как уже говорилось», — это и есть привязка к странице.
- Проверьте читаемость текста в анализе читаемости, а полноту раскрытия темы — в охвате сущностей: он покажет подвопросы, которых на странице нет.
Термины — в глоссарии: AI Overviews, E-E-A-T, избранный сниппет, структурированные данные.
Как понять, что страница стала пригодной для цитирования
Проверяемый признак один и он не про ИИ: возьмите любой раздел своей страницы и прочитайте его вслух человеку, который статью не открывал. Если он понял мысль целиком — фрагмент самодостаточен. Если переспросил «а это про что?» — нет.
Второй признак — в данных. Сравните показы и клики страницы до и после переработки за равные периоды. Рост показов при тех же позициях означает, что страница стала попадать в большее число формулировок, а это ровно то, чего добивается разбивка на подвопросы.
Чего ждать не стоит: что структура заменит содержание. Отлично нарезанный текст ни о чём цитировать так же нечего, как и сплошную простыню. Структура помогает найти мысль, а не создаёт её.
Что дальше
Следующий урок — ИИ в создании контента: где машине можно доверить работу, а где это стоит позиций. Предыдущий урок, про ИИ-ответы в выдаче, — здесь.