11 июня 2026 г. · 8 мин чтения · Команда geoboost
Как нейросети выбирают, кого цитировать
Разбираем конвейер генеративных движков — поиск, отбор и цитирование источников: что известно из открытых исследований о критериях выбора, что делает контент цитируемым и почему бренды появляются и исчезают из ответов ИИ.
Когда пользователь спрашивает нейросеть «какую CRM выбрать для отдела продаж из десяти человек», он получает связный ответ с двумя-тремя названиями и несколькими ссылками на источники. Со стороны выбор этих названий и ссылок выглядит как лотерея. На деле за каждым таким ответом стоит конвейер: движок ищет источники, отбирает из найденного рабочий набор и решает, кого назвать в тексте.
На каждом этапе конвейера часть брендов отсеивается — и на каждом этапе на результат можно влиять. Разберём, как этот конвейер устроен, что известно из открытых исследований о критериях выбора и почему присутствие бренда в ответах нестабильно по своей природе.
Конвейер вместо магии
Системы, которые ищут информацию в интернете и синтезируют из неё ответ с помощью больших языковых моделей, в исследовательской литературе называют генеративными движками — термин закрепила научная работа «GEO: Generative Engine Optimization», представленная на конференции KDD 2024. ChatGPT с веб-поиском, Perplexity, Алиса с нейроответами на базе YandexGPT — все они работают по этой схеме.
Путь бренда внутрь ответа удобно описывать как воронку из трёх шагов:
- поиск (retrieval) — страницы бренда попали в поле зрения движка среди кандидатов;
- отбор (selection) — движок включил их в набор источников, на которых строит ответ;
- цитирование (citation) — бренд назван в тексте или указан как источник.
Каждый шаг — отдельный фильтр со своими правилами. Пройдём по ним по порядку.
Этап 1. Поиск: попасть в поле зрения движка
Первое, что важно понять: движок почти никогда не ищет по запросу пользователя «как есть». Один вопрос превращается в десятки поисковых под-запросов.
Google официально описывает эту технику как query fan-out: AI Mode «разбивает вопрос на подтемы и выполняет множество запросов одновременно», а режим Deep Search может выполнять сотни поисков по одному вопросу. ChatGPT работает похоже: согласно документации OpenAI, модель сама решает, нужен ли поиск, может искать прямо по ходу рассуждения, анализировать результаты и решать, продолжать ли искать дальше. Perplexity держит собственный поисковый индекс, который обновляется в реальном времени, и ранжирует кандидатов гибридно — комбинируя лексические и векторные сигналы.
Для бренда из этого следует практичный вывод: бороться нужно не за один запрос, а за семейство под-запросов вокруг сценария выбора. Если контент отвечает только на «лобовую» формулировку, он рискует не попасть в выборку ни по одной из подтем, на которые движок разложил вопрос.
Рунет: вход через органику
В русскоязычном сегменте этап поиска пока жёстко привязан к классической выдаче. По данным исследования «Ашманов и партнёры» (август 2025 — январь 2026), до 90% источников в нейроответах Алисы приходится на топ-10 органической выдачи Яндекса, а вероятность попадания заметно падает уже после пятой позиции. Иными словами, для Алисы SEO — это входной билет на первый этап воронки: кого нет в органическом топе, того движок просто не увидит.
Этап 2. Отбор: из найденного — в основу ответа
Найден — не значит использован. Это видно даже в технических интерфейсах движков: документация OpenAI разделяет полный список источников, к которым модель обращалась при подготовке ответа, и список процитированных — и прямо отмечает, что первый обычно длиннее второго. Между «движок прочитал вашу страницу» и «движок построил на ней ответ» лежит отдельный фильтр.
Что известно о критериях этого фильтра из открытых данных:
- Отбираются фрагменты, а не сайты. Поисковый слой Perplexity работает на уровне чанков — отдельных смысловых кусков страницы, чтобы передавать модели только релевантные пассажи, а не документы целиком. Страница, из которой нельзя извлечь самодостаточный фрагмент с ответом, проигрывает ещё до этапа цитирования.
- Свежесть имеет значение. Ahrefs проанализировал почти 17 миллионов цитирований в ответах ИИ-ассистентов: средний возраст цитируемых страниц оказался на 25,7% меньше, чем у страниц из обычной органической выдачи (1064 дня против 1432). Сильнее всех «любит свежее» ChatGPT — его цитаты в среднем на 458 дней моложе органики.
- У каждого движка своя «диета» источников. Компания Profound, проанализировав 680 миллионов цитирований с августа 2024 по июнь 2025 года, обнаружила устойчивые различия: ChatGPT чаще всего ссылается на Википедию (7,8% всех цитат), а в ответах Google AI Overviews и Perplexity лидирует Reddit. То есть один и тот же контент разные движки оценивают по-разному — единого «рейтинга авторитетности» не существует.
Этап 3. Цитирование: кого назовут в ответе
Финальный фильтр — само цитирование: модель решает, какие из отобранных источников назвать в тексте, на кого поставить ссылку и в каком порядке. Здесь действуют уже не поисковые, а редакторские критерии — насколько источник удобен модели как опора для конкретных утверждений.
Авторы исходной работы по GEO проверили девять способов оптимизации контента на тысячах реальных запросов и показали, что видимость источника в ответах генеративных движков можно поднять на величину до 40% относительно исходного уровня. Лучше всего работали редакторские приёмы: добавление статистики, цитат и ссылок на первоисточники. А вот классическое насыщение текста ключевыми словами видимость, наоборот, снижало. Важная оговорка из той же работы: эффективность приёмов различается от тематики к тематике, универсального рецепта нет.
Порядок цитирования тоже не случаен: в исследовании Ahrefs у ChatGPT и Perplexity более свежие материалы в среднем цитировались раньше более старых — а значит, позиция бренда внутри списка источников, как и сам факт попадания в него, частично управляема.
Если собрать критерии цитируемости в один список, получится так:
- проверяемые факты: цифры, статистика, данные исследований с указанием источника;
- цитаты экспертов и первоисточников, на которые модель может опереться;
- структура, из которой легко извлечь самодостаточный фрагмент: внятные заголовки, короткие абзацы, списки;
- актуальность: дата обновления и соответствие текущему состоянию рынка;
- прямые ответы на реальные вопросы аудитории, а не маркетинговые формулировки.
Почему бренды появляются и исчезают из ответов
Самое неожиданное для тех, кто привык к относительно инертному SEO: правила отбора у генеративных движков меняются быстро и без объявлений.
Показательный пример — динамика Google AI Overviews. В июле 2025 года 76% цитируемых страниц находились в топ-10 органической выдачи по тому же запросу. К марту 2026-го, по обновлённому исследованию Ahrefs на 863 тысячах выдач, эта доля упала до 38%: остальные цитаты почти поровну разделились между позициями 11–100 и страницами вообще за пределами топ-100. Ahrefs связывает сдвиг с тем самым query fan-out: источники всё чаще приходят из выдач по под-запросам, а не по исходному запросу.
В рунете движение обратное: у Алисы доля источников вне топ-10 Яндекса за полгода сжалась с 40% до 10% — движок ужесточил отбор. Один и тот же бренд мог за это время «исчезнуть» из нейроответов, не изменив на сайте ни строчки: поменялись не его страницы, а правила фильтра.
Добавим сюда различия в источниках между платформами — и картина складывается окончательно: присутствие в ответах нейросетей — это движущаяся цель. Бренд может быть заметен в одном движке и невидим в другом, а вчерашний результат ничего не гарантирует завтра. По западным движкам открытых исследований уже немало; ответы YandexGPT, GigaChat или DeepSeek приходится изучать в основном прямым измерением.
Что делать бренду: короткий чек-лист
Из устройства конвейера следует вполне конкретная программа действий:
- Не бросать SEO. Для Алисы органический топ — условие входа в воронку; у других движков связь слабее, но поиск остаётся первым этапом везде.
- Строить контент вокруг семейств вопросов. Один сценарий выбора — это десятки под-запросов; страница должна закрывать подтемы, а не одну формулировку.
- Добавлять фактуру. Статистика, цитаты, ссылки на первоисточники — приёмы с доказанным эффектом на видимость в ответах.
- Писать извлекаемыми фрагментами. Каждый смысловой блок — самодостаточный ответ с понятным заголовком, который движок может забрать целиком.
- Обновлять регулярно. Свежесть — измеримый фактор отбора, особенно в ChatGPT.
- Измерять, а не предполагать. Раз правила различаются между движками и меняются со временем, разовые проверки быстро устаревают — положение нужно замерять регулярно. Так устроен мониторинг geoboost: сервис ежедневно проверяет, находят ли, отбирают ли и цитируют ли бренд семь движков — ChatGPT, YandexGPT/Алиса, Claude, Gemini, GigaChat, DeepSeek и Perplexity — и показывает, на каком этапе воронки бренд теряет видимость.
Вывод
Выбор источников в ответах нейросетей — не лотерея, а конвейер с тремя фильтрами: поиск, отбор, цитирование. Про каждый фильтр уже есть открытые данные: движки раскладывают вопрос на десятки под-запросов, отбирают фрагменты с поправкой на свежесть и тип источника, а цитируют охотнее тот контент, где есть факты, цитаты и ясная структура. И всё это — на фоне правил, которые у каждого движка свои и меняются за месяцы, а не за годы.
Для маркетинговой команды это означает смену рамки: вопрос «почему нас нет в ответе?» всегда раскладывается на три разных вопроса — нас не нашли, нас не отобрали или нас не процитировали. У каждого из них своё решение, и начинается оно с одного и того же шага — измерить, на каком этапе воронки бренд выпадает сейчас.
Источники
- Aggarwal et al. GEO: Generative Engine Optimization (KDD 2024)
- OpenAI: Web search — документация инструмента веб-поиска
- Google: AI Mode in Search — updates from Google I/O 2025
- Vespa.ai: How Perplexity uses Vespa.ai to power fast, accurate, and trusted answers
- Ahrefs: Update — 38% of AI Overview Citations Pull From The Top 10
- Ahrefs: AI Assistants Prefer to Cite Fresher Content (17 Million Citations Analyzed)
- Profound: AI Platform Citation Patterns
- Sostav: До 90% источников в нейроответах «Алисы» приходится на топ-10 выдачи «Яндекса»