Как нейросети выбирают источники: разбор документации 4 сервисов

Нейросети выбирают источники для ответа в 2 шага: сначала поиск находит страницы по запросу, затем языковая модель пересказывает самые подходящие и ставит на них ссылки. Алиса AI опирается на поиск Яндекса, AI Overviews на индекс Google, ChatGPT на собственного робота OAI-SearchBot и поисковых партнеров. Поэтому в ответ попадает страница, которая есть в индексе, открыта для робота сервиса и прямо отвечает на вопрос человека.
Получить консультацию
Вячеслав Савицкий, копирайтер-маркетолог с 2009 года, частный специалист по продвижению в нейросетях

Приветствую! Я Вячеслав Савицкий, проверяю GEO по первоисточникам

Прежде чем полностью уйти в тексты и маркетинг, я около 3 лет работал анестезиологом-реаниматологом в детской больнице. В реанимации дозировку сверяют по инструкции к препарату и клиническим рекомендациям, а пересказ коллеги в коридоре годится разве что как подсказка. Привычка идти к исходному документу осталась со мной и в GEO, где советов много, а ссылок на документацию мало.

Для этой статьи я прочитал справки OpenAI, Perplexity, Google и Яндекса на октябрь 2026 года и по словам самих сервисов разобрал, как нейросети выбирают источники. Выводы разделил на 3 уровня: что подтверждено документацией, что показывают исследования и что пока остается мнением рынка. Общее введение в тему ищите в статье что такое GEO-оптимизация.

Автор статьи: Вячеслав Савицкий, частный специалист по продвижению в нейросетях, копирайтер-маркетолог с 2009 года. Опубликовано 6 октября 2026.

Откуда нейросеть берет информацию для ответа: 2 пути

Языковая модель отвечает либо по памяти, либо после поиска в интернете. На первый путь владелец сайта влияет слабо, второй открыт каждому.

Память нейросети: знания до даты среза
Большая языковая модель, LLM (large language model), учится на огромном массиве текстов: книгах, статьях, сайтах и коде. После обучения знания застывают на дате среза (knowledge cutoff), и о событиях позже этой даты модель узнает только из поиска.

Поиск в реальном времени: RAG и поисковый индекс
Для свежих и фактических вопросов модель сначала идет в интернет. Подход называется RAG (retrieval-augmented generation, генерация с поиском по источникам): сервис отправляет запрос в поисковую систему, получает страницы и пишет ответ по ним, со ссылками.

Разницу между 2 путями я увидел в своей проверке 30 сайтов из топа Яндекса. ChatGPT в 2 ответах из 5 обошелся без единой ссылки на сайты: цифры и советы пришли из памяти модели. Алиса AI на 10 информационных вопросов дала 73 ссылки на источники. Откуда нейросеть берет информацию в конкретном ответе, подсказывают сноски: ответ без них почти всегда написан по памяти.
Схема: нейросеть отвечает по памяти до даты среза без ссылок или ищет свежие страницы в индексе и ставит сноски; в проверке 30 сайтов ChatGPT в 2 ответах из 5 обошелся без ссылок
Скриншоты: на вопрос о выборе стоматологии в Екатеринбурге ChatGPT ответил без ссылок на сайты, а Алиса AI поставила сноски на сайты клиник
Один вопрос в ChatGPT и Алисе AI, моя проверка, октябрь 2026 года

Как работает RAG и при чем тут ваш сайт

Путь от вопроса до готового ответа укладывается в 4 шага, и на 2 из них решает обычная поисковая система.
  1. Вопрос. Человек пишет в чат, например: «какой копирайтер напишет лендинг для онлайн-школы».
  2. Подзапросы. Сервис переписывает вопрос в 1 или несколько поисковых фраз и отправляет их в индекс.
  3. Отбор. Поиск возвращает подходящие страницы, а сервис вырезает из них фрагменты с прямым ответом.
  4. Генерация. Модель пишет текст своими словами и ставит ссылки на страницы, откуда взяла факты.
Второй шаг OpenAI описывает в справке о поиске: переписанные запросы уходят поисковым партнерам. Google называет такой прием query fan-out и запускает серию связанных поисков по подтемам.

Отсюда 2 вывода для владельца сайта. На шагах 2 и 3 работает классический поиск, поэтому страница вне индекса остается для модели невидимой. А благодаря подзапросам в ответ попадает и статья по смежной теме, если в ней есть точный абзац под одну из подтем. У крупных сервисов ИИ-поиск источников устроен по одной схеме, а различаются только индексы и роботы-сборщики страниц.
Схема RAG за 4 шага: вопрос, подзапросы, отбор страниц из поиска, ответ со сносками; шаги 2 и 3 решает обычная поисковая система
Как работает RAG: путь от вопроса до ответа
Сводная таблица: откуда ChatGPT, Perplexity, Google AI Overviews и Алиса AI берут свежие данные, каких роботов пустить и как они показывают сноски

Как нейросети выбирают источники: что пишут сами 4 сервиса

Официальные справки говорят скромнее статей агентств, зато каждое слово в них проверяемо.

OpenAI и ChatGPT: 3 робота с разными задачами
В документации о краулерах у компании описаны 3 бота:
  • OAI-SearchBot собирает страницы для поиска в ChatGPT и подчиняется robots.txt. По словам OpenAI, сайты с запретом для него исчезают из поисковых ответов.
  • GPTBot собирает тексты для обучения моделей, а запрет для него оставляет поиск в ChatGPT прежним.
  • ChatGPT-User открывает страницы по действиям пользователя, о нем отдельный факт в конце статьи.
Свежие источники ChatGPT берет из страниц OAI-SearchBot и у сторонних поисковых провайдеров, среди партнеров в справке упомянута Microsoft, владелец Bing.
Perplexity: свой робот и нумерованные ссылки в ответе
Справка Perplexity обещает сноски на исходные страницы в каждом ответе. Про Bing в официальных материалах Perplexity ни слова, хотя в статьях о GEO эту связку повторяют часто.

Роботов у Perplexity 2, оба описаны в документации для разработчиков. PerplexityBot показывает сайты в поиске Perplexity и ставит на них ссылки, а обучение моделей, по словам компании, идет без его участия. Perplexity-User заходит на страницу в момент вопроса пользователя и правила robots.txt в большинстве случаев игнорирует.

Google AI Overviews: требования те же, что у поиска
Для ИИ-ответов компания обходится общими правилами. В документации об ИИ-функциях сказано: странице достаточно быть в индексе и иметь право на сниппет, никаких специальных оптимизаций сверх обычного SEO.

Токен Google-Extended часто путают с ИИ-поиском, хотя он управляет обучением Gemini и опорой на веб-данные в других продуктах. В списке краулеров Google прямо пишет, что токен не влияет на попадание в Поиск и ранжирование. Запрет Google-Extended оставляет сайт в AI Overviews, а запрет Googlebot убирает его и из выдачи, и из ИИ-ответов.

Яндекс: ответы Алисы AI строятся на результатах поиска
Справка Вебмастера описывает механику коротко: нейросеть опирается на источники, высоко ранжирующиеся в выдаче. Сноски расставлены по логике ответа, независимо от порядка выдачи, и 1 сайт встречается в них несколько раз.

У Яндекса есть и отдельный робот YandexAdditional. Если закрыть ему доступ в robots.txt, информация сайта перестанет попадать в быстрые ответы с YandexGPT, а изменения вступят в силу за срок от 2 до 14 дней (справка о быстрых ответах).

Качество страниц Яндекс оценивает по критериям ЭПОС: экспертность, полезность, оригинальность и содержательность. По ним ранжируется поиск, а ответы Алисы AI строятся с опорой на его результаты.

Сводная таблица: 4 сервиса, их индексы и роботы
Общий знаменатель у всех 4 сервисов один: за ответом стоит поисковый индекс, а вход в него охраняет robots.txt. Как нейросети выбирают источники внутри самого индекса, справки раскрывают скупо: Google и Яндекс отсылают к обычным правилам качества, OpenAI и Perplexity к доступу для робота.
Проверю, видят ли нейросети ваш сайт
Запишу бесплатный видео-аудит: открыт ли сайт для роботов ChatGPT, Perplexity и Алисы, есть ли страницы с прямыми ответами на вопросы клиентов и кого нейросети советуют вместо вас.

Почему нейросеть цитирует конкурента вместо вашего сайта

Чаще всего у соперника есть страница с прямым ответом на заданный вопрос, а у вас тот же ответ размыт по общим разделам или закрыт для робота. Остальное раскладываю по 3 уровням доказательности и своим наблюдениям.

Подтверждено документацией. Страница есть в индексе нужного поиска, робот сервиса допущен в robots.txt, а для Google у нее еще и разрешен сниппет. Для Алисы AI сверху добавляются критерии ЭПОС.

Показывают исследования. Profound изучил 680 млн цитирований в ChatGPT, Google AI Overviews и Perplexity с августа 2024 по июнь 2025 года. ChatGPT чаще всего ссылался на Википедию (7,8 % всех цитирований), а Perplexity на Reddit (6,6 %).

Semrush с 14 июля по 12 октября 2025 года отслеживал 230 000 промптов: в начале августа ChatGPT ссылался на Reddit почти в 60 % ответов, а к середине сентября примерно в 10 %. Любимые площадки моделей меняются за недели, поэтому ставка на 1 площадку рискованна. Обе выборки собраны на англоязычных запросах, так что для рунета их выводы годятся как ориентир.

Видно в моей проверке. На вопрос «сколько стоит» Алиса AI в 4 городах из 5 брала цены с сайтов местных компаний. Советы «как выбрать» в тех же городах она брала у СМИ и блогов из других регионов: вопрос о стоматологии в Екатеринбурге закрыла 10 источниками, и 6 из них оказались блогами клиник из Фрязино, Реутова, Москвы и Перми. Выигрывает страница с точным ответом, а адрес компании и позиция ее главной страницы отходят на второй план.

Гипотезы рынка. Метрики DR и DA, длину текста и плотность ключей SEO-специалисты обсуждают активно, однако в справках сервисов о них ни слова.
Почему нейросеть цитирует конкурента: подтверждено документацией, показывают исследования Profound и Semrush, видно в моей проверке, гипотезы рынка без подтверждения
Что выключают data-nosnippet, метатег nosnippet и Disallow в robots.txt: фрагмент в сниппете, текст страницы в AI Overviews, сайт в ответах нейросети

data-nosnippet и запрет роботов: 3 настройки с разным эффектом

Фрагмент с запретом на сниппет Google сканирует, но для ИИ-ответа возьмет похожий текст с другого сайта, поэтому прятать полезный контент бессмысленно. Так звучит ответ на вопрос читателя vc.ru, а путаница возникает из-за 3 разных настроек:
  1. Пометка блока. Google индексирует страницу целиком, а фрагмент с атрибутом data-nosnippet исключает из сниппета и из AI Overviews. В справках Яндекса и OpenAI такой атрибут отсутствует.
  2. Метатег nosnippet. Google перестает брать текст страницы в AI Overviews, а заодно убирает описание под ссылкой в обычной выдаче.
  3. Правило в robots.txt. Disallow для OAI-SearchBot выключает сайт из поиска ChatGPT, для PerplexityBot из Perplexity, для YandexAdditional из быстрых ответов Алисы, а обычная выдача сохраняется.
Мой совет: роботов держите открытыми, а data-nosnippet ставьте точечно, на то, что цитировать рискованно: персональные данные, цены под индивидуальный расчет, условия из договора. Для ИИ-поиска источников доступ робота важнее любых метатегов.

Как попасть в источники ответа нейросети: чек-лист владельца сайта

Начинать стоит с техники, а заканчивать текстами.
  1. Поисковые кабинеты. Подключите Яндекс Вебмастер, Google Search Console и Bing Webmaster Tools и убедитесь, что важные страницы есть в индексе.
  2. Доступ роботам. Откройте в robots.txt OAI-SearchBot, PerplexityBot, Googlebot, YandexBot и YandexAdditional.
  3. Ответ на вопрос. Под каждый частый запрос клиента заведите отдельную статью с прямым ответом в первом абзаце.
  4. Цифры и факты. Указывайте цены, сроки и ссылки на документы: в моей проверке Алиса брала стоимость именно с таких страниц.
  5. Подзаголовки и таблицы. Вопросы в H2, короткие абзацы и списки помогают поиску вырезать точный фрагмент, подробный разбор в статье про структуру SEO-текста.
  6. Подпись и дата. Покажите, кто писал текст и когда его обновили: в ЭПОС Яндекс связывает экспертность с доверием к автору, сайту и бизнесу.
  7. Внешние упоминания. Подборки СМИ и профили на отраслевых площадках дают модели второй рассказ о вас, а Алиса в моей проверке пересказывала рейтинги kp.ru прямо в ответах.
Первые 2 шага занимают 1 вечер, остальные 5 требуют регулярной работы с текстами. Каждая новая статья с точным ответом добавляет сайту шанс оказаться среди источников ответа нейросети.
Чек-лист: 7 шагов в источники ответа нейросети, от поисковых кабинетов и доступа роботам до внешних упоминаний

Частые вопросы об источниках ChatGPT и Алисы: 4 ответа

Правила robots.txt работают для OAI-SearchBot и GPTBot, а для ChatGPT-User применяются не всегда, по документации OpenAI

Неочевидная деталь из документации OpenAI про ChatGPT-User

Из 3 роботов компании только 1 живет по особым правилам. Для OAI-SearchBot и GPTBot запрет в robots.txt работает, а про ChatGPT-User OpenAI пишет иначе: раз действие запускает пользователь, правила robots.txt к нему применяются не всегда (developers.openai.com). Получается, robots.txt управляет поиском и обучением, а для визитов по просьбе человека компания оставляет себе исключение.

Что в итоге: 3 условия попадания в ответы нейросетей

Языковая модель ищет почти как обычный поисковик, только вместо списка ссылок выдает пересказ со сносками. Шанс оказаться в этих сносках дают индекс, открытый робот и страница с точным ответом на вопрос клиента.

Как попасть в ответы нейросетей с помощью живого блога, рассказываю на странице услуги: 4 статьи в месяц, размещение и ежемесячный замер упоминаний. Бесплатный видео-аудит вашего сайта запишу по сообщению в Telegram @Smextenej. Нейросети уже составляют список тех, кого цитировать в вашей нише, и в нем вполне найдется место для вашего сайта.
Читайте также:
    Made on
    Tilda