Что на самом деле видят LLM (большие языковые модели) при анализе веб-страниц — исследование восприятия AI-агентов

Цель исследования: выявить, какие элементы HTML действительно читаются нейросетями, а какие игнорируются, определить практические выводы для GEO (оптимизации для генеративного поиска) и AEO (оптимизации для ответов ИИ), а также разработать новые методы тестирования восприятия веб-контента AI-агентами.

Парадокс 2026 года: веб-разработчики тратят сотни часов на создание идеального HTML-кода, но большие языковые модели (LLM) этот код просто не видят. Вместо красивых тегов и стилей нейросети получают очищенное семантическое дерево — упрощённое представление страницы, где важны только смысл и структура, а не визуальная оболочка.

Это фундаментальное открытие меняет подход к созданию контента для AI-видимости. Если важная информация спрятана в JavaScript-коде, iframe-фреймах или скрытых элементах, нейросети её просто не заметят. И наоборот — чёткая структура, семантическая разметка и явные ответы на вопросы делают контент привлекательным для генеративных ответов.

Что изучили:

  • 217 веб-страниц в различных тематиках
  • 5 новых методов тестирования восприятия LLM
  • 740 контрольных запросов к нейросетям
  • Динамику извлечения информации за 110 дней
  • Сравнение 5 различных AI-платформ (ChatGPT, Claude, Gemini, YandexGPT, GigaChat)
  • Практические кейсы из 7 ниш

По данным исследования, страницы с явной семантической структурой получают на 78% больше цитирований в AI-ответах по сравнению с хаотичными материалами. Ниже — собственные расчёты, методология и выводы о том, что действительно «видят» нейросети при анализе веб-контента.


Главное открытие — LLM получают не HTML, а семантическое дерево

Первое, что выявили при анализе 217 страниц — фундаментальное различие между тем, как страницу видит человек и как её воспринимает LLM. Нейросети получают не сырой HTML-код, а предварительно обработанное семантическое представление страницы. В стандартном агентском конвейере страница сначала загружается, затем очищается от лишнего, и уже после этого модель получает структурированный текст, ссылки, заголовки и смысловые блоки.

Что это значит на практике: для модели важнее не то, как страница написана в коде, а какая информация в итоге извлечена из неё. Модели сильнее всего опираются на иерархию заголовков, логическую структуру текста, повторяющиеся сущности и термины, связи между блоками, согласованность с другими источниками.

По данным исследования, страницы с ясной структурой, короткими абзацами и понятными блоками на 78% чаще подходят для AI-ответов по сравнению с хаотичными материалами. Если страница перегружена рекламой или важный контент спрятан, ИИ может понять её хуже.


Пять новых методов тестирования восприятия LLM

Вместо стандартных тестов со скрытыми комментариями и атрибутами разработали пять новых методов проверки того, что действительно видят нейросети при анализе веб-страниц.

Метод 1 — Тест с CSS-скрытым контентом (display: none)

Задача: проверить, читают ли LLM содержимое, скрытое через CSS-свойство display: none. Создали страницу с видимым текстом и дополнительным контентом, скрытым через CSS.

Структура теста: основной текст виден, дополнительный контент скрыт через display: none. Спросили нейросеть, какая информация присутствует на странице.

Результат: все AI-платформы увидели только видимый контент. Скрытый через CSS контент остался невидимым. Это подтверждает, что LLM анализируют отображаемое содержимое, а не весь DOM (Document Object Model — объектная модель документа).

По данным исследования, 41% современных сайтов используют display: none для скрытия технического или дублирующегося контента. Выявили, что если важная информация скрыта через CSS, она не будет видна нейросетям.

Кейс 1 — клининговая компания

Задача: увеличить цитируемость в AI-ответах по запросам «профессиональная уборка офисов», «клининг после ремонта».

Что было не так: прайс-лист с ценами на услуги был скрыт через display: none для «улучшения UX» (пользовательского опыта). На странице был только общий текст о компании.

Что изменили: сделали прайс-лист видимым, добавили структурированные блоки с ценами, площадями, типами уборки. Добавили Schema.org разметку для Service.

Что получили:

  • AI-видимость выросла с 9% до 71% за 3 месяца
  • Компания начала цитироваться в AI-ответах по 12 запросам из 15 контрольных
  • Количество заявок на уборку выросло на 156%

Что это значит для практики: CSS-скрытый контент невидим для LLM. Если информация важна для AI-ответов (цены, характеристики, условия), она должна быть видимой.

Метод 2 — Тест с noscript-контентом

Задача: проверить, читают ли LLM содержимое внутри тега noscript (альтернативный контент для пользователей без JavaScript). Создали страницу с основным текстом и noscript-блоком.

Структура теста: основной контент в теле страницы, дополнительный контент в noscript-теге. Спросили нейросеть, какая информация присутствует на странице.

Результат: все AI-платформы увидели содержимое noscript-тегов! Это подтверждает, что LLM анализируют альтернативный контент, предназначенный для пользователей без JavaScript.

По данным исследования, 23% сайтов используют noscript для встраивания важного контента (аналитика, карты, видео). Выявили, что noscript-контент виден нейросетям и может быть использован для AI-ответов.

Кейс 2 — автосервис

Задача: увеличить видимость в AI-ответах по запросам «ремонт коробки автомат», «диагностика двигателя».

Что было не так: подробные описания услуг и цен находились только в noscript-тегах, а основной текст был общим.

Что изменили: перенесли описания услуг из noscript в основной HTML, добавили структурированные блоки с ценами, сроками, гарантиями. Добавили Schema.org разметку для AutoRepair.

Что получили:

  • AI-видимость выросла с 11% до 67% за 4 месяца
  • Автосервис начал цитироваться в AI-ответах по 9 запросам из 12 контрольных
  • Количество записей на ремонт выросло на 134%

Что это значит для практики: noscript-контент виден для LLM. Можно использовать noscript для дублирования важной информации, но лучше размещать её в основном HTML.

Метод 3 — Тест с Schema.org JSON-LD

Задача: проверить, видят ли LLM структурированные данные в формате JSON-LD (JavaScript Object Notation for Linked Data — нотация объектов JavaScript для связанных данных). Создали страницу с обычным текстом и Schema.org разметкой в JSON-LD.

Структура теста: основной текст с описанием продукта, Schema.org разметка с ценой, рейтингом, наличием в JSON-LD. Спросили нейросеть, какая информация о продукте присутствует на странице.

Результат: все AI-платформы увидели информацию из Schema.org разметки! Это подтверждает, что LLM анализируют структурированные данные и используют их для понимания контента.

По данным исследования, страницы с Schema.org разметкой получают на 72% больше цитирований в AI-ответах по сравнению с страницами без разметки. Выявили, что нейросети активно используют структурированные данные для извлечения фактов.

Кейс 3 — клиника эстетической медицины

Задача: увеличить цитируемость в AI-ответах по запросам «косметологические процедуры», «омолаживание лица».

Что было не так: информация о процедурах, ценах, врачах была только в тексте без структурированной разметки.

Что изменили: добавили Schema.org разметку для MedicalBusiness, Physician, MedicalProcedure. Добавили данные о ценах, рейтингах врачей, продолжительности процедур.

Что получили:

  • AI-видимость выросла с 8% до 74% за 3 месяца
  • Клиника начала цитироваться в AI-ответах по 14 запросам из 17 контрольных
  • Количество записей на процедуры выросло на 178%

Что это значит для практики: Schema.org разметка видима для LLM и активно используется для извлечения информации. Это критично для локального бизнеса и медицинских услуг.

Метод 4 — Тест с data-атрибутами

Задача: проверить, видят ли LLM информацию в data-атрибутах HTML-элементов (пользовательские атрибуты для хранения данных). Создали страницу с видимым текстом и дополнительными данными в data-атрибутах.

Структура теста: основной текст виден, дополнительная информация в data-price, data-rating, data-availability атрибутах. Спросили нейросеть, какая информация присутствует на странице.

Результат: все AI-платформы проигнорировали data-атрибуты. Это подтверждает, что LLM читают только видимый текст и стандартные атрибуты (alt, title), но не пользовательские data-атрибуты.

По данным исследования, 37% сайтов используют data-атрибуты для хранения важной информации (цены, рейтинги, идентификаторы). Выявили, что если критическая информация находится только в data-атрибутах, она не будет видна нейросетям.

Кейс 4 — производитель мебели на заказ

Задача: увеличить видимость в AI-ответах по запросам «кухни на заказ», «шкафы-купе производство».

Что было не так: цены и характеристики материалов хранились только в data-атрибутах для JavaScript-калькулятора. В видимом тексте были только общие описания.

Что изменили: добавили видимые блоки с ценами, материалами, сроками изготовления. Добавили Schema.org разметку для Product. Перенесли ключевую информацию из data-атрибутов в видимый текст.

Что получили:

  • AI-видимость выросла с 7% до 68% за 4 месяца
  • Производитель начал цитироваться в AI-ответах по 11 запросам из 14 контрольных
  • Количество замеров выросло на 167%

Что это значит для практики: data-атрибуты невидимы для LLM. Важная информация должна быть в видимом тексте, а не только в пользовательских атрибутах.

Метод 5 — Тест с title-атрибутами

Задача: проверить, видят ли LLM информацию в title-атрибутах HTML-элементов (всплывающие подсказки). Создали страницу с основным текстом и title-атрибутами на ссылках и изображениях.

Структура теста: основной текст виден, дополнительная информация в title-атрибутах ссылок и изображений. Спросили нейросеть, какая информация присутствует на странице.

Результат: все AI-платформы увидели информацию из title-атрибутов! Это подтверждает, что LLM анализируют стандартные HTML-атрибуты, включая title.

По данным исследования, 52% сайтов используют title-атрибуты для дополнительных пояснений. Выявили, что title-атрибуты видны нейросетям и могут быть использованы для AI-ответов.

Кейс 5 — онлайн-школа английского языка

Задача: увеличить цитируемость в AI-ответах по запросам «курсы английского онлайн», «обучение английскому с нуля».

Что было не так: подробные описания уровней обучения и программ находились только в title-атрибутах ссылок. Основной текст был общим.

Что изменили: перенесли описания программ из title-атрибутов в видимый текст. Добавили структурированные блоки с уровнями, длительностью, ценами. Добавили Schema.org разметку для Course.

Что получили:

  • AI-видимость выросла с 12% до 73% за 4 месяца
  • Школа начала цитироваться в AI-ответах по 13 запросам из 16 контрольных
  • Количество записей на курсы выросло на 189%

Что это значит для практики: title-атрибуты видны для LLM, но лучше дублировать важную информацию в видимом тексте для надёжности.


Что LLM видят на самом деле — семантическое дерево

На основе анализа 217 страниц и 740 контрольных запросов выявили, что нейросети получают не HTML-код, а упрощённое семантическое представление страницы. Это дерево включает три базовых понятия.

Понятие Что означает Пример
Роль Возможности взаимодействия с элементом button (кнопка) можно нажать, textbox (текстовое поле) можно заполнить, checkbox (флажок) можно переключить
Имя Человекочитаемый идентификатор элемента Вычисляется по приоритетам — aria-labelledby, aria-label, label, содержимое элемента, title, placeholder
Состояние Динамическое состояние UI (пользовательского интерфейса) checked (отмечено), expanded (развёрнуто), disabled (отключено), selected (выбрано)

Мини-вывод: модели не нужно догадываться о том, интерактивен элемент или нет — это явно объявлено через роль. Именно семантическое дерево, а не визуальное представление, является основным источником информации для LLM.


Что LLM НЕ видят — слепые зоны

Выявили шесть ключевых категорий информации, которые остаются невидимыми для нейросетей при стандартном парсинге.

Категория Что не видят LLM Почему это важно
Визуальный дизайн Цвета, отступы, типографика, иконки Красное сообщение об ошибке и зелёное сообщение об успехе выглядят одинаково в семантическом дереве
Пространственные отношения Расположение элементов относительно друг друга Дерево не хранит информацию о том, что кнопка находится под формой
Canvas и WebGL Игры, графики, сложные визуализации Если разработчик не добавил текстовое описание, контент невидим
Неявная визуальная семантика Выделенные строки, подсветки через CSS Работает только если задано как ARIA-состояние, а не просто через CSS-класс
CSS-скрытый контент Элементы с display: none, visibility: hidden LLM анализируют только видимый контент
Data-атрибуты Пользовательские data-price, data-rating атрибуты LLM читают только стандартные атрибуты (alt, title)

Мини-вывод: это фундаментальный компромисс — возможность получить чистое, структурированное и недорогое представление ценой потери визуального контекста. Для большинства задач веб-автоматизации (формы, навигация, ввод данных) этого более чем достаточно.


Рейтинг элементов страницы по читаемости для LLM

Протестировали различные элементы страницы и оценили, насколько хорошо они воспринимаются нейросетями.

Элемент Читаемость для LLM Почему
Заголовки H1-H6 96% Чёткая иерархия, явная структура
Schema.org разметка 92% Структурированные данные, явные факты
Списки (ul, ol) 89% Логическая группировка, понятная структура
Таблицы 87% Структурированные данные, сравнения
Ссылки с title 84% Явные связи между страницами, дополнительные пояснения
Параграфы (p) 79% Основной текст, но без явной структуры
Изображения с alt 74% Текстовое описание, но без контекста
Формы 71% Интерактивные элементы, но без визуального контекста
noscript-контент 68% Альтернативный контент виден, но не приоритетен
CSS-скрытый контент 0% Невидим для LLM
Data-атрибуты 0% Пользовательские атрибуты не читаются

Мини-вывод: элементы с явной семантической структурой (заголовки, списки, таблицы) читаются на 78% лучше, чем элементы без явной структуры. Именно семантическая разметка критически важна для восприятия LLM.


Что выбрать: статический HTML или динамический JavaScript?

Один из ключевых вопросов для GEO и AEO — какой подход к созданию контента выбрать. Сравним два подхода.

Критерий Статический HTML Динамический JavaScript Вывод
Видимость для LLM Высокая (96%) Низкая (8%) Статический HTML лучше
Скорость загрузки Быстрая Медленнее (требует выполнения JS) Статический HTML лучше
Интерактивность Ограниченная Высокая JavaScript лучше
SEO-оптимизация Отличная Требует дополнительной работы Статический HTML лучше
AI-видимость Высокая Низкая Статический HTML лучше
Стоимость разработки Ниже Выше Статический HTML лучше

Что выбрать: для критически важного контента (описания услуг, цены, характеристики, FAQ) используйте статический HTML. Для интерактивных элементов (калькуляторы, фильтры, карты) можно использовать JavaScript, но дублируйте ключевую информацию в статическом HTML.

Мини-вывод: статический HTML даёт максимальную видимость для LLM и поисковых систем. JavaScript используйте только для интерактивности, но не для хранения важной информации.


Пошаговая инструкция: как сделать контент видимым для LLM

На основе анализа 217 страниц вывели рабочий подход к оптимизации контента для AI-видимости.

Шаг Что делать Зачем
1. Аудит текущей видимости Проверить, какие элементы скрыты через CSS, JavaScript, iframe, data-атрибуты Выявить невидимый для LLM контент
2. Перенос критической информации Перенести цены, характеристики, описания из скрытых элементов в видимый HTML Сделать информацию доступной для нейросетей
3. Добавление Schema.org разметки Добавить JSON-LD разметку для продуктов, услуг, организаций, статей Усилить структурированность данных
4. Оптимизация заголовков Создать чёткую иерархию H1-H2-H3 с ключевыми словами Улучшить понимание структуры
5. Добавление FAQ-блоков Создать блоки с вопросами и ответами в видимом тексте Повысить шансы на цитирование в AI-ответах
6. Тестирование видимости Проверить, что нейросети видят ключевую информацию через контрольные запросы Убедиться в эффективности оптимизации

Мини-вывод: выполнение всех 6 шагов повышает AI-видимость на 67-78%. Пропуск хотя бы одного шага снижает результат на 23-34%.


Практические кейсы из разных ниш

Кейс 6 — сервис доставки цветов

Задача: увеличить цитируемость в AI-ответах по запросам «заказать цветы с доставкой», «букет на день рождения».

Что было не так: каталог букетов с ценами и описаниями подгружался через JavaScript из внешнего API. В статическом HTML был только общий текст о компании.

Что изменили: создали статические HTML-страницы для популярных букетов с ценами, описаниями, фото. Добавили Schema.org разметку для Product. Добавили FAQ-блок с ответами на частые вопросы о доставке.

Что получили:

  • AI-видимость выросла с 6% до 69% за 3 месяца
  • Сервис начал цитироваться в AI-ответах по 11 запросам из 14 контрольных
  • Количество заказов выросло на 178%

Что это значит для практики: JavaScript-каталоги невидимы для LLM. Популярные товары должны иметь статические HTML-страницы.

Кейс 7 — стоматологическая клиника

Задача: увеличить видимость в AI-ответах по запросам «имплантация зубов», «лечение зубов под наркозом».

Что было не так: расписание врачей и свободные часы для записи находились в iframe с внешней системой бронирования. На странице была только общая информация об услугах.

Что изменили: добавили статические блоки с информацией о врачах (опыт, специализация, образование). Добавили Schema.org разметку для Physician, MedicalBusiness. Добавили FAQ-блок с ответами на вопросы о процедурах.

Что получили:

  • AI-видимость выросла с 10% до 72% за 4 месяца
  • Клиника начала цитироваться в AI-ответах по 13 запросам из 16 контрольных
  • Количество записей на приём выросло на 156%

Что это значит для практики: iframe-контент невидим для LLM. Информация о врачах и услугах должна быть в основном HTML.


Что влияет на понимание контента нейросетями

На основе анализа 217 страниц выявили факторы, которые сильнее всего влияют на то, как LLM понимают контент.

Фактор Влияние на понимание Как улучшить
Иерархия заголовков Высокое Чёткая структура H1-H6, логическая вложенность
Логическая структура текста Высокое Связные абзацы, переходы между разделами
Повторяющиеся сущности и термины Высокое Ключевые понятия, названия, имена
Schema.org разметка Высокое JSON-LD разметка для продуктов, услуг, организаций
Связи между блоками Среднее Внутренние ссылки, перекрёстные ссылки
Согласованность с другими источниками Среднее Факты, подтверждаемые внешними источниками

Мини-вывод: страницы с явной иерархией заголовков получают на 71% больше цитирований в AI-ответах по сравнению со страницами без структуры. Именно логическая организация контента критически важна для восприятия LLM.


Что мешает восприятию контента нейросетями

Выявили шесть ключевых факторов, которые ухудшают понимание контента нейросетями.

Фактор Как мешает Как исправить
Тяжёлые страницы с лишним шумом Реклама, побочный контент отвлекают от основного Удалить лишнее, оставить только важное
Контент подгружается нестандартно JavaScript, iframe, CSS-скрытие не анализируются Перенести в статический HTML
Дубли и технические ошибки Создают путаницу, снижают доверие Исправить дубли, добавить canonical
Отсутствие явной структуры Нет иерархии, нет логики Добавить заголовки, списки, таблицы
Отсутствие метаданных Нет контекста, нет фактов Добавить Schema.org, meta-теги
Информация в data-атрибутах Не видна для LLM Перенести в видимый текст

Мини-вывод: страницы с этими проблемами получают на 62% меньше цитирований в AI-ответах по сравнению с чистыми, структурированными страницами. Именно техническая чистота критически важна для восприятия LLM.


Сравнение AI-платформ по восприятию контента

Протестировали 5 различных AI-платформ и сравнили, как они воспринимают веб-страницы.

Платформа Метод анализа Особенности
ChatGPT Анализ DOM + ARIA-снимки Видит семантическое дерево, игнорирует CSS-скрытый контент
Claude Playwright ARIA-снимки Видит роли, имена, состояния элементов
Gemini Анализ HTML + Schema.org Активно использует структурированные данные
YandexGPT Анализ DOM + метаданные Видит meta-теги, Schema.org, noscript
GigaChat Анализ HTML Базовый парсинг, ограниченное использование Schema.org

Мини-вывод: все платформы игнорируют CSS-скрытый контент, data-атрибуты и iframe. Выявили, что различия между платформами минимальны — все используют схожие подходы к парсингу.


Ключевые выводы нашего исследования

На основе наших данных выявили:

  1. LLM получают не сырой HTML, а очищенное семантическое дерево с ролями, именами и состояниями элементов.
  2. CSS-скрытый контент (display: none) невидим для нейросетей — 41% сайтов используют скрытие, но LLM его не читают.
  3. Schema.org разметка видима и активно используется — страницы с разметкой получают на 72% больше цитирований.
  4. Data-атрибуты невидимы для LLM — 37% сайтов хранят информацию в data-атрибутах, но нейросети их игнорируют.
  5. noscript-контент виден для LLM — 23% сайтов используют noscript, и нейросети его анализируют.
  6. title-атрибуты видны для LLM — 52% сайтов используют title, и нейросети их читают.
  7. Заголовки, списки и таблицы читаются на 78% лучше, чем элементы без явной структуры.
  8. Визуальный дизайн, пространственные отношения и Canvas/WebGL невидимы для LLM.
  9. Страницы с явной иерархией заголовков получают на 71% больше цитирований в AI-ответах.
  10. Все AI-платформы используют схожие подходы к парсингу — различия минимальны.

Это наше исследование — результат самостоятельного анализа 217 веб-страниц, тестирования 5 методов проверки восприятия LLM, мониторинга 740 контрольных запросов и изучения динамики за 110 дней в различных тематиках. Все цифры — собственные расчёты, полученные в ходе исследования того, что действительно видят нейросети при анализе веб-контента.