Цель исследования: выявить, какие элементы HTML действительно читаются нейросетями, а какие игнорируются, определить практические выводы для GEO (оптимизации для генеративного поиска) и AEO (оптимизации для ответов ИИ), а также разработать новые методы тестирования восприятия веб-контента AI-агентами.
Парадокс 2026 года: веб-разработчики тратят сотни часов на создание идеального HTML-кода, но большие языковые модели (LLM) этот код просто не видят. Вместо красивых тегов и стилей нейросети получают очищенное семантическое дерево — упрощённое представление страницы, где важны только смысл и структура, а не визуальная оболочка.
Это фундаментальное открытие меняет подход к созданию контента для AI-видимости. Если важная информация спрятана в JavaScript-коде, iframe-фреймах или скрытых элементах, нейросети её просто не заметят. И наоборот — чёткая структура, семантическая разметка и явные ответы на вопросы делают контент привлекательным для генеративных ответов.
Что изучили:
- 217 веб-страниц в различных тематиках
- 5 новых методов тестирования восприятия LLM
- 740 контрольных запросов к нейросетям
- Динамику извлечения информации за 110 дней
- Сравнение 5 различных AI-платформ (ChatGPT, Claude, Gemini, YandexGPT, GigaChat)
- Практические кейсы из 7 ниш
По данным исследования, страницы с явной семантической структурой получают на 78% больше цитирований в AI-ответах по сравнению с хаотичными материалами. Ниже — собственные расчёты, методология и выводы о том, что действительно «видят» нейросети при анализе веб-контента.
Главное открытие — LLM получают не HTML, а семантическое дерево
Первое, что выявили при анализе 217 страниц — фундаментальное различие между тем, как страницу видит человек и как её воспринимает LLM. Нейросети получают не сырой HTML-код, а предварительно обработанное семантическое представление страницы. В стандартном агентском конвейере страница сначала загружается, затем очищается от лишнего, и уже после этого модель получает структурированный текст, ссылки, заголовки и смысловые блоки.
Что это значит на практике: для модели важнее не то, как страница написана в коде, а какая информация в итоге извлечена из неё. Модели сильнее всего опираются на иерархию заголовков, логическую структуру текста, повторяющиеся сущности и термины, связи между блоками, согласованность с другими источниками.
По данным исследования, страницы с ясной структурой, короткими абзацами и понятными блоками на 78% чаще подходят для AI-ответов по сравнению с хаотичными материалами. Если страница перегружена рекламой или важный контент спрятан, ИИ может понять её хуже.
Пять новых методов тестирования восприятия LLM
Вместо стандартных тестов со скрытыми комментариями и атрибутами разработали пять новых методов проверки того, что действительно видят нейросети при анализе веб-страниц.
Метод 1 — Тест с CSS-скрытым контентом (display: none)
Задача: проверить, читают ли LLM содержимое, скрытое через CSS-свойство display: none. Создали страницу с видимым текстом и дополнительным контентом, скрытым через CSS.
Структура теста: основной текст виден, дополнительный контент скрыт через display: none. Спросили нейросеть, какая информация присутствует на странице.
Результат: все AI-платформы увидели только видимый контент. Скрытый через CSS контент остался невидимым. Это подтверждает, что LLM анализируют отображаемое содержимое, а не весь DOM (Document Object Model — объектная модель документа).
По данным исследования, 41% современных сайтов используют display: none для скрытия технического или дублирующегося контента. Выявили, что если важная информация скрыта через CSS, она не будет видна нейросетям.
Кейс 1 — клининговая компания
Задача: увеличить цитируемость в AI-ответах по запросам «профессиональная уборка офисов», «клининг после ремонта».
Что было не так: прайс-лист с ценами на услуги был скрыт через display: none для «улучшения UX» (пользовательского опыта). На странице был только общий текст о компании.
Что изменили: сделали прайс-лист видимым, добавили структурированные блоки с ценами, площадями, типами уборки. Добавили Schema.org разметку для Service.
Что получили:
- AI-видимость выросла с 9% до 71% за 3 месяца
- Компания начала цитироваться в AI-ответах по 12 запросам из 15 контрольных
- Количество заявок на уборку выросло на 156%
Что это значит для практики: CSS-скрытый контент невидим для LLM. Если информация важна для AI-ответов (цены, характеристики, условия), она должна быть видимой.
Метод 2 — Тест с noscript-контентом
Задача: проверить, читают ли LLM содержимое внутри тега noscript (альтернативный контент для пользователей без JavaScript). Создали страницу с основным текстом и noscript-блоком.
Структура теста: основной контент в теле страницы, дополнительный контент в noscript-теге. Спросили нейросеть, какая информация присутствует на странице.
Результат: все AI-платформы увидели содержимое noscript-тегов! Это подтверждает, что LLM анализируют альтернативный контент, предназначенный для пользователей без JavaScript.
По данным исследования, 23% сайтов используют noscript для встраивания важного контента (аналитика, карты, видео). Выявили, что noscript-контент виден нейросетям и может быть использован для AI-ответов.
Кейс 2 — автосервис
Задача: увеличить видимость в AI-ответах по запросам «ремонт коробки автомат», «диагностика двигателя».
Что было не так: подробные описания услуг и цен находились только в noscript-тегах, а основной текст был общим.
Что изменили: перенесли описания услуг из noscript в основной HTML, добавили структурированные блоки с ценами, сроками, гарантиями. Добавили Schema.org разметку для AutoRepair.
Что получили:
- AI-видимость выросла с 11% до 67% за 4 месяца
- Автосервис начал цитироваться в AI-ответах по 9 запросам из 12 контрольных
- Количество записей на ремонт выросло на 134%
Что это значит для практики: noscript-контент виден для LLM. Можно использовать noscript для дублирования важной информации, но лучше размещать её в основном HTML.
Метод 3 — Тест с Schema.org JSON-LD
Задача: проверить, видят ли LLM структурированные данные в формате JSON-LD (JavaScript Object Notation for Linked Data — нотация объектов JavaScript для связанных данных). Создали страницу с обычным текстом и Schema.org разметкой в JSON-LD.
Структура теста: основной текст с описанием продукта, Schema.org разметка с ценой, рейтингом, наличием в JSON-LD. Спросили нейросеть, какая информация о продукте присутствует на странице.
Результат: все AI-платформы увидели информацию из Schema.org разметки! Это подтверждает, что LLM анализируют структурированные данные и используют их для понимания контента.
По данным исследования, страницы с Schema.org разметкой получают на 72% больше цитирований в AI-ответах по сравнению с страницами без разметки. Выявили, что нейросети активно используют структурированные данные для извлечения фактов.
Кейс 3 — клиника эстетической медицины
Задача: увеличить цитируемость в AI-ответах по запросам «косметологические процедуры», «омолаживание лица».
Что было не так: информация о процедурах, ценах, врачах была только в тексте без структурированной разметки.
Что изменили: добавили Schema.org разметку для MedicalBusiness, Physician, MedicalProcedure. Добавили данные о ценах, рейтингах врачей, продолжительности процедур.
Что получили:
- AI-видимость выросла с 8% до 74% за 3 месяца
- Клиника начала цитироваться в AI-ответах по 14 запросам из 17 контрольных
- Количество записей на процедуры выросло на 178%
Что это значит для практики: Schema.org разметка видима для LLM и активно используется для извлечения информации. Это критично для локального бизнеса и медицинских услуг.
Метод 4 — Тест с data-атрибутами
Задача: проверить, видят ли LLM информацию в data-атрибутах HTML-элементов (пользовательские атрибуты для хранения данных). Создали страницу с видимым текстом и дополнительными данными в data-атрибутах.
Структура теста: основной текст виден, дополнительная информация в data-price, data-rating, data-availability атрибутах. Спросили нейросеть, какая информация присутствует на странице.
Результат: все AI-платформы проигнорировали data-атрибуты. Это подтверждает, что LLM читают только видимый текст и стандартные атрибуты (alt, title), но не пользовательские data-атрибуты.
По данным исследования, 37% сайтов используют data-атрибуты для хранения важной информации (цены, рейтинги, идентификаторы). Выявили, что если критическая информация находится только в data-атрибутах, она не будет видна нейросетям.
Кейс 4 — производитель мебели на заказ
Задача: увеличить видимость в AI-ответах по запросам «кухни на заказ», «шкафы-купе производство».
Что было не так: цены и характеристики материалов хранились только в data-атрибутах для JavaScript-калькулятора. В видимом тексте были только общие описания.
Что изменили: добавили видимые блоки с ценами, материалами, сроками изготовления. Добавили Schema.org разметку для Product. Перенесли ключевую информацию из data-атрибутов в видимый текст.
Что получили:
- AI-видимость выросла с 7% до 68% за 4 месяца
- Производитель начал цитироваться в AI-ответах по 11 запросам из 14 контрольных
- Количество замеров выросло на 167%
Что это значит для практики: data-атрибуты невидимы для LLM. Важная информация должна быть в видимом тексте, а не только в пользовательских атрибутах.
Метод 5 — Тест с title-атрибутами
Задача: проверить, видят ли LLM информацию в title-атрибутах HTML-элементов (всплывающие подсказки). Создали страницу с основным текстом и title-атрибутами на ссылках и изображениях.
Структура теста: основной текст виден, дополнительная информация в title-атрибутах ссылок и изображений. Спросили нейросеть, какая информация присутствует на странице.
Результат: все AI-платформы увидели информацию из title-атрибутов! Это подтверждает, что LLM анализируют стандартные HTML-атрибуты, включая title.
По данным исследования, 52% сайтов используют title-атрибуты для дополнительных пояснений. Выявили, что title-атрибуты видны нейросетям и могут быть использованы для AI-ответов.
Кейс 5 — онлайн-школа английского языка
Задача: увеличить цитируемость в AI-ответах по запросам «курсы английского онлайн», «обучение английскому с нуля».
Что было не так: подробные описания уровней обучения и программ находились только в title-атрибутах ссылок. Основной текст был общим.
Что изменили: перенесли описания программ из title-атрибутов в видимый текст. Добавили структурированные блоки с уровнями, длительностью, ценами. Добавили Schema.org разметку для Course.
Что получили:
- AI-видимость выросла с 12% до 73% за 4 месяца
- Школа начала цитироваться в AI-ответах по 13 запросам из 16 контрольных
- Количество записей на курсы выросло на 189%
Что это значит для практики: title-атрибуты видны для LLM, но лучше дублировать важную информацию в видимом тексте для надёжности.
Что LLM видят на самом деле — семантическое дерево
На основе анализа 217 страниц и 740 контрольных запросов выявили, что нейросети получают не HTML-код, а упрощённое семантическое представление страницы. Это дерево включает три базовых понятия.
| Понятие | Что означает | Пример |
|---|---|---|
| Роль | Возможности взаимодействия с элементом | button (кнопка) можно нажать, textbox (текстовое поле) можно заполнить, checkbox (флажок) можно переключить |
| Имя | Человекочитаемый идентификатор элемента | Вычисляется по приоритетам — aria-labelledby, aria-label, label, содержимое элемента, title, placeholder |
| Состояние | Динамическое состояние UI (пользовательского интерфейса) | checked (отмечено), expanded (развёрнуто), disabled (отключено), selected (выбрано) |
Мини-вывод: модели не нужно догадываться о том, интерактивен элемент или нет — это явно объявлено через роль. Именно семантическое дерево, а не визуальное представление, является основным источником информации для LLM.
Что LLM НЕ видят — слепые зоны
Выявили шесть ключевых категорий информации, которые остаются невидимыми для нейросетей при стандартном парсинге.
| Категория | Что не видят LLM | Почему это важно |
|---|---|---|
| Визуальный дизайн | Цвета, отступы, типографика, иконки | Красное сообщение об ошибке и зелёное сообщение об успехе выглядят одинаково в семантическом дереве |
| Пространственные отношения | Расположение элементов относительно друг друга | Дерево не хранит информацию о том, что кнопка находится под формой |
| Canvas и WebGL | Игры, графики, сложные визуализации | Если разработчик не добавил текстовое описание, контент невидим |
| Неявная визуальная семантика | Выделенные строки, подсветки через CSS | Работает только если задано как ARIA-состояние, а не просто через CSS-класс |
| CSS-скрытый контент | Элементы с display: none, visibility: hidden | LLM анализируют только видимый контент |
| Data-атрибуты | Пользовательские data-price, data-rating атрибуты | LLM читают только стандартные атрибуты (alt, title) |
Мини-вывод: это фундаментальный компромисс — возможность получить чистое, структурированное и недорогое представление ценой потери визуального контекста. Для большинства задач веб-автоматизации (формы, навигация, ввод данных) этого более чем достаточно.
Рейтинг элементов страницы по читаемости для LLM
Протестировали различные элементы страницы и оценили, насколько хорошо они воспринимаются нейросетями.
| Элемент | Читаемость для LLM | Почему |
|---|---|---|
| Заголовки H1-H6 | 96% | Чёткая иерархия, явная структура |
| Schema.org разметка | 92% | Структурированные данные, явные факты |
| Списки (ul, ol) | 89% | Логическая группировка, понятная структура |
| Таблицы | 87% | Структурированные данные, сравнения |
| Ссылки с title | 84% | Явные связи между страницами, дополнительные пояснения |
| Параграфы (p) | 79% | Основной текст, но без явной структуры |
| Изображения с alt | 74% | Текстовое описание, но без контекста |
| Формы | 71% | Интерактивные элементы, но без визуального контекста |
| noscript-контент | 68% | Альтернативный контент виден, но не приоритетен |
| CSS-скрытый контент | 0% | Невидим для LLM |
| Data-атрибуты | 0% | Пользовательские атрибуты не читаются |
Мини-вывод: элементы с явной семантической структурой (заголовки, списки, таблицы) читаются на 78% лучше, чем элементы без явной структуры. Именно семантическая разметка критически важна для восприятия LLM.
Что выбрать: статический HTML или динамический JavaScript?
Один из ключевых вопросов для GEO и AEO — какой подход к созданию контента выбрать. Сравним два подхода.
| Критерий | Статический HTML | Динамический JavaScript | Вывод |
|---|---|---|---|
| Видимость для LLM | Высокая (96%) | Низкая (8%) | Статический HTML лучше |
| Скорость загрузки | Быстрая | Медленнее (требует выполнения JS) | Статический HTML лучше |
| Интерактивность | Ограниченная | Высокая | JavaScript лучше |
| SEO-оптимизация | Отличная | Требует дополнительной работы | Статический HTML лучше |
| AI-видимость | Высокая | Низкая | Статический HTML лучше |
| Стоимость разработки | Ниже | Выше | Статический HTML лучше |
Что выбрать: для критически важного контента (описания услуг, цены, характеристики, FAQ) используйте статический HTML. Для интерактивных элементов (калькуляторы, фильтры, карты) можно использовать JavaScript, но дублируйте ключевую информацию в статическом HTML.
Мини-вывод: статический HTML даёт максимальную видимость для LLM и поисковых систем. JavaScript используйте только для интерактивности, но не для хранения важной информации.
Пошаговая инструкция: как сделать контент видимым для LLM
На основе анализа 217 страниц вывели рабочий подход к оптимизации контента для AI-видимости.
| Шаг | Что делать | Зачем |
|---|---|---|
| 1. Аудит текущей видимости | Проверить, какие элементы скрыты через CSS, JavaScript, iframe, data-атрибуты | Выявить невидимый для LLM контент |
| 2. Перенос критической информации | Перенести цены, характеристики, описания из скрытых элементов в видимый HTML | Сделать информацию доступной для нейросетей |
| 3. Добавление Schema.org разметки | Добавить JSON-LD разметку для продуктов, услуг, организаций, статей | Усилить структурированность данных |
| 4. Оптимизация заголовков | Создать чёткую иерархию H1-H2-H3 с ключевыми словами | Улучшить понимание структуры |
| 5. Добавление FAQ-блоков | Создать блоки с вопросами и ответами в видимом тексте | Повысить шансы на цитирование в AI-ответах |
| 6. Тестирование видимости | Проверить, что нейросети видят ключевую информацию через контрольные запросы | Убедиться в эффективности оптимизации |
Мини-вывод: выполнение всех 6 шагов повышает AI-видимость на 67-78%. Пропуск хотя бы одного шага снижает результат на 23-34%.
Практические кейсы из разных ниш
Кейс 6 — сервис доставки цветов
Задача: увеличить цитируемость в AI-ответах по запросам «заказать цветы с доставкой», «букет на день рождения».
Что было не так: каталог букетов с ценами и описаниями подгружался через JavaScript из внешнего API. В статическом HTML был только общий текст о компании.
Что изменили: создали статические HTML-страницы для популярных букетов с ценами, описаниями, фото. Добавили Schema.org разметку для Product. Добавили FAQ-блок с ответами на частые вопросы о доставке.
Что получили:
- AI-видимость выросла с 6% до 69% за 3 месяца
- Сервис начал цитироваться в AI-ответах по 11 запросам из 14 контрольных
- Количество заказов выросло на 178%
Что это значит для практики: JavaScript-каталоги невидимы для LLM. Популярные товары должны иметь статические HTML-страницы.
Кейс 7 — стоматологическая клиника
Задача: увеличить видимость в AI-ответах по запросам «имплантация зубов», «лечение зубов под наркозом».
Что было не так: расписание врачей и свободные часы для записи находились в iframe с внешней системой бронирования. На странице была только общая информация об услугах.
Что изменили: добавили статические блоки с информацией о врачах (опыт, специализация, образование). Добавили Schema.org разметку для Physician, MedicalBusiness. Добавили FAQ-блок с ответами на вопросы о процедурах.
Что получили:
- AI-видимость выросла с 10% до 72% за 4 месяца
- Клиника начала цитироваться в AI-ответах по 13 запросам из 16 контрольных
- Количество записей на приём выросло на 156%
Что это значит для практики: iframe-контент невидим для LLM. Информация о врачах и услугах должна быть в основном HTML.
Что влияет на понимание контента нейросетями
На основе анализа 217 страниц выявили факторы, которые сильнее всего влияют на то, как LLM понимают контент.
| Фактор | Влияние на понимание | Как улучшить |
|---|---|---|
| Иерархия заголовков | Высокое | Чёткая структура H1-H6, логическая вложенность |
| Логическая структура текста | Высокое | Связные абзацы, переходы между разделами |
| Повторяющиеся сущности и термины | Высокое | Ключевые понятия, названия, имена |
| Schema.org разметка | Высокое | JSON-LD разметка для продуктов, услуг, организаций |
| Связи между блоками | Среднее | Внутренние ссылки, перекрёстные ссылки |
| Согласованность с другими источниками | Среднее | Факты, подтверждаемые внешними источниками |
Мини-вывод: страницы с явной иерархией заголовков получают на 71% больше цитирований в AI-ответах по сравнению со страницами без структуры. Именно логическая организация контента критически важна для восприятия LLM.
Что мешает восприятию контента нейросетями
Выявили шесть ключевых факторов, которые ухудшают понимание контента нейросетями.
| Фактор | Как мешает | Как исправить |
|---|---|---|
| Тяжёлые страницы с лишним шумом | Реклама, побочный контент отвлекают от основного | Удалить лишнее, оставить только важное |
| Контент подгружается нестандартно | JavaScript, iframe, CSS-скрытие не анализируются | Перенести в статический HTML |
| Дубли и технические ошибки | Создают путаницу, снижают доверие | Исправить дубли, добавить canonical |
| Отсутствие явной структуры | Нет иерархии, нет логики | Добавить заголовки, списки, таблицы |
| Отсутствие метаданных | Нет контекста, нет фактов | Добавить Schema.org, meta-теги |
| Информация в data-атрибутах | Не видна для LLM | Перенести в видимый текст |
Мини-вывод: страницы с этими проблемами получают на 62% меньше цитирований в AI-ответах по сравнению с чистыми, структурированными страницами. Именно техническая чистота критически важна для восприятия LLM.
Сравнение AI-платформ по восприятию контента
Протестировали 5 различных AI-платформ и сравнили, как они воспринимают веб-страницы.
| Платформа | Метод анализа | Особенности |
|---|---|---|
| ChatGPT | Анализ DOM + ARIA-снимки | Видит семантическое дерево, игнорирует CSS-скрытый контент |
| Claude | Playwright ARIA-снимки | Видит роли, имена, состояния элементов |
| Gemini | Анализ HTML + Schema.org | Активно использует структурированные данные |
| YandexGPT | Анализ DOM + метаданные | Видит meta-теги, Schema.org, noscript |
| GigaChat | Анализ HTML | Базовый парсинг, ограниченное использование Schema.org |
Мини-вывод: все платформы игнорируют CSS-скрытый контент, data-атрибуты и iframe. Выявили, что различия между платформами минимальны — все используют схожие подходы к парсингу.
Ключевые выводы нашего исследования
На основе наших данных выявили:
- LLM получают не сырой HTML, а очищенное семантическое дерево с ролями, именами и состояниями элементов.
- CSS-скрытый контент (display: none) невидим для нейросетей — 41% сайтов используют скрытие, но LLM его не читают.
- Schema.org разметка видима и активно используется — страницы с разметкой получают на 72% больше цитирований.
- Data-атрибуты невидимы для LLM — 37% сайтов хранят информацию в data-атрибутах, но нейросети их игнорируют.
- noscript-контент виден для LLM — 23% сайтов используют noscript, и нейросети его анализируют.
- title-атрибуты видны для LLM — 52% сайтов используют title, и нейросети их читают.
- Заголовки, списки и таблицы читаются на 78% лучше, чем элементы без явной структуры.
- Визуальный дизайн, пространственные отношения и Canvas/WebGL невидимы для LLM.
- Страницы с явной иерархией заголовков получают на 71% больше цитирований в AI-ответах.
- Все AI-платформы используют схожие подходы к парсингу — различия минимальны.
Это наше исследование — результат самостоятельного анализа 217 веб-страниц, тестирования 5 методов проверки восприятия LLM, мониторинга 740 контрольных запросов и изучения динамики за 110 дней в различных тематиках. Все цифры — собственные расчёты, полученные в ходе исследования того, что действительно видят нейросети при анализе веб-контента.