Что реально стало известно после утечки алгоритмов Google

А помните, пару лет назад была шумиха на тему «слива» алгоритмов ранжирования поисковой системы Google? Если быть максимально точным, то речь шла об утечке Google Content Warehouse API, ставшей публичной в мае 2024 года. После двух лет обсуждений главный вывод выглядит намного прозаичнее, чем заголовки докладов с SEO-конференций. В действительности, утечка не раскрыла формулу Google, но показала, какие виды данных поисковая система умеет хранить и потенциально использовать.

В документации было около 2 596 модулей и 14 014 атрибутов, но не было весов сигналов, пороговых значений, исходного кода и точной последовательности вычислений. Поэтому называть содержимое «14 тысячами факторов ранжирования» было бы некорректно. Часть полей могла использоваться для экспериментов, индексирования, внутренних инструментов или уже быть отключена.

В данной статье я просто хочу подвести итоги того, что реально стало известно о работе поисковой системы Google после «слива». Без спекуляций, без теорий и гипотез, без хайпа.

1. Поведение пользователей действительно имеет значение

Это, вероятно, наиболее важное практическое подтверждение.

В документации присутствуют:

  • goodClicks;
  • badClicks;
  • lastLongestClicks;
  • unsquashedClicks;
  • данные по устройствам, странам, запросам и URL;
  • многочисленные упоминания NavBoost.

Но окончательно существование и назначение NavBoost подтвердили даже не столько утечки, сколько материалы антимонопольного разбирательства в США. В судебном документе Google NavBoost описан как сигнал, учитывающий частоту кликов на конкретный документ по конкретному запросу с разделением по устройствам и местоположению. Система использует данные примерно за последние 13 месяцев.

Это не означает, что простой CTR напрямую определяет позиции и что клики можно безопасно накручивать. Google нормализует данные, распознаёт аномальное поведение и объединяет пользовательские сигналы с большим количеством других показателей. Практический вывод другой:

Страница должна не просто получить клик, а удовлетворить человека настолько, чтобы он не продолжал искать более подходящий ответ.

Для SEO это усилило значение:

  • точного соответствия поисковому намерению;
  • понятного title и сниппета;
  • быстрого ответа в начале страницы;
  • отсутствия обманных заголовков;
  • удобства чтения;
  • реальной полноты материала.

2. Google оценивает не только страницу, но и сайт целиком

В документации обнаружено поле siteAuthority. Это показывает, что у Google существует определённая оценка на уровне сайта, хотя мы не знаем, как она рассчитывается и насколько сильно влияет на разные типы запросов. Это также не означает, что siteAuthority равен Domain Rating Ahrefs или Domain Authority Moz. 

Кроме того, Google хранит PageRank главной страницы и сведения о степени доверия к главной странице источника. Это косвенно подтверждает, что новый материал не рассматривается в полном отрыве от репутации домена, структуры сайта и уже известных Google страниц. 

Практический вывод для информационного сайта:

  • сотня качественных статей на сильном тематическом ресурсе может работать лучше тысячи разрозненных SEO-текстов;
  • репутация и качество всего домена могут влиять на шансы новых страниц;
  • нельзя бесконечно публиковать слабые статьи, рассчитывая, что Google будет оценивать каждую изолированно;
  • главная страница и основные разделы должны ясно объяснять тематику и назначение проекта.

3. Тематическая связность сайта измеряется технически

Одно из наиболее полезных открытий — поля:

  • siteFocusScore;
  • siteRadius;
  • siteEmbedding;
  • pageEmbedding.

Документация указывает, что Google может создавать векторное представление сайта, сравнивать с ним отдельную страницу и оценивать, насколько далеко материал отклоняется от основной тематики ресурса. 

Это не означает, что многотематические СМИ автоматически получают наказание. У крупных ресурсов могут быть сильные отдельные разделы, категории, авторы и сущности. Но для небольшого информационного сайта хаотичное расширение тематик может размывать понятность проекта.

Например, если один сайт публикует одновременно:

  • статьи о строительстве;
  • обзоры смартфонов;
  • медицинские советы;
  • биографии знаменитостей;
  • рецепты;
  • новости криптовалют,

Google сложнее определить, в какой области сайт действительно заслуживает доверия.

Для ваших информационных сайтов это особенно важный вывод: лучше развивать полноценные тематические кластеры, чем размещать отдельные статьи под любые доступные ключи.

4. Ссылки по-прежнему важны, но не все ссылки равны

Документы подтвердили существование нескольких вариантов PageRank, оценок источника ссылки, доверия к главной странице и механизмов понижения ссылки при смысловом несоответствии источника и целевой страницы. Также учитываются страна, тип источника, положение документа в индексе и другие параметры. Главный практический вывод:

Тематическая и контекстная уместность ссылки важнее абстрактного показателя DR сайта-донора.

Полезнее получить ссылку:

  • из подходящей по теме статьи;
  • с посещаемого отраслевого сайта;
  • из материала, который сам находится в основном индексе;
  • с естественным окружением и понятной причиной упоминания,

чем массово покупать ссылки с высокими SEO-метриками, но без связи с тематикой.

Утечка не дала формулы стоимости ссылки и не доказала, что любая нерелевантная ссылка вредна. Она лишь показала, что Google располагает средствами для гораздо более сложной оценки, чем подсчёт числа доменов-доноров.

5. Объём текста сам по себе почти ничего не гарантирует

В документах упоминаются:

  • показатель оригинальности коротких страниц;
  • оценка переспама;
  • число токенов;
  • ограничение объёма документа, который может обрабатываться отдельной системой;
  • сопоставление заголовков сайта с пользовательскими запросами. 

Это стало дополнительным подтверждением того, что правило «нужно написать 5 000 или 10 000 символов» не имеет самостоятельного смысла. Короткая страница может быть полезной и оригинальной, а длинная — шаблонной и пустой.

Практически это означает:

  • основную информацию лучше размещать ближе к началу;
  • не следует искусственно растягивать материал;
  • title должен точно описывать содержание;
  • ключевые термины должны использоваться естественно;
  • важнее оригинальные сведения, чем высокий процент технической уникальности;
  • пересказ десяти конкурентов другими словами не создаёт настоящей добавленной ценности.

Для информационных сайтов полезной добавленной ценностью могут быть собственные:

  • расчёты;
  • таблицы;
  • фотографии;
  • скриншоты;
  • эксперименты;
  • мнения специалистов;
  • локальные данные;
  • инструкции, проверенные на практике;
  • выводы из первичных документов.

6. Google анализирует даты и историю изменений

В документации присутствуют разные способы определения даты материала:

  • дата, указанная автором;
  • дата, извлечённая из URL или заголовка;
  • семантическая дата, полученная из содержания и связанных документов.

Также утечка указывает на хранение версий страниц и использование истории изменений в отдельных процессах. 

Практический вывод: простая замена даты «2024» на «2026» без содержательного обновления вряд ли делает статью свежей в глазах Google. Поисковик способен сопоставлять дату с текстом, ссылками и предыдущими версиями.

Обновление должно быть реальным:

  • актуализированы цифры;
  • удалены устаревшие советы;
  • добавлены новые факты;
  • проверены ссылки;
  • изменены выводы;
  • пересмотрена структура материала.

7. Новые сайты действительно могут проходить ограничительный период

В документации обнаружено поле hostAge, описанное как используемое для ограничения свежего спама при выдаче. Это подтверждает существование механизма, похожего на то, что SEO-специалисты традиционно называли «песочницей». Но документация говорит именно о борьбе со свежим спамом, а не о гарантированном наказании каждого нового домена. 

Следовательно, новый сайт может не получить доверие и стабильные позиции сразу. Ему нужно накопить историю:

  • нормального сканирования;
  • качественных публикаций;
  • внешних упоминаний;
  • пользовательского спроса;
  • естественных ссылок;
  • отсутствия спамных шаблонов.

8. Данные Chrome присутствуют, но вокруг них было много преувеличений

В документации есть поле chromeInTotal, описанное как число просмотров сайта в Chrome. Chrome-данные также встречаются в модулях, связанных с качеством и формированием дополнительных ссылок в результатах поиска. Однако утечка не доказывает, что обычное увеличение посещений из Chrome автоматически повышает позиции. Неизвестно:

  • где именно применяется этот показатель;
  • с каким весом;
  • для всех ли запросов;
  • используется ли он сейчас;
  • является ли он фактором ранжирования или вспомогательным признаком.

Поэтому практический вывод не в том, чтобы покупать Chrome-трафик. Скорее он заключается в том, что Google способен оценивать реальную известность и посещаемость сайта не только через ссылки.

9. Авторы и сущности распознаются, но «Author Rank» не раскрыт

Документация показывает, что Google хранит сведения об авторах и пытается связать автора с документом как сущность. 

Но из этого нельзя заключить, что:

  • наличие биографии автора автоматически повышает позиции;
  • разметка Person даёт прямой бонус;
  • количество статей автора формирует известный SEO-специалистам числовой рейтинг.

Полезный вывод более ограниченный: настоящие авторы, постоянные профили, публикации по своей специализации и подтверждаемая компетентность помогают Google лучше понимать, кто создал материал. Придумывать десятки фальшивых «экспертов» ради E-E-A-T бессмысленно и рискованно.

Что конференции часто преувеличивали

После утечки появилось несколько слишком категоричных тезисов:

  • «CTR — прямой фактор, его можно накрутить» — не доказано;
  • «Chrome-трафик непосредственно двигает позиции» — не доказано;
  • «найден точный Domain Authority Google» — найдено поле siteAuthority, но формула неизвестна;
  • «все новые сайты помещаются в песочницу» — документация говорит об ограничении свежего спама;
  • «14 014 полей являются факторами ранжирования» — это атрибуты API, а не подтверждённый перечень действующих факторов;
  • «достаточно оптимизировать все найденные поля» — большая часть из них недоступна владельцу сайта и не имеет известного веса.

Что в итоге реально изменилось в SEO

По существу утечка подтвердила переход от примитивного SEO страницы к системе, где одновременно учитываются:

  1. содержание документа;
  2. соответствие запросу;
  3. история пользовательского взаимодействия;
  4. качество и тематическая репутация сайта;
  5. структура и связи между страницами;
  6. ссылки и качество их источников;
  7. сущности, авторы, даты и история документа;
  8. дополнительные этапы повторного ранжирования и понижения.

Для информационных проектов я бы сформулировал главный вывод так:

Google оценивает не то, сколько SEO-текстов вы опубликовали, а заслуживает ли весь проект регулярного сканирования, хранения в индексе и показа пользователям.

Именно поэтому сегодня плохо работает модель: взять ключевой запрос, написать под него 3–5 тысяч символов, поставить точное вхождение и перейти к следующей статье. Утечка не дала кнопки для быстрого роста, но довольно ясно показала, почему тематические сильные сайты с реальной аудиторией, узнаваемостью, ссылками и полезными материалами получают преимущество перед массовыми сетками шаблонных статей. Это интерпретация совокупности обнаруженных сигналов, а не раскрытая Google формула.

Поделиться: