📔 Роль сутностей у пошуку Google за даними зливів

Давайте розберемо, яку увагу Google приділяє сутностям.

entities – A list of entities detected on Document.text
entityRelations – Placeholder. Relationship among Document.entities

Спочатку у гугла є необроблений список сутностей у документі. Ці сутності відіграють центральну роль у тому, що отримуємо в органічній видачі при кожному запиті. При цьому сутності входять у домени сутностей, які забезпечують контекст пов’язаними темами і допомагають знайти взаємопов’язані теми.

Multiple entities can be identified on a document or query. Each entity can be mentioned several times in different positions on the document or query. This message describes a single mention of the entity. Note that a mention can be either explicit or implicit mentions. All explicit mentions refer to exact range in the document where the entity occurred, but implicit mentions may or may not have corresponding range. Next available tag number: 40

Гугл визначає частоту і важливість кожної знайденої сутності. Чим частіше сутність зустрічається – тим вона важливіша. Крім того, гугл виявляє «неявні» сутності.

isImplicit – True if the entity is mentioned implicitly

Наприклад, якщо описується якийсь червоний чобіт у контенті, то гугл може припустити наявність сутності «взуття» в цьому контенті. Таким чином isImplicit вкрай корисний і дає змогу ранжуватися за запитами, яких явно немає в контенті. Отже, немає жодної потреби використовувати всі 100500 варіацій ключових слів у контенті, щоб ранжуватися за ними.

confidenceScore – A probabilistic score describing how certain the annotator is that this exact range in the document or query refers to the entity

Важливо розуміти, що гугл не збирається ранжувати сторінку тільки через наявність якоїсь там сутності на ній. Якийсь confidenceScore вказує, що Гугл оперує тільки найважливішими сутностями контенту.

SalientTermSet is a collection of terms (unigrams and bigrams) with associated weights that can describe something. The “salient terms”
docData – doc_data contain additional salient-term-set-level data
salientTerm – salient_term is the list of terms that are good descriptors, sorted in decreasing order of weight
version – version is the Salient Terms version used to create the SalientTermSet

Стає зрозуміло, що гугл для кожної сторінки ранжує всі найважливіші сутності у зворотному порядку – від найважливішої до найменш цінної.

A list of entities that are latent given this entity. For example, “Lionel Messi” can have the latent entity “FC Barcelona”. See go/refx-latent-entities for detailed description.
latentEntity – Latent entities with associated metadata including source of the relationship

Отже, у списку неявних, латентних сутностей будуть присутні якісь споріднені ключі, пов’язані з головною сутністю. Отже, ці терміни будуть взаємопов’язані з головною сутністю і, можливо, контент ранжуватиметься за ними.

Отже, щоб поліпшити ранжування, необхідно використовувати в контенті не тільки основну сутність, а й пов’язані з нею неявні сутності.

Найкращим прийомом використання сутностей є набивання контенту побічними, пов’язаними сутностями, водночас потрібно відстежувати, що центральна сутність домінує – тобто щонайменше зустрічається частіше (3-5 разів у контенті). При цьому вкрай важливо пхати в контент ті вторинні сутності, яких немає у ваших конкурентів. Саме так і виходить оригінальний контент (а зовсім не рерайтом контенту конкурентів).

Тут відразу виникає питання про те, що потрібно бути в темі, потрібно володіти новими вміннями з генерації (написання) контенту і мати великий словниковий запас – тобто знову ми приходимо до того, що ефективна SEO оптимізація сайту – коли окрім вилизаної технічки ще є професійні автори або редактори, що контролюють якість контенту. Навіть для підготовки промптів для чат-ботів вони потрібні.

Якщо понапихати контент різноманітними сутностями, то це, можливо, спрацює. Але, як завжди, є свої нюанси.

idf – idf of the original_term
label – label can be two things depending on where this message is
originalTerm – original_term are the different ways we found this normalized term in the signals
salience – salience is the importance of the term as a descriptor in [0, 1] (the higher the more important)
signalTerm – signal_term contains extra signal-specific (e.g., body, anchors, clicks) data for this term
virtualTf – virtual_tf is the accumulated corrected term frequency from all the signals
weight – weight is the importance of the term as a descriptor in [0, 100] (the higher the more important)

Сутності та домени сутностей за даними зливів

Якщо з окремими сутностями все зрозуміло, то нагадаю, що всі вони входять до структури вищого рівня, званого доменами сутностей.

Давайте все-таки трохи пограємо з визначеннями. Сутності в SEO – це, по суті, будь-які реальні або абстрактні об’єкти, про які може йти мова в інтернеті. Це можуть бути:

  • Люди: Шевченко, Джамала, будь-який підписник каналу.
  • Місця: Київ, громадський туалет, улюблений магазин «Humana».
  • Речі: Айфон, книга, червоні чоботи.
  • Концепції: любов, щастя, ідіотизм, штучний інтелект.
  • Події: Олімпіада, конференція, концерт.

Домен сутності – це, по суті, група пов’язаних між собою сутностей. За ідеєю, домени сутностей – це ширші тематичні області, що об’єднують безліч сутностей. Це ніби бібліотеки, де зберігаються всі знання про конкретну тему або по іншому, категорії знань.

Наприклад:

Домен «Автомобілі» включає в себе сутності: «BMW», «Toyota», «спортивні автомобілі», «запчастини» тощо.

Домен «Здоров’я» об’єднує сутності: «серцево-судинні захворювання», «харчування», «ліки» тощо.

Здавалося б, що домени сутностей це окремі тематичні категорії. І, скоріше за все, років 10 тому так це і було. На це натякає і старий список NLP категорій Гугла, і дані зливів:

We still allow legacy use case to exist (no forced migration), but we will not accept any new usage of WMA, incl. from existing clients. UDR has the same features and can be used similarly: – To consume the topical entities
categoryConfidenceE2 – The confidence of the category
categoryEncodedMid – See go/category-annotations-api about the story behind various types of category annotations that are provided using the catmid token and category_encoded_mid fields below
confidenceE2 – The confidence scores of all entities in the encoded_mid array
topicalityE2 – The topicality scores of all entities in the encoded_mid array

Але насправді домени сутностей далеко виходять за просто якісь там іменовані категорії.

Як гугл це використовує і чому це так важливо для SEO?

Розуміння пошукових запитів: Пошукові системи намагаються зрозуміти не просто набір слів, а саме сутності та їхні взаємозв’язки. Наприклад, запит «купити айфон» говорить про те, що користувач шукає конкретний продукт з домену «Смартфони».

Структуровані дані: Використовуючи розмітку даних (schema.org), ви можете допомогти пошуковим системам краще зрозуміти ваш контент і видати більш релевантні результати пошуку. Наприклад, ви можете вказати, що на вашій сторінці описано конкретний смартфон із зазначенням його характеристик.

Граф знань: Пошукові системи будують так звані графи знань – величезні бази даних, що пов’язують між собою мільярди сутностей. Чим краще ваш сайт відповідає цій моделі, тим вища ймовірність потрапити в топ видачі.

Ну і так далі…

Як використовувати сутності та домени сутностей у SEO?

  1. Оптимізуйте контент: Використовуйте ключові слова, пов’язані з вашою сутністю та її доменом.
  2. Використовуйте структуровані дані: Розмічайте свої сторінки за допомогою schema.org, щоб допомогти пошуковим системам краще зрозуміти контент. Це дуже важливо, повноцінно розписати сутності в мікророзмітці.
  3. Створюйте якісний контент: Що кориснішим та унікальнішим (про унікальність див попередній пост про сутності) буде ваш контент, то більше шансів, що він асоціюватиметься з вашою сутністю.
  4. Створіть посилання: Посилання від трастових сайтів, пов’язаних із вашою тематикою, допоможуть зміцнити ваш авторитет в очах пошукових систем.

Приклад №1: Уявіть, що ви створюєте сайт про подорожі по Україні. Ваші сутності – це міста України, визначні пам’ятки, готелі тощо. Домен сутностей – «Туризм в Україні». Використовуючи структуровані дані, ви можете вказати, що ваш сайт присвячений подорожам, і описати кожне місто із зазначенням його визначних пам’яток, готелів тощо.

Приклад №2 Як працювати з доменами сутностей (мій досвід).

Є в мене суперпромпт, що описує окремі категорії. Крім стандартних вимог щодо професіоналізму написання тексту, найповніших даних, тональності тексту тощо, він складається з кількох десятків запитань.

Наприклад, описуємо який-небудь глечик для очищення води. Тоді запитання будуть Який матеріал глечика? Як часто треба міняти фільтр? Які фільтри є на ринку? Які виробники випускають фільтри для цього глечика? Чи можна мити глечик у посудомийці? Яке наповнення фільтрів? Які додаткові функції є у глечика (механічний лічильник літражу, аналіз якості очищення тощо)? Ну і так далі – всього штук 20-30 запитань.

Стандартно цей промпт згодовувався Перплексіті, а потім полірувався результат Бардом.

Якщо ми починаємо оперувати доменами сутностей, то перед тим як згодувати промпт Перплексіті, запитую в Барда/Гемені, мовляв, треба зробити опис горезвісного глечика для очищення води, тож будь ласка, проаналізуй промпт і додай до нього більше запитань для розкриття пов’язаних сутностей та їхніх доменів в цьому промпті.

У результаті отримуємо перероблений промпт, у якому понапихано абсолютно неочевидні запитання про сутності глечика. У результаті отримуємо більш всеосяжний опис і, що найцікавіше, структура опису абсолютно різна для кожного горезвісного глечика. Це дуже важливо.

Отже, розуміння сутностей і доменів сутностей – це важливий крок для створення ефективної SEO-стратегії. Це дає змогу вам не просто конкурувати за ключові слова, а будувати глибоке розуміння вашої ніші та надавати користувачам дійсно корисний контент.

Додати коментар