🔄 Як Google бреше: що ми дізналися зі злитої документації

Як ви знаєте, було злито документацію API Гугл пошуку. Загалом на гітхабі викладено щось близько 2500 сторінок документів.  Google поки стоїчно мовчить із цього приводу. Інформації багато, але я спробував більш-менш її адекватно структурувати. Розгляньмо найбільш цікаві моменти.

Алгоритми зі зливу:

  • Trawler – система сканування веб-сторінок. Він має чергу сканування, підтримує швидкість сканування і розуміє, як часто змінюються сторінки.
  • Alexandria – основна система індексації.
  • SegIndexer – система, яка поміщає документи рівнів у рівні індексу.
  • TeraGoogle – вторинна система індексування документів, які довго зберігаються на диску.
  • HtmlrenderWebkitHeadless – система рендерингу сторінок JavaScript.
  • LinkExtractor – витягує посилання зі сторінок.
  • WebMirror – система управління канонізацією і дублюванням.
  • Mustang – основна система підрахунку очок, ранжування та обслуговування.
  • Ascorer – основний алгоритм ранжування, який ранжує сторінки перед будь-якими коригуваннями повторного ранжування.
  • NavBoost – система повторного ранжування на основі журналів кліків про поведінку користувачів.
  • FreshnessTwiddler – система зміни рейтингу документів на основі свіжості.
  • WebChooserScorer – визначає імена функцій, що використовуються під час оцінювання фрагментів.
  • Google Web Server (GWS) – це сервер, з яким взаємодіє інтерфейс Google. Він отримує корисні дані для відображення користувачеві.
  • SuperRoot – це мозок Google Search, який надсилає повідомлення на сервери Google і керує системою постобробки для повторного ранжування та подання результатів.
  • SnippetBrain – система, яка генерує фрагменти результатів.
  • Glue – система об’єднання універсальних результатів на основі поведінки користувача.
  • Cookbook – система генерації сигналів. Є вказівка на те, що значення створюються під час виконання.
  • SiteFocusScore – фіксує, наскільки сайт дотримується однієї теми.

70+ фактів зі зливу

Загинайте пальці:

  1. Navboost і використання кліків, CTR, довгі й короткі кліки та користувацькі дані.
  2. Використання статистики кліків браузера Chrome для поліпшення пошуку в Google.
  3. Білі списки сайтів у сфері подорожей, Covid і політики.
  4. Використання відгуків оцінювачів якості.
  5. Використання даних про кліки, щоб визначити вагу посилань у рейтингу.
  6. У Google є функція, яку вони обчислюють, під назвою «siteAuthority» для оцінки сигналів якості, які зберігаються окремо для кожного документа.
  7.  Виявляється, пісочниця все-таки є в Google.
  8. Google зберігає авторів, пов’язаних із документом, система також намагається визначити, чи є об’єкт на сторінці її автором.
  9. Рівень індексування впливає на цінність посилання.
  10. Google використовує тільки останні 20 змін для даної URL-адреси під час аналізу посилань.
  11. PageRank домашньої сторінки враховується для всіх сторінок.
  12. Розмір шрифту термінів і посилань має значення.
  13. Дані про відхилення посилань не пов’язані з основними системами ранжування.
  14. Короткий контент оцінюється за його оригінальність. Ймовірно, тому “тонкий” контент не завжди залежить від довжини.
  15. Title, як і раніше, оцінюється за запитами.
  16. Довгі Title неоптимальні для збільшення кількості кліків, але вони хороші для підвищення рейтингу.
  17. Дати документа дуже важливі (дата публікації, дата зміни).
  18. Якщо понад 50% сторінок сайту містять відео, сайт вважається орієнтованим на відео, і до нього ставитимуться по-іншому.
  19. Існують документи золотого стандарту.
  20. Your Money Your Life має спеціальну оцінку.
  21. Google спеціально векторизує сторінки та сайти і порівнює вбудовування сторінок із вбудовуваннями сайтів, щоб побачити, наскільки сторінка не по темі.
  22. У Google є спеціальний прапор, який вказує, що сайт є «невеликим персональним сайтом».
  23. SiteFocusScore – фіксує, наскільки сайт дотримується однієї теми.
  24. Цей витік не вирваний з контексту, не застарів і не є неповною інформацією.
  25. Navboost, заснований на даних про кліки, надзвичайно важливий фактор ранжування в пошуку, і тепер завдяки цьому витоку ми знаємо, що це походить від Chrome.
  26. Існують токсичні зворотні посилання, з документами пов’язана функція badbacklinksPenalized.
  27. Є штрафні за погані зворотні посилання.
  28. Google може обмежувати кількість сайтів певного типу, що з’являються в результатах.
  29. Слова або фрази, які асоціюються з об’єктом, можуть вплинути на рейтинг у пошукових системах так само, як це роблять посилання (одразу пригадується кейс від Михайла Шакіна, де він говорив, що гостьовий пост із брендом, але без посилання показав хороший результат).
  30. Існує оцінка відповідності заголовка для сайту, а не тільки для окремих сторінок.
  31. Відповідність заголовка сторінки – важливий фактор.
  32. Google може вказати обмеження результатів для кожного типу контенту. Іншими словами, вони можуть вказати тільки кількість X повідомлень у блогах або кількість Y новинних статей, які можуть з’явитися для даної пошукової видачі.
  33. Модуль QualityTravelGoodSitesData має функції, які ідентифікують і оцінюють туристичні сайти, імовірно, щоб дати їм перевагу перед неофіційними сайтами.
  34. Google визначає, який контент можна або не можна використовувати з Knowledge Graph з LLM.
  35. Можливо, Google за допомогою LLM прогнозує теми відео.
  36. Google намагається визначити кількість зусиль, що витрачаються при створенні контенту. Ґрунтуючись на визначенні, ми не знаємо, чи оцінюється LLM у такий спосіб весь контент, чи це просто контент, який, як вони підозрюють, створено з використанням генеративного ШІ.
  37. Значимість оновлення сторінки впливає на те, як часто сторінка сканується і потенційно індексується. Раніше ви могли просто змінити дати на своїй сторінці, і це сигналізувало Google про її свіжість, але Google очікує більш значних оновлень на сторінці.
  38. У модулі блогу BlogPerDocData є наслідувач без визначення, але прив’язаний до docQualityScore, найімовірніше, це міра дублювання повідомлень у блогах.
  39. Механізм вибірки робота Googlebot здатний виконувати не тільки запити GET. У документації зазначено, що він також може виконувати запити POST, PUT або PATCH.
  40. Google визначає, наскільки комерційна сторінка.
  41. Успіхом також вважається пошук, за якого відбувається клік і користувач проводить на сторінці 5 хвилин, перш ніж повернутися в Google.
  42. Цінність посилань вища на сторінках, які мають вищий пріоритет в індексі.
  43. Twiddlers – це алгоритми переоцінки, які працюють між великими оновленнями та зміною рейтингу в пошуковій видачі.
  44. Надмірно оптимізований якірний текст, особливо якщо він постійно використовується для посилань на ваш сайт з боку третіх осіб, схоже, спричиняє спам-пониження цих посилань.
  45. Погана навігація і домени з точною відповідністю можуть знизити ваш рейтинг.
  46. У Google є показник наповнення ключовими словами.
  47. Google відстежує термін дії доменів, тому вони або вже можуть, або скоро зможуть виявити зловживання щодо прострочених доменів.
  48. Немає чіткої згадки внутрішніх посилань як атрибута.
  49. Google, можливо, ігнорує посилання з контенту, який не має відношення до справи (не релевантний контент).
  50. Важливі посилання з сайтів у тій самій країні, що й ваша.
  51. Google позначає посилання, що надходять із високоякісних новинних сайтів.
  52. Вміст, що оточує посилання, допомагає йому надати контекст.
  53. «Надійні джерела» можуть використовуватися при визначенні ймовірності того, що сторінка є спамом.
  54. Посилання зі сторінок із трафіком, імовірно, більш ефективні, ніж посилання без нього.
  55. Цінність посилання залежить від того, наскільки Google довіряє головній сторінці сайту.
  56. Якщо ви отримуєте посилання на контент, який не є актуальним, є ймовірність, що ці посилання ігноруються і, отже, не впливають на ваш рейтинг.
  57. Google використовує набір «надійних вихідних сайтів», таких як New York Times та інші.
  58. Посилання з цих «високоякісних новинних сайтів», за визначенням Google, здатні певною мірою підвищити авторитет сайту.
  59. Google може посилатися на загальну кількість посилань із надійних джерел за певним URL, значення «true» або «false», що присвоюється посиланням, які надходять із надійних джерел, і, що цікаво, на кількість посилань із надійних джерел із текстом прив’язки, який відповідає умовам розсилки спаму.
  60. Google використовує розрахунок, заснований на кількості посилань з надійних джерел порівняно з тими, які такими не є, для визначення ймовірності того, що сторінка є спамом.
  61. Найважливіший, найдоступніший і регулярно оновлюваний контент зберігається у флеш-пам’яті.
  62. Менш важливий контент зберігається на твердотільних накопичувачах.
  63. Ще менш важливий або застарілий контент зберігається на стандартних жорстких дисках, що підтвердив Гері Ілліес.
  64. Наявність атрибута SourceType визначає якість джерела посилання відповідно до рівня, на якому існує контент.
  65. Свіжість посилань поміщає джерело посилання в групу «високоякісних».
  66. Google використовує кількість переходів на сторінку, щоб визначити, на якому рівні вона перебуває.
  67. Якщо сторінка не отримує кліків, вона переводиться на рівень «низької якості».
  68. За великої кількості кліків сторінку буде переведено на рівень «високої якості».
  69. Посилання зі сторінок низької якості не проходять рівень PageRank. Отже, ці посилання не сприяють підвищенню рейтингу або показника якості сторінки.
  70.  Високоякісні новинні сайти належать до категорії повністю надійних.
  71. Google надає великого значення свіжому, актуальному контенту.

Гугл і автори

Після медік апдейта і повального захоплення YMYL і EEAT стало досить «модним» прописувати авторів контенту і цих авторів пробувати «розкручувати», напрацьовуючи для них досвід і авторитет (відповідно до QRG). Але останні півроку-рік ентузіазм у цьому плані дещо вщух, почали чути заяви окремих оптимізаторів, що Гугл авторство ніяк не враховує, ніяк на ранжування це не впливає.

Для розуміння, необхідно розрізняти сигнали ранжування і фактори ранжування. Другі залежать від перших. Сигнали прямо не впливають на ранжування, але обумовлюють значущість факторів ранжування.

Авторство – це сигнал ранжування.

У зливі видно, як Гугл зберігає авторів у вигляді текстового рядка або як намагається виокремити авторів з об’єктів на сторінці.

У поєднанні з докладним відображенням сутностей і вкладень, представленим у зливі, стає цілком зрозуміло, що існує деяка комплексна оцінка авторів.

Звідси висновок – удосконалюйте мікророзмітку (структуровані дані), прописуйте авторів (schema.org/Person) максимально повно.

Про пісочницю

Тривалий час гуглівці загалом, а Мюллер зокрема, стверджували, що ніякої пісочниці немає. Що ранжуються і нові сайти, і застарілі аксакали абсолютно однаково (не враховуючи інших чинників ранжування).

Якщо зазирнути в матеріали витоку, а саме в модуль PerDocData, то побачимо там атрибут hostAge, про який говориться: The earliest firstseen date of all pages in this host/domain. Ці дані використовуються в twiddler для sandbox fresh spam in serving time.

Найбільш рання дата першого перегляду всіх сторінок на цьому хості/домені. Ці дані використовуються в twiddler для пісочниці свіжого спаму за часом обслуговування.

Так виходить пісочниця є насправді? Як вона працює, скільки триває та інше – оптимізатори і так знають. Але навіщо було брехати? Незрозуміло.

Про траст сайту

Концепція трасту (авторитету сайту) зародилася на зорі пошукових систем. Якщо коротко, то траст – це міра оцінки авторитетності сайту. Нічого спільного з PageRank траст не має (хоча й залежить від останнього).

Раніше представники Google (ми знаємо хто, але не говоритимемо) заявляли, що Google узагалі не вимірює і не враховує авторитетність домену. Вони заявили, що не беруть до уваги загальну якість або авторитетність сайту (загалом) під час ранжування окремих сторінок. Однак злив показав, що як частина стислих сигналів якості, які зберігаються окремо для кожного документа, у Google є функція, яку вони обчислюють, під назвою siteAuthority.

siteAuthority (type: integer(), default: nil) – site_authority: перетворено з quality_nsr.SiteAuthority, застосовано в Qstar.

Таким чином, траст сайту вимірюється Гуглом. Знову ж таки, ми точно не знаємо, наскільки це важливо для ранжування, але Google якимось чином на це дивиться, оцінює, використовує.

Про поведінкове і кліки

Багато років поспіль Гугл брехав, що поведінкові сигнали ніяк не беруть участі в ранжируванні. Мовляв вони надмірно зашумлені і не можуть достовірно служити фактором ранжування.

Як з’ясувалося під час антимонопольного судового розгляду, у Google є така собі система Navboost, заснована на кількості та якості кліків, що є одним із важливих сигналів під час ранжування сайтів.

Якщо глянути злив, то ми побачимо, що Гугл оцінює якість кліків. У нього є badClicks, GoodClicks, LastLongestClicks тощо.

Звідси висновки – поведінка користувачів вкрай важлива для ранжування сторінок, хоч би як це заперечував Гугл.

Про обсяг контенту на сторінці

Як нам казали гугловці – розмір контенту не має значення. Він ранжується абсолютно за одними й тими самими правилами, що коротка стаття, що довга.

Це не так.

Великі документи Гугл обрізає. Він розраховує кількість токенів і співвідношення загальної кількості слів у тексті до кількості унікальних токенів. У документах зазначено, що існує максимальна кількість токенів, які можна розглядати для документа, особливо в системі Mustang. Частину документів урізають.

Мустанг – це основна підсистема підрахунку рейтингів, ранжування та обслуговування ядра алгоритмів Гугла.

Ви можете перевірити самі – взяти речення з початку контенту і пошукати його в Гуглі. А потім повторити те ж саме, взявши речення з кінця контенту. Якщо він безглуздий, то знайдений він не буде (на відміну від першого).

Звідси висновок – усе найважливіше розміщуємо вгорі контенту, до лінії згину екрана (включно із зовнішніми посиланнями).

Другий момент, якщо контент надмірно короткий, то включається додаткова оцінка його оригінальності – OriginalContentScore. При цьому короткий контент не обов’язково буде Thin – контентом (безглуздим, непотрібним). При цьому існує показник наповнення ключовими словами (переспам).

Додати коментар