Чому багато великих сайтів додають так багато правил до robots.txt, якщо є велика ймовірність, що ці сторінки потраплять в індекс. Чому відразу не використовувати <meta name=”robots” content=”noindex”>?
За допомогою robots.txt ви можете керувати скануванням свого сайту, але не індексуванням. Тобто скласти маршрут, за яким буде слідувати пошуковий робот і вказати сторінки і розділи, на які роботу заходити не варто.
Так, директиви в robots.txt – це всього лише рекомендації для роботів ПС, але помилка: “проіндексовано, незважаючи на блокування в файлі robots.txt” найчастіше виникає через те, що на такі сторінки ведуть зовнішні посилання з інших сайтів або внутрішні посилання з вашого.
Великі сайти додають так багато правил у файл robots.txt для того, щоб оптимізувати краулінговий бюджет сайту і підвищити ймовірність обходу потрібних і корисних сторінок.
Метатег <meta name=”robots” content= “noindex”> дозволяє управляти індексуванням сайту, тобто навіть якщо робот виявить сторінку, він не додасть її в індекс ПС. Але найчастіше при запуску сайту технічні або службові сторінки, які нам не потрібні, простіше закрити через robots.txt прописавши там пару рядків.









