Файл robots.txt — один из первых документов, к которому обращаются поисковые роботы при посещении сайта. Именно он подсказывает, какие разделы можно обходить, а какие следует исключить из сканирования.
Несмотря на простоту синтаксиса, ошибки в настройке robots.txt способны привести к серьёзным последствиям: от потери индексации важных страниц до бесполезной траты краулингового бюджета. Поэтому понимание принципов работы этого файла является обязательным для любого SEO-специалиста и владельца сайта.
В этом руководстве подробно разберём, как работает robots.txt, какие директивы поддерживаются поисковыми системами, какие ошибки встречаются чаще всего и как использовать файл для эффективной технической оптимизации сайта.
💡 Мнение эксперта SEO-Pulse
Robots.txt не управляет индексацией напрямую. Его задача — управлять обходом сайта поисковыми роботами. Именно поэтому важно понимать разницу между запретом сканирования и запретом индексации, которую часто путают даже опытные специалисты.
Что такое robots.txt
Robots.txt — это текстовый файл, расположенный в корневой директории сайта. Он содержит инструкции для поисковых роботов о том, какие разделы сайта разрешено или запрещено сканировать.
Например:
https://example.com/robots.txt
При первом посещении сайта поисковый робот обычно запрашивает именно этот файл, чтобы определить правила обхода.
Основные задачи robots.txt
- управление обходом сайта;
- экономия Crawl Budget;
- исключение технических разделов из обхода;
- указание расположения XML Sitemap;
- ограничение доступа для отдельных роботов.
Как работает robots.txt
Алгоритм работы достаточно простой.
- Робот открывает сайт.
- Запрашивает файл robots.txt.
- Считывает правила для своего User-agent.
- Определяет, какие URL разрешено обходить.
- Начинает сканирование сайта.
🔍 Проверяем на практике
Введите в браузере:
https://ваш-домен.ru/robots.txt
Если файл отсутствует, большинство поисковых систем будет считать, что ограничений на обход нет.
Синтаксис robots.txt
Файл состоит из простых директив, каждая из которых имеет своё назначение.
User-agent
Определяет, для какого поискового робота предназначены последующие правила.
User-agent: Googlebot
Или для всех роботов:
User-agent: *
Disallow
Запрещает обход определённых страниц или каталогов.
Disallow: /admin/
В результате робот не будет сканировать содержимое каталога /admin/.
Allow
Разрешает обход отдельных страниц внутри запрещённого раздела.
User-agent: *
Disallow: /catalog/
Allow: /catalog/public/
Такой подход позволяет закрыть большую часть каталога, оставив доступ только к нужному подразделу.
Sitemap
Позволяет указать расположение XML Sitemap.
Sitemap: https://example.com/sitemap.xml
Если используется индекс карт сайта, рекомендуется указывать именно его.
Самые популярные примеры robots.txt
Полностью открытый сайт
User-agent: *
Disallow:
Закрытый административный раздел
User-agent: *
Disallow: /admin/
Несколько запрещённых директорий
User-agent: *
Disallow: /admin/
Disallow: /cgi-bin/
Disallow: /tmp/
Disallow: /cart/
💡 Совет SEO-Pulse
Не стремитесь закрыть в robots.txt всё подряд. Запрещайте только те разделы, которые действительно не должны расходовать краулинговый бюджет или не несут ценности для поисковых систем.
Robots.txt и индексация — в чём разница?
Это одна из самых распространённых тем для путаницы.
| Robots.txt | Meta Robots |
|---|---|
| Управляет обходом | Управляет индексацией |
| Может запретить сканирование | Может запретить индексирование |
| Не гарантирует отсутствие страницы в поиске | Исключает страницу из индекса при корректной обработке |
⚠ Типичная ошибка
Закрыть страницу через Disallow и ожидать, что она исчезнет из поиска. Если на такую страницу ведут внешние ссылки, поисковая система может сохранить её в индексе без возможности просканировать содержимое.
Промежуточный вывод
Robots.txt — это инструмент управления обходом сайта, а не универсальный способ скрыть страницы из поисковой выдачи. Для корректной работы важно понимать назначение каждой директивы и использовать файл только для тех задач, для которых он действительно предназначен.
Специальные символы в robots.txt
Помимо основных директив, robots.txt поддерживает специальные символы, позволяющие более гибко управлять обходом сайта. Их использование особенно полезно для крупных проектов, интернет-магазинов и сайтов с большим количеством параметризованных URL.
Символ *
Символ * означает любое количество любых символов.
Например:
User-agent: *
Disallow: /*?
Такое правило запрещает обход всех URL, содержащих параметры.
Например:
- /catalog/?sort=price
- /blog/?page=2
- /search/?q=seo
💡 Совет SEO-Pulse
Используйте символ * аккуратно. Слишком широкие правила могут случайно закрыть полезные страницы от обхода.
Символ $
Символ $ обозначает конец URL.
Например:
Disallow: /*.pdf$
В этом случае правило распространяется только на PDF-файлы.
| URL | Будет запрещён |
|---|---|
| /guide.pdf | ✅ |
| /guide.pdf?download=1 | ❌ |
| /images/file.pdf | ✅ |
Комментарии
Для документирования правил используются комментарии.
# Административный раздел
Disallow: /admin/
Комментарии игнорируются поисковыми роботами, но значительно упрощают сопровождение файла.
Поддерживается ли Crawl-delay?
Директива Crawl-delay позволяет указывать задержку между запросами поискового робота.
Например:
User-agent: Bingbot
Crawl-delay: 5
Важно
| Поисковая система | Crawl-delay |
|---|---|
| ❌ Не поддерживается | |
| Bing | ✅ Поддерживается |
| Яндекс | ✅ Поддерживается |
⚠ Типичная ошибка
Использовать Crawl-delay в надежде ограничить скорость обхода Googlebot. Google полностью игнорирует эту директиву.
Как Google обрабатывает robots.txt
Googlebot загружает robots.txt перед началом обхода сайта и анализирует наиболее подходящий набор правил для своего User-agent.
При наличии нескольких совпадающих правил применяется наиболее специфичное.
Пример
User-agent: *
Disallow: /admin/
User-agent: Googlebot
Allow: /admin/public/
Для Googlebot будет разрешён обход каталога /admin/public/, несмотря на общий запрет.
Robots.txt и Google Search Console
Google Search Console предоставляет удобные инструменты для проверки влияния robots.txt на обход сайта.
Рекомендуется регулярно анализировать:
- ошибки обхода;
- страницы, заблокированные robots.txt;
- статистику сканирования;
- отчёты по индексированию.
🔍 Проверяем на практике
- Откройте Google Search Console.
- Перейдите в отчёт «Индексация страниц».
- Найдите страницы с причиной «Blocked by robots.txt».
- Убедитесь, что блокировка действительно запланирована.
Типичные ошибки в robots.txt
| Ошибка | Последствия |
|---|---|
| Disallow: / | Полная блокировка обхода сайта. |
| Закрыты CSS и JS | Ошибки рендеринга страниц. |
| Закрыты изображения | Проблемы с индексацией изображений. |
| Закрыты страницы категорий | Потеря органического трафика. |
| Отсутствует Sitemap | Замедленное обнаружение новых URL. |
| Используются устаревшие правила | Некорректный обход после обновления сайта. |
💡 Совет SEO-Pulse
После каждого крупного обновления сайта автоматически проверяйте robots.txt. Даже небольшое изменение шаблона или CMS может случайно заменить файл и изменить правила обхода.
Robots.txt и Crawl Budget
Для небольших сайтов влияние robots.txt на Crawl Budget практически незаметно. Однако на крупных проектах с сотнями тысяч URL грамотная настройка помогает направить ресурсы поисковых роботов на действительно важные страницы.
Чаще всего рекомендуется ограничивать обход:
- страниц поиска;
- фильтров товаров;
- страниц сортировки;
- URL с параметрами;
- служебных разделов;
- личных кабинетов пользователей.
💡 Мнение эксперта SEO-Pulse
Robots.txt не должен использоваться как средство «скрыть всё лишнее». Его задача — оптимизировать обход сайта. Перед добавлением каждой директивы задайте себе вопрос: действительно ли эта страница не должна расходовать краулинговый бюджет?
Промежуточный вывод
Грамотное использование специальных символов, понимание особенностей обработки robots.txt разными поисковыми системами и регулярная проверка файла позволяют избежать большинства технических ошибок и эффективнее управлять обходом сайта.
Robots.txt для популярных CMS
Большинство современных CMS автоматически создают файл robots.txt или позволяют легко управлять им. Однако стандартные настройки не всегда соответствуют требованиям SEO, поэтому после запуска сайта рекомендуется провести аудит содержимого файла.
Robots.txt для WordPress
WordPress по умолчанию не требует сложной конфигурации robots.txt, однако многие SEO-плагины позволяют автоматически формировать оптимальный файл.
Базовый пример
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap.xml
Почему именно так?
- закрывается административная часть сайта;
- разрешается AJAX, необходимый для корректной работы некоторых функций;
- указывается XML Sitemap.
💡 Совет SEO-Pulse
Не закрывайте каталог /wp-content/uploads/. Именно там находятся изображения, которые должны индексироваться Google Images.
Robots.txt для 1С-Битрикс
На проектах, работающих на 1С-Битрикс, robots.txt часто содержит дополнительные технические каталоги.
User-agent: *
Disallow: /bitrix/
Disallow: /search/
Disallow: /personal/
Sitemap: https://example.com/sitemap.xml
Рекомендуется проверить
- не закрыты ли каталоги товаров;
- не запрещены ли страницы категорий;
- не блокируются ли CSS и JavaScript.
Robots.txt для OpenCart
Интернет-магазины на OpenCart часто сталкиваются с большим количеством страниц фильтрации и сортировки.
Пример:
User-agent: *
Disallow: /*?sort=
Disallow: /*?order=
Disallow: /*?limit=
Disallow: /*?route=product/search
Sitemap: https://example.com/sitemap.xml
Что это даёт
- уменьшается количество дублирующихся URL;
- экономится Crawl Budget;
- ускоряется обход основных страниц каталога.
Robots.txt для Shopify
Shopify автоматически формирует robots.txt. Владельцы магазинов могут вносить изменения только в рамках возможностей платформы.
Перед изменением правил рекомендуется убедиться, что ограничения действительно необходимы, поскольку избыточные запреты могут негативно сказаться на индексации товаров и коллекций.
Robots.txt для Joomla
Стандартный robots.txt Joomla уже содержит большинство необходимых исключений.
После установки рекомендуется проверить:
- служебные каталоги;
- страницы поиска;
- дубли URL с параметрами.
Robots.txt для Drupal
Drupal также поставляется с готовым robots.txt, однако при использовании дополнительных модулей желательно пересмотреть стандартные правила.
Особое внимание стоит уделить:
- страницам фильтрации;
- служебным URL;
- поиску по сайту.
Нужно ли закрывать CSS и JavaScript?
Нет. Современные поисковые системы используют рендеринг страниц и должны иметь доступ к CSS, JavaScript и большинству статических ресурсов.
| Ресурс | Рекомендация |
|---|---|
| CSS | ✅ Открыть |
| JavaScript | ✅ Открыть |
| Изображения | ✅ Открыть |
| Шрифты | ✅ Открыть |
⚠ Типичная ошибка
После обновления CMS каталог со статическими файлами случайно закрывается в robots.txt. В результате Google не может корректно отрендерить страницу, что может привести к проблемам с индексацией и оценкой качества контента.
Какие страницы обычно закрывают?
Для большинства сайтов рекомендуется ограничивать обход технических разделов, которые не несут ценности для поиска.
| Раздел | Рекомендуется закрыть |
|---|---|
| Административная панель | ✅ |
| Личный кабинет | ✅ |
| Корзина | ✅ |
| Оформление заказа | ✅ |
| Страницы поиска | ✅ |
| Фильтры и сортировки | При необходимости |
| Категории товаров | ❌ |
| Карточки товаров | ❌ |
| Статьи блога | ❌ |
Robots.txt для интернет-магазина
Наиболее распространённая задача — сократить количество бесполезных URL, которые расходуют Crawl Budget.
Чаще всего ограничивают:
- результаты внутреннего поиска;
- страницы фильтрации;
- сортировку;
- параметры URL;
- страницы оформления заказа;
- личный кабинет.
🔍 Проверяем на практике
- Запустите полный краулинг сайта.
- Определите страницы, которые не должны индексироваться.
- Убедитесь, что они действительно закрыты от обхода или индексирования подходящим способом.
- Проверьте, не затронули ли ограничения важные коммерческие страницы.
Лучшие практики использования robots.txt
- ✅ Используйте только необходимые директивы.
- ✅ Добавляйте комментарии для удобства сопровождения.
- ✅ Указывайте XML Sitemap.
- ✅ После изменений проверяйте файл.
- ✅ Не закрывайте CSS и JavaScript.
- ✅ Регулярно проводите технический аудит.
- ✅ Контролируйте отчёты Google Search Console.
💡 Мнение эксперта SEO-Pulse
Хороший robots.txt — это не самый длинный файл, а самый понятный и аккуратный. Чем меньше лишних правил, тем проще сопровождать сайт и тем ниже вероятность случайно ограничить обход важных страниц.
Промежуточный вывод
Для большинства современных сайтов robots.txt должен быть максимально простым: ограничивать обход технических разделов, помогать экономить Crawl Budget и не препятствовать корректному рендерингу страниц поисковыми системами.
Как провести аудит robots.txt
Даже если файл robots.txt существует уже несколько лет и ранее не вызывал проблем, его необходимо регулярно проверять. После обновления CMS, смены шаблона, внедрения новых модулей или миграции сайта правила могут измениться без ведома владельца.
Комплексный аудит позволяет убедиться, что файл не мешает поисковым системам корректно обходить и индексировать сайт.
Чек-лист проверки robots.txt
- ✅ Файл доступен по адресу
/robots.txt. - ✅ Сервер возвращает HTTP-статус 200.
- ✅ Используется кодировка UTF-8 без BOM.
- ✅ Указан актуальный XML Sitemap.
- ✅ Нет случайного правила
Disallow: /. - ✅ Не закрыты CSS, JavaScript и изображения.
- ✅ Не запрещены страницы категорий и товаров.
- ✅ Закрыты административные разделы.
- ✅ Закрыты страницы оформления заказа.
- ✅ Закрыты личные кабинеты пользователей.
- ✅ Ограничены страницы внутреннего поиска.
- ✅ Проверены URL с параметрами.
- ✅ Отсутствуют устаревшие правила.
- ✅ Используются комментарии для сложных настроек.
- ✅ После изменений проведена повторная проверка.
- ✅ Проверены отчёты Google Search Console.
- ✅ Проверена статистика обхода.
- ✅ robots.txt соответствует текущей структуре сайта.
- ✅ Проверены правила для всех поисковых систем.
- ✅ Файл входит в регламент технического аудита.
20 распространённых ошибок при настройке robots.txt
| Ошибка | Возможные последствия |
|---|---|
| Disallow: / | Полная блокировка обхода сайта. |
| Отсутствует robots.txt | Поисковые системы обходят все доступные URL. |
| Нет Sitemap | Замедляется обнаружение новых страниц. |
| Закрыты CSS | Ошибки рендеринга. |
| Закрыт JavaScript | Некорректная обработка SPA и динамического контента. |
| Закрыты изображения | Потеря трафика из поиска по изображениям. |
| Запрещены страницы категорий | Снижение органического трафика. |
| Закрыты карточки товаров | Выпадение коммерческих страниц из обхода. |
| Ошибочное использование * | Блокировка нужных URL. |
| Некорректное использование $ | Правила работают не так, как ожидалось. |
| Отсутствуют комментарии | Сложности при сопровождении. |
| Дублирующиеся правила | Запутанная логика файла. |
| Устаревшие каталоги | Файл становится неактуальным. |
| Неверный путь к Sitemap | Карта сайта не обнаруживается. |
| Использование robots.txt вместо noindex | Страницы могут оставаться в индексе. |
| Игнорирование Crawl Budget | Робот тратит ресурсы на технические URL. |
| Отсутствие проверки после релиза | Ошибки остаются незамеченными. |
| Редактирование без резервной копии | Риск потери рабочей конфигурации. |
| Не проверены правила для разных User-agent | Некоторые роботы получают неверные инструкции. |
| Файл не обновлялся годами | Настройки не соответствуют текущей архитектуре сайта. |
💡 Практика SEO-Pulse
Во время технических аудитов мы регулярно обнаруживаем проекты, где robots.txt годами копируется между сайтами без проверки. В результате в файле остаются ссылки на несуществующие карты сайта, старые каталоги или правила, актуальные только для предыдущей версии CMS. Поэтому robots.txt обязательно проверяется при каждом комплексном SEO-аудите и после крупных обновлений сайта.
Когда robots.txt действительно помогает SEO
Наибольшую пользу файл приносит в следующих случаях:
- крупные интернет-магазины с тысячами товаров;
- маркетплейсы;
- новостные порталы;
- SaaS-платформы;
- форумы;
- сайты с большим количеством фильтров и параметров URL;
- проекты с ограниченным Crawl Budget.
Для небольших корпоративных сайтов robots.txt остаётся важным техническим элементом, но его влияние на эффективность обхода обычно менее заметно.
Итоги
Robots.txt — это инструмент управления обходом сайта, который помогает поисковым системам эффективнее распределять ресурсы при сканировании. Он не заменяет директивы индексации, но позволяет исключить из обхода технические разделы, сократить расход Crawl Budget и упростить обнаружение важных страниц.
Правильно настроенный robots.txt должен быть простым, понятным и соответствовать текущей структуре проекта. Любые изменения рекомендуется проверять с помощью Google Search Console и технического краулера, чтобы исключить случайную блокировку важных разделов сайта.
💼 Услуги SEO-Pulse
Если вы хотите убедиться, что robots.txt, индексация и другие технические настройки сайта работают корректно, специалисты SEO-Pulse помогут провести комплексный аудит и подготовят рекомендации по устранению ошибок.
📚 Похожие статьи
- International SEO: полное руководство
- XML Sitemap для мультиязычных сайтов
- Canonical для мультиязычных сайтов
- 25 ошибок International SEO
- Meta Robots и X-Robots-Tag: полное руководство (готовится)