FIKSU LAB / система в разработке Клиенты из поиска. Без SEO-магии.
Сайт

Robots.txt и Sitemap: как объяснить поиску, что обходить

Два служебных файла, которые незаметны на сайте, но напрямую влияют на то, что и как часто поиск обходит. Что в них писать и каких ошибок избегать.

Коротко

Robots.txt — служебный файл с правилами для поисковых роботов, sitemap — список страниц, которые вы хотите показать поиску. Оба файла человек на сайте не видит, но они решают, попадёт ваша услуга в поиск или нет.

  • Robots.txt лежит в корне сайта по адресу /robots.txt, и робот читает его первым.
  • Sitemap помогает найти новые страницы, на которые ещё нет ссылок на сайте.
  • Одна неверная строка в robots.txt способна закрыть от поиска весь сайт — проверяйте файл после любых правок.

Есть два типа сайтов. У одних страницы появляются в Яндексе через день-два после публикации. У других новая страница «висит» в поиске месяцами или не появляется вообще, и владелец уверен, что дело в текстах. А причина часто в служебном файле на несколько строк, о котором никто не помнит.

В нашем семантическом разборе «sitemap» — примерно 4 300 запросов в месяц, «robots.txt» — около 2 600. Интерес есть, но объяснений по-человечески мало, поэтому разберём оба файла по порядку.

Что такое robots.txt

Это обычный текстовый файл, который вы кладёте в корень сайта. Робот поиска приходит на сайт, первым делом запрашивает /robots.txt и действует по тому, что там написано: что можно обходить, что нельзя, где лежит карта сайта.

Работает это простыми правилами из двух строк:

  • User-agent — к кому обращено правило. Обычно указывают всех сразу.
  • Disallow — что закрываем. Например, служебные разделы админки или страницы с параметрами, которые плодят дубли.
  • Sitemap — прямая ссылка на карту сайта, чтобы робот её нашёл.

И главное правило: robots.txt предназначен для управления обходом, а не для «выброса из поиска». Если закрыть страницу в robots.txt, робот её не посетит — а значит, не увидит и метку «не индексировать», если она там есть. Убрать страницу из выдачи надёжнее другими способами, а не запретом обхода.

Что такое sitemap

Sitemap (карта сайта) — файл со списком адресов ваших страниц. Если robots.txt говорит «куда не ходить», то карта сайта говорит «вот сюда точно стоит зайти». Полезнее всего она для сайтов, где страницы плохо связаны ссылками: интернет-магазины, каталоги услуг, сайты с постоянно добавляемыми материалами.

Технически это отдельный файл, который поиск умеет читать. В большинстве современных систем управления сайтом карта собирается автоматически и обновляется сама — вам остаётся проверить, что она существует и указана в robots.txt. В Яндекс Вебмастере карту можно добавить вручную: как устроен этот инструмент, разбирали в статье «Зачем подключать сайт к Яндекс Вебмастеру».

Ключевой вывод

Robots.txt и карта сайта — не «SEO-настройка для продвинутых», а базовые вещи вроде вывески на входе. Настроить их один раз занимает час, а забыть о них — значит годами терять страницы, которых не видит поиск.

Пять ошибок, которые закрывают сайт от поиска

  1. Запрет всего сайта. Так бывает при переносе: файл тестового сайта залили на рабочий, а там строка «закрыть всех». Сайт живёт, люди по прямым ссылкам заходят, а в поиске его просто нет.
  2. Запрет всего, кроме главной. Похожий случай: закрыли все разделы, а главную оставили. В поиске одна страница, услуги и статьи не находятся.
  3. Запрет служебных папок вроде стилей и скриптов. Бывает из желания «не грузить робота лишним». В итоге робот не может оценить, как выглядит страница, и это мешает понять её структуру. Такие файлы закрывать не нужно.
  4. Ссылка на карту сайта ведёт на старое или пустое место. Адрес остался от прежней версии сайта, файла по нему нет. Робот идёт в пустоту, а новые страницы ждут обхода дольше.
  5. Параметры в адресах не закрыты. Фильтры, сортировки и метки создают сотни похожих друг на друга адресов. Поиску понятнее, когда такое многообразие закрыто правилом, а не когда он сам разбирается с ним неделями.

Как проверить, что всё работает

Проверка занимает несколько минут и не требует специальных знаний.

  1. Откройте файл по адресу /robots.txt. Допишите к адресу сайта /robots.txt — файл должен открываться как обычный текст. Если видите ошибку, правила для роботов не читаются вообще, а значит, действуют как настроено по умолчанию.
  2. Найдите строку с адресом карты сайта. Откройте эту ссылку: должен открыться список ваших страниц, в котором есть и свежие.
  3. Проверьте файл через Вебмастер. Там есть встроенная проверка robots.txt: она показывает, какие разделы закрыты, и позволяет посмотреть файл глазами робота — включая ваши комментарии и ошибки, которые сервис заметит.
  4. Посмотрите, сколько страниц в поиске. Если у вас тридцать страниц, а в поиске три — это повод лезть в служебные файлы, а не в тексты.

FIKSU / наблюдение

Служебные файлы меняют один раз и забывают о них на годы. Поэтому перед публикацией новой страницы полезно не искать сложные причины, а за минуту проверить, что сайт вообще открыт для поиска.

Что делать прямо сейчас

Если сайт новый или вы не помните, что там с robots.txt: откройте файл, убедитесь, что весь сайт не закрыт, что адрес карты сайта рабочий и что карта содержит актуальные страницы. Для сайта из пары десятков страниц это исчерпывающая проверка.

Дальше имеет смысл навести порядок в структуре: чтобы поиск понимал, что где лежит, разделы и страницы должны быть связаны между собой логично. Об этом — статьи «Структура сайта» и «Перелинковка сайта». А если при проверке выяснится, что часть страниц уже отдаёт ошибку вместо ответа, действуйте по инструкции из статьи «Ошибка 404».

Частые вопросы

Обязательно ли вообще иметь robots.txt?

Технически нет: если файла нет, робот обходит сайт без ограничений. Но тогда он лезет и в служебные разделы, и в адреса с параметрами. Базовый файл из пары правил и ссылкой на карту сайта — минутная работа, которая снимает эти вопросы.

Надо ли закрывать от поиска админку?

Да, это разумно: служебные адреса не должны появляться в выдаче. Но помните: закрытие обхода — не защита от взлома. Доступ к админке защищают паролем и дополнительным подтверждением входа, а не файлом для роботов.

Я поправил robots.txt — когда изменения подействуют?

Сразу для новых обходов, но не мгновенно для всех страниц: робот заходит к вам не по расписанию, которое вы задаёте. Закрытые по ошибке страницы вернутся в поиск постепенно. В Вебмастере можно попросить переобход конкретных адресов — это ускоряет процесс.

Карта сайта — это то же самое, что меню сайта?

Нет. Меню — для людей, оно показывает основные разделы. Карта сайта — служебный список адресов для робота, и он умеет включать страницы, которых в меню нет. Полезно и то, что карта служит простым ориентиром: если страницы нет в карте, возможно, на неё нигде нет ссылок — и её не найдут ни люди, ни поиск.

Редакция FIKSU

Пишем о том, как небольшие компании получают клиентов из поиска. Проверяем всё, о чём рассказываем, на реальных сайтах.

Что дальше

Если материал был полезен, посмотрите другие разборы в направлении «Сайт» — они устроены так же: без жаргона и с понятными шагами.

Читать дальше →
Все статьи →
Сайт 7 мин

Индексация сайта: почему страниц нет в поиске

Сайт открывается, услуги на месте, а в поиске его нет. Разбираем, как устроена индексация, что мешает страницам попасть в выдачу и как проверить каждую причину по очереди.

Сайт 7 мин

Title и description: что писать, чтобы кликали из выдачи

Заголовок и описание страницы поиск почти всегда показывает в сниппете — и по ним решают, переходить или нет. Разбираем, что убрать из title, как писать description и почему красивая формулировка не спасёт клики.

Сайт 7 мин

Google Search Console: что смотреть владельцу сайта

Бесплатный инструмент Google, который показывает, по каким запросам сайт находят, какие страницы попали в индекс и на что жалуется поисковый робот. Подключение занимает несколько минут, а польза появляется с первого отчёта.