Что такое индексирование сайта? Как оно происходит? На эти и другие вопросы вы можете найти ответы в статье. Веб-индексированием (индексированием в поисковых системах) называют процесс приобщения информации о сайте к базе данных роботом поисковой машины, которая впоследствии используется для розыска сведений на веб-проектах, прошедших такую процедуру.
Данные о веб-ресурсах чаще всего состоят из ключевых слов, статей, ссылок, документов. Индексироваться также могут аудио, изображения и так далее. Известно, что алгоритм выявления ключевых слов зависим от поискового устройства.
На типы индексируемой информации (flash файлы, javascript) существует некоторая лимитация.
Управление приобщением
Индексирование сайта – сложный процесс. Чтобы им управлять (к примеру, запрещать приобщение той или иной страницы), нужно использовать файл robots.txt и такие предписания, как Allow, Disallow, Crawl-delay, User-agent и другие.
Также для ведения индексации применяют теги <noindex> и реквизит <nofollow>, скрывающие содержимое ресурса от роботов Google и «Яндекса» (Yahoo применяет тег <nofollow>).
В поисковой системе Goglle новые сайты индексируются от пары дней до одной недели, а в Яндексе – от одной недели до четырёх.
Вы желаете, чтобы ваш сайт показывался в запросах результатов поисковиков? Тогда он должен быть обработан «Рамблером», «Яндексом», Google, Yahoo и так далее. Вы должны сообщить поисковым машинам (паукам, системам) о существовании вашего веб-узла, и тогда они просканируют его полностью или частично.
Многие сайты не индексируются годами. Информацию, которая на них находится, не видит никто, кроме их владельцев.
Способы обработки
Индексирование сайта может выполняться несколькими способами:
- Первым вариантом является ручное добавление. Вам нужно ввести данные своего сайта через особые формы, предлагаемые поисковиками.
- Во втором случае робот поисковой машины сам находит ваш веб-узел по ссылкам и индексирует его. Он может разыскать ваш сайт по ссылкам с других ресурсов, которые ведут на ваш проект. Этот способ наиболее эффективен. Если поисковик нашёл сайт таким образом, он считает его значительным.
Сроки
Индексирование сайта происходит не слишком быстро. Сроки разные, от 1-2 недель. Ссылки с авторитетных ресурсов (с великолепным PR и Тиц) значительно ускоряют размещение сайта в базе поисковиков. Сегодня самым медленным считается Google, хотя до 2012 года он мог выполнять эту работу за неделю. К сожалению, всё очень быстро меняется. Известно, что Mail.ru работает с веб-узлами в этой области около полугода.
Индексирование сайта в поисковиках осуществить способен не каждый специалист. На сроки добавления в базу новых страниц уже обработанного поисковиками сайта влияет частота корректировки его контента. Если на ресурсе постоянно появляется свежая информация, система считает его часто обновляемым и полезным для людей. В этом случае её работа ускоряется.
За ходом индексации веб-узла можно следить на особых разделах для веб-мастеров или на поисковиках.
Изменения
Итак, мы уже разобрались, как происходит индексирование сайта. Необходимо отметить, что базы данных поисковиков часто обновляются. Поэтому количество добавленных в них страниц вашего проекта может меняться (как уменьшаться, так и увеличиваться) по следующим причинам:
- санкции поисковика к веб-узлу;
- наличие погрешностей на сайте;
- изменение алгоритмов поисковиков;
- отвратительный хостинг (недосягаемость сервера, на котором находится проект) и так далее.
Ответы «Яндекса» на обычные вопросы
«Яндекс» - поисковая система, которой пользуются многие пользователи. Она занимает пятое место среди розыскных систем мира по числу обработанных исследовательских запросов. Если вы в неё добавили сайт, он может слишком долго добавляться в базу.
Добавление URL не гарантирует его индексацию. Это лишь один из методов, с помощью которого сообщают роботу системы о том, что появился новый ресурс. Если на сайт отсутствуют ссылки с других веб-узлов или их немного, добавление поможет его быстрее обнаружить.
Если индексация не произошла, нужно проверить, не было ли на сервере сбоев в момент создания ему заявки от робота «Яндекса». Если сервер сообщает об ошибке, робот завершит свою работу и попытается её выполнить в порядке всестороннего обхода. Работники «Яндекса» не могут увеличить скорость добавления страниц в базу поисковика.
Индексирование сайта в «Яндексе» - довольно-таки сложное занятие. Вы не знаете как добавить ресурс в поисковую систему? Если на него имеются ссылки с других веб-узлов, то добавлять специально сайт не требуется – робот его автоматически разыщет и проиндексирует. Если у вас нет таких ссылок, можно использовать форму «Добавить URL», чтобы заявить поисковику о существовании веб-узла.
Необходимо помнить, что добавление URL не гарантирует индексацию вашего творения (или её скорость).
Многим интересно, сколько времени занимает индексирование сайта в «Яндексе». Сотрудники этой компании не дают гарантий и не прогнозируют сроки. Как правило, с тех пор, как робот узнал о сайте, страницы его в поиске появляются через два дня, иногда – через пару недель.
Процесс обработки
«Яндекс» - поисковая система, требующая точности и внимания. Индексация сайта состоит из трёх частей:
- Поисковый робот выполняет обход страниц ресурса.
- Содержимое (контент) сайта записывается в базу данных (индекс) розыскной системы.
- Через 2-4 недели, после обновления базы, можно увидеть результаты. Ваш сайт появится (или не появится) в поисковой выдаче.
Проверка индексации
Как проверить индексацию сайта? Выполнить это можно тремя способами:
- Введите наименование своего предприятия в строке поиска (к примеру, «Яндекса») и проверьте каждую ссылку на первой и второй странице. Если вы обнаружите там URL своего детища, значит, робот свою задачу выполнил.
- Можно ввести URL своего сайта в розыскной строке. Вы сможете увидеть, сколько интернет-листов показывается, то есть проиндексировано.
- Зарегистрируйтесь на страницах веб-мастеров в Mail.ru, «Гугле», «Яндексе». После того как вы пройдёте верификацию сайта, вы сможете увидеть и итоги индексации, и иные сервисы поисковиков, созданные для улучшения работы вашего ресурса.
Почему «Яндекс» отказывает?
Индексирование сайта в Google осуществляется следующим образом: робот в базу данных заносит все страницы сайта, некачественные и качественные, не выбирая. Но в ранжировании участвуют лишь полезные документы. А «Яндекс» весь веб-хлам исключает сразу же. Он может проиндексировать любую страницу, но поисковик со временем ликвидирует весь мусор.
У обеих систем имеется добавочный индекс. И у той, и у другой страницы низкого качества влияют на рейтинг веб-узла в целом. Здесь работает простая философия. Излюбленные ресурсы конкретного пользователя будут занимать более высокие позиции в его выдаче. Зато этот же индивидуум с трудом отыщет сайт, который ему в прошлый раз не понравился.
Именно поэтому сперва необходимо от индексации прикрыть копии веб-документов, проинспектировать наличие пустых страниц и не пускать в выдачу некачественный контент.
Ускорение работы «Яндекса»
Как можно ускорить индексирование сайта в «Яндексе»? Необходимо выполнить следующие шаги:
- Установить на компьютер браузер «Яндекса» и побродить с помощью него по страницам сайта.
- Подтвердить права на управление ресурсом в «Яндекс.Вебмастере».
- В Twitter опубликовать ссылку на статью. Известно, что с 2012 года «Яндекс» сотрудничает с этой компанией.
- Для сайта добавить поиск от Yandex. В разделе «Индексация» можно указать собственные URL-адреса.
- Ввести код «Яндекс.Метрики», не указывая галочку «Отправка страниц на индексацию запрещена».
- Изготовить файл Sitemap, который существует только для робота и не виден аудитории. Проверка будет начинаться именно с него. Адрес Sitemap вводится в robots.txt или в подходящую форму в «Вебмастере» - «Настройка индексации»-«Файлы Sitemap».
Промежуточные действия
Что необходимо выполнить, пока веб-страница «Яндексом» не проиндексирована? Отечественный поисковик должен считать сайт первоисточником. Именно поэтому ещё до публикации статьи обязательно необходимо добавить её содержание в форму «Специфичных текстов». В противном случае плагиаторы скопируют запись на свой ресурс и окажутся в базе данных первыми. В итоге признаны авторами будут они.
База данных Google
Для Google подойдут те же рекомендации, о которых мы рассказали выше, только сервисы будут иными:
- Google+ (взамен Twitter);
- Google Chrome;
- Google-приспособления для программистов – «Сканирование» - «Взглянуть как Googlebot» - опция «Сканировать» - опция «Добавить в индекс»;
- поиск внутри ресурса от «Гугла»;
- Google Analytics (взамен «Яндекс.Метрики).
Запрещение
Что собой представляет запрет индексирования сайта? Вы можете наложить его как на всю страницу, так и на отдельную её часть (ссылку или кусок текста). Фактически существует как глобальный запрет индексации, так и локальный. Как это реализуется?
Рассмотрим запрет добавления в базу поисковика веб-узла в Robots.txt. С помощью файла robots.txt можно исключить индексацию одной страницы или целой рубрики ресурса так:
- User-agent: *
- Disallow: /kolobok.html
- Disallow: /foto/
Первый пункт говорит о том, что инструкции определены для всех ПС, второй указывает на запрет индексации файла kolobok.html, а третий - не разрешает добавление в базу всей начинки папки foto. Если нужно исключить несколько страниц или папок, укажите их все в «Роботсе».
Для того чтобы воспрепятствовать индексации отдельного интернет-листа, можно применить мета-тег robots. Он отличается от robots.txt тем, что даёт указания сразу всем ПС. Этот мета-тег подчиняется общим принципам формата html. Его нужно размещать в заголовке страницы между тегами <head><head>. Запись для запрета, к примеру, может быть написана так: <meta name=”robots” content=”noindex, nofollow”>.
Ajax
А как проводит индексирование Ajax-сайтов Yandex? Сегодня технологией Ajax пользуются многие разработчики веб-узлов. Конечно, у неё есть большие возможности. С помощью неё можно создавать быстродействующие и производительные интерактивные веб-страницы.
Однако робот поисковой системы веб-лист «видит» не так, как пользователь и браузер. К примеру, человек смотрит на комфортный интерфейс с подвижно подгружаемыми интернет-листами. Для поискового робота содержимое той же страницы может быть порожним или представленным как остальной статический HTML-контент, для генерации которого скрипты не идут в дело.
Для создания Ajax-сайтов можно применять URL с #, но его робот-поисковик не использует. Обычно часть URL после # отделяется. Это нужно учитывать. Поэтому взамен URL вида http://site.ru/#example он делает заявку главной странице ресурса, размещённой по адресу http://site.ru. Это значит, что контент интернет-листа может не попасть в базу данных. В итоге он не окажется в результатах поиска.
Для усовершенствования индексации Ajax-сайтов «Яндекс» поддержал изменения в поисковом роботе и правилах обработки URL таких веб-узлов. Сегодня веб-мастера могут указать поисковику «Яндекса» на необходимость индексации, создав соответствующую схему в структуре ресурса. Для этого необходимо:
- Заменить в URL страниц символ # на #!. Теперь робот поймёт, что он сможет обратиться за HTML-версией наполнения этого интернет-листа.
- HTML-версия контента такой страницы должна быть размещена на URL, где #! заменён на ?_escaped_fragment_=.