Рассмотрим подробнее понятие поискового запроса на примере поисковой системы «Яндекс». Поисковый запрос должен быть сформулирован пользователем в соответствии с тем, что он хочет найти, максимально кратко и просто. Допустим, мы хотим найти информацию в «Яндексе» о том, как выбрать автомобиль. Для этого, открываем главную страницу «Яндекса», и вводим текст поискового запроса «как выбрать автомобиль». Далее, наша задача сводится к тому, чтобы открыть предоставленные по нашему запросу ссылки на источники информации в Интернет. Однако, вполне можно и не найти нужную нам информацию. Если таковое произошло, то либо нужно перефразировать свой запрос, либо в базе поисковой системе действительно нет никакой актуальной информации по нашему запросу (такое может быть при задании очень «узких» запросов, как, например «как выбрать автомобиль в Архангельске»)

Первоочередная задача любой поисковой системы – доставлять людям именно ту информацию, которую они ищут. А научить пользователей делать «правильные» запросы к системе, т.е. запросы, соответствующие принципам работы поисковых систем, невозможно. Поэтому разработчики создают такие алгоритмы и принципы работы поисковых систем, которые бы позволяли находить пользователям искомую ими информацию.

Это означает, поисковая система должна «думать» так же, как думает пользователь при поиске информации. Когда пользователь обращается с запросом к поисковой машине, он хочет найти то, что ему нужно, максимально быстро и просто. Получая результат, он оценивает работу системы, руководствуясь несколькими основными параметрами. Нашел ли он то, что искал? Если не нашел, то сколько раз ему пришлось перефразировать запрос, чтобы найти искомое? Насколько актуальную информацию он смог найти? Насколько быстро обрабатывала запрос поисковая машина? Насколько удобно были представлены результаты поиска? Был ли искомый результат первым или же сотым? Как много ненужного мусора было найдено наравне с полезной информацией? Найдется ли нужная информация, при обращении к поисковой системе, скажем, через неделю, или через месяц?

Для того, чтобы удовлетворить ответами все эти вопросы, разработчики поисковых машин постоянно совершенствуют алгоритмы и принципы поиска, добавляют новые функции и возможности, всячески пытаются ускорить работу системы.

3. Основные характеристики поисковой системы

Опишем основные характеристики поисковых систем:

  • Полнота

    Полнота - одна из основных характеристик поисковой системы, представляющая собой отношение количества найденных по запросу документов к общему числу документов в сети Интернет, удовлетворяющих данному запросу. К примеру, если в Интернете имеется 100 страниц, содержащих словосочетание «как выбрать автомобиль», а по соответствующему запросу было найдено всего 60 из них, то полнота поиска будет 0,6. Очевидно, что чем полнее поиск, тем меньше вероятность того, что пользователь не найдет нужный ему документ, при условии, что он вообще существует в Интернете.

  • Точность

    Точность - еще одна основная характеристика поисковой машины, которая определяется степенью соответствия найденных документов запросу пользователя. Например, если по запросу «как выбрать автомобиль» находится 100 документов, в 50 из них содержится словосочетание «как выбрать автомобиль», а в остальных просто наличествуют эти слова («как правильно выбрать магнитолу и установить в автомобиль»), то точность поиска считается равной 50/100 (=0,5). Чем точнее поиск, тем быстрее пользователь найдет нужные ему документы, тем меньше различного рода «мусора» среди них будет встречаться, тем реже найденные документы не будут соответствовать запросу.

  • Актуальность

    Актуальность - не менее важная составляющая поиска, которая характеризуется временем, проходящим с момента публикации документов в сети Интернет, до занесения их в индексную базу поисковой системы. Например, на следующий день после появления интересной новости, большое количество пользователей обратились к поисковым системам с соответствующими запросами. Объективно с момента публикации новостной информации на эту тему прошло меньше суток, однако основные документы уже были проиндексированы и доступны для поиска, благодаря существованию у крупных поисковых систем так называемой «быстрой базы», которая обновляется несколько раз в день.

  • Скорость поиска

    Скорость поиска тесно связана с его устойчивостью к нагрузкам. Например, по данным ООО «Рамблер Интернет Холдинг», на сегодняшний день в рабочие часы к поисковой машине Рамблер приходит около 60 запросов в секунду. Такая загруженность требует сокращения времени обработки отдельного запроса. Здесь интересы пользователя и поисковой системы совпадают: посетитель желает получить результаты как можно быстрее, а поисковая машина должна отрабатывать запрос максимально оперативно, чтобы не тормозить вычисление следующих запросов.

  • Наглядность

4. Краткая история развития поисковых систем

В начальный период развития Интернет, число его пользователей было невелико, а объем доступной информации сравнительно небольшим. В большинстве своем, доступ к сети Интернет имели лишь сотрудники научно-исследовательской сферы. В это время задача поиска информации в Интернете не была столь актуальной, как в настоящее время.

Одним из первых способов организации доступа к информационным ресурсам сети стало создание открытых каталогов сайтов, ссылки на ресурсы в которых группировались согласно тематике. Первым таким проектом стал сайт Yahoo.com, открывшийся весной 1994 года. После того, как количество сайтов в каталоге значительно увеличилось, была добавлена возможность поиска нужной информации по каталогу. В полном смысле это еще не было поисковой системой, так как поисковая область была ограничена только ресурсами, присутствующими в каталоге, а не всеми Интернет ресурсами.

Каталоги ссылок широко использовались ранее, однако практически полностью утратили свою популярность в настоящее время. Так как даже современные, огромные по своему объему каталоги, содержат информацию лишь о ничтожно малой части сети Интернет. Самый большой каталог сети DMOZ (его еще называют Open Directory Project) содержит информацию о 5 миллионах ресурсов, тогда как база поисковой системы Google состоит из более чем 8 миллиардов документов.

В 1995 году появились поисковые системы Lycos и AltaVista. Последняя долгие годы была лидером в области поиска информации в сети Интернет.

В 1997 году Сергей Брин и Ларри Пейдж создали поисковую машину Google в рамках исследовательского проекта в Стэндфордском университете. В настоящий момент Google - самая популярная поисковая система в мире!

В сентябре 1997 года была официально анонсирована поисковая система Yandex, являющаяся самой популярной в русскоязычном Интернете.

В настоящее время существуют три основные поисковые системы (международные) – Google, Yahoo и , имеющие собственные базы и алгоритмы поиска. Большинство остальных поисковых систем (коих насчитывается большое количество) использует в том или ином виде результаты трех перечисленных. Например, поиск AOL (search.aol.com) использует базу Google, а AltaVista, Lycos и AllTheWeb – базу Yahoo.

5. Состав и принципы работы поисковой системы

В России основной поисковой системой является «Яндекс», далее - Rambler.ru, Google.ru, Aport.ru, Mail.ru. Причем, на данный момент, Mail.ru использует механизм и базу поиска «Яндекса».

Практически все крупные поисковые системы имеют свою собственную структуру, отличную от других. Однако можно выделить общие для всех поисковых машин основные компоненты. Различия в структуре могут быть лишь в виде реализации механизмов взаимодействия этих компонентов.

Модуль индексирования

Модуль индексирования состоит из трех вспомогательных программ (роботов):

Spider (паук) – программа, предназначенная для скачивания веб-страниц. «Паук» обеспечивает скачивание страницы и извлекает все внутренние ссылки с этой страницы. Скачивается html-код каждой страницы. Для скачивания страниц роботы используют протоколы HTTP. Работает «паук» следующим образом. Робот на сервер передает запрос “get/path/document” и некоторые другие команды HTTP-запроса. В ответ робот получает текстовый поток, содержащий служебную информацию и непосредственно сам документ.

  • URL страницы
  • дата, когда страница была скачана
  • http-заголовок ответа сервера
  • тело страницы (html-код)

Crawler («путешествующий» паук) – программа, которая автоматически проходит по всем ссылкам, найденным на странице. Выделяет все ссылки, присутствующие на странице. Его задача - определить, куда дальше должен идти паук, основываясь на ссылках или исходя из заранее заданного списка адресов. Crawler, следуя по найденным ссылкам, осуществляет поиск новых документов, еще неизвестных поисковой системе.

Indexer (робот- индексатор) - программа, которая анализирует веб-страницы, скаченные пауками. Индексатор разбирает страницу на составные части и анализирует их, применяя собственные лексические и морфологические алгоритмы. Анализу подвергаются различные элементы страницы, такие как текст, заголовки, ссылки структурные и стилевые особенности, специальные служебные html-теги и т.д.

Таким образом, модуль индексирования позволяет обходить по ссылкам заданное множество ресурсов, скачивать встречающиеся страницы, извлекать ссылки на новые страницы из получаемых документов и производить полный анализ этих документов.

База данных

База данных, или индекс поисковой системы - это система хранения данных, информационный массив, в котором хранятся специальным образом преобразованные параметры всех скачанных и обработанных модулем индексирования документов.

Поисковый сервер

Поисковый сервер является важнейшим элементом всей системы, так как от алгоритмов, которые лежат в основе ее функционирования, напрямую зависит качество и скорость поиска.

Поисковый сервер работает следующим образом:

  • Полученный от пользователя запрос подвергается морфологическому анализу. Генерируется информационное окружение каждого документа, содержащегося в базе (которое и будет впоследствии отображено в виде , то есть соответствующей запросу текстовой информации на странице выдачи результатов поиска).
  • Полученные данные передаются в качестве входных параметров специальному модулю ранжирования. Происходит обработка данных по всем документам, в результате чего, для каждого документа рассчитывается собственный рейтинг, характеризующий релевантность запроса, введенного пользователем, и различных составляющих этого документа, хранящихся в индексе поисковой системы.
  • В зависимости от выбора пользователя этот рейтинг может быть скорректирован дополнительными условиями (например, так называемый «расширенный поиск»).
  • Далее генерируется сниппет, то есть, для каждого найденного документа из таблицы документов извлекаются заголовок, краткая аннотация, наиболее соответствующая запросу и ссылка на сам документ, причем найденные слова подсвечиваются.
  • Полученные результаты поиска передаются пользователю в виде SERP (Search Engine Result Page) – страницы выдачи поисковых результатов.

Как видно, все эти компоненты тесно связаны друг с другом и работают во взаимодействии, образовывая четкий, достаточно сложный механизм работы поисковой системы, требующий огромных затрат ресурсов.

6. Заключение

Теперь подытожим все вышесказанное.

  • Первоочередная задача любой поисковой системы – доставлять людям именно ту информацию, которую они ищут.
  • Основные характеристики поисковых систем:
    1. Полнота
    2. Точность
    3. Актуальность
    4. Скорость поиска
    5. Наглядность
  • Первой полноценной поисковой системой стал проект WebCrawler, вышедший в свет в 1994 году.
  • В состав поисковой системы входят компоненты:
    1. Модуль индексирования
    2. База данных
    3. Поисковый сервер

Надеемся, наш мастер-класс позволит Вам поближе ознакомиться с понятием ПС, лучше узнать основные функции, характеристики и принцип работы поисковых систем.


По материалам сайта: http://www.seonews.ru/

Справочники и поисковые системы глобального масштаба

Все перечисленные системы предназначены для поиска информации в Интернет в целом, без относительно к какому либо региону мира. При необходимости выявления исчерпывающей информации рекомендуется провести последовательный поиск с использованием нескольких поисковых машин или справочников.


About

Справочник, поддерживаемый экспертами различных областей знания. Основная задача - отразить не все, а лишь наиболее ценные ресурсы. Описания сайтов составлены очень квалифицированно. Удобен при необходимости отбора самых качественных ресурсов по конкретной тематике. Основной недостаток - медленное обновление материала.


AlltheWeb

Изначально - поисковая система, расположенная в Европе и ориентированная преимущественно на европейские сайты. С марта 2004 года под брэндом AlltheWeb была размещена и запущена поисковая система Yahoo! и в настоящее время AlltheWeb представляет собой фактическое “зеркало” поисковой системы Yahoo! Serach, с той лишь разницей, что в его модуле выдачи результатов гораздо лучше решены проблемы вывода документов на разных языках, использующих кодировки, отличные от расширенной латиницы. В число 36 языков, с которыми система работает вполне корректно, попал и русский.


Alta Vista

В прошлом одна из наиболее популярных поисковых систем мира. С марта 2004 года под брэндом Alta Vista была размещена и запущена поисковая система Yahoo! и в настоящее время Alta Vista представляет собой фактическое “зеркало” поисковой системы Yahoo! Serach.


Excite

Поисковая система, объем базы данных которой насчитывает более 250 миллионов документов. Имеет развернутую подсистему поиска мультимедийных источников.


Google

Мировой лидер поискового сервиса. Поисковая система последнего поколения, декларирующая самый большой объем базы данных - более 8 миллиардов документов. Обеспечивает интерфейс на языке пользователя, а также возможность разыскания иллюстраций. Google был первой поисковой машиной, начавшей индексацию документов в форматах PDF, PS, DOC, XLS, PPT, RTF, WP5.


HotBot

Поисковая система, объем индекса базы данных которой не превышает 500 миллионов документов. Имеет возможность поиска иллюстраций, аудио и видео файлов. Не допускает выявление документов на русском языке.


LookSmart

Справочник ресурсов, ориентированный на интересы среднестатистического пользователя Интернет.


Lycos

Проект пережил несколько кардинальных преобразований. В 1996 году был начат как поисковая система, в 1999 году Lycos преобразован в справочник ресурсов, но с июля 2002 года, с введением в эксплуатацию поискового механизма Search Lycos 6.0, вновь используется в основном как поисковая система. Допускает поиск иллюстраций, аудио и видеофайлов. Декларируя наибольший объем индексного файла, тем не менее, не указывает его точный объем. С русскоязычными ресурсами работает плохо.


MSN Search

Поисковая система, созданная компанией Microsoft. С февраля 2005 года окончательно перешла на использование собственного поискового модуля. Декларируется учет более 5 миллиардов документов. Система обладает возможностью поиска на новостных сайтах, поиском иллюстраций, поиска в принадлежащей Microsoft энциклопедии Encarta, а также модулем, который, после бесплатной выгрузки и установки, производит поиск на собственном компьютере пользователя.


Open Directory

Справочник ресурсов Интернет, являющийся на сегодня одним из наиболее полных в мире: отражено порядка 4 миллионов ресурсов. Является некоммерческим проектом, формируясь силами Интернет-сообщества. По этой причине множество разделов Open Directory выполнены полностью на национальных языках, включая русский.


Teoma Поисковая система, открытая для использования в начале третьего тысячелетия. Единственным достоинством является внушительный объем индексного файла. Не способна осуществлять поиск документов на русском языке.
Webtop

Поисковая система, декларирующая объем базы данных более 500 миллионов документов. В настоящее время располагает примитивным механизмом составления запроса. Не обладает возможностью поиска документов на русском языке.


WiseNut Поисковая система последнего поколения. Главное достоинство - большое число проиндексированных документов. Не способна осуществлять поиск материалов на русском языке.
Yahoo! Directory

Один из наиболее авторитетных и полных справочников ресурсов Интернет. Имеет внушительный объем (порядка 2 миллионов учтенных ресурсов) и хорошо разветвленную иерархическую структуру. Удобен при разыскании перечней зарубежных, прежде всего англоязычных, сайтов по заданной тематике. Поскольку за отражение ресурса взимается ежегодная плата, многие ценные ресурсы были исключены из Yahoo! Directory и справочник в настоящее время не может претендовать на исчерпывающую полноту.

Поисковая система Yahoo!, выделившаяся в отдельный сервис после преобразования портала в 2004 году. По результатам тестов, включает порядка 4 миллиардов документов. Имеет хорошие возможности поиска иллюстраций и видеофайлов. Допускает поиск на русском языке.

Метапоисковые системы

Метапоисковые системы являются разновидностью поисковых инструментов, не имеющих собственных поисковых роботов и баз данных (индексных файлов). Их главное достоинство заключается в умении рассылать запрос сразу в несколько "реальных" поисковых систем и затем суммировать результаты. Пользование ими рекомендуется в случае разыскания сведений предположительно об очень редком объекте или при крайнем недостатке времени, поскольку метапоисковые средства очень часто не в состоянии корректно обработать запрос для различных поисковых систем, а также правильно совместить результаты, полученные разными системами.


Dogpile

Обращается к различным поисковым средствам последовательно, а не одновременно. Обеспечивает выявление данных в конференциях UseNet и на FTP-серверах, а также поиск иллюстраций, аудио- и видеофайлов.


Ez2find.com

Система обеспечивает релевантный поиск на русском языке. Имеет неплохие возможности для формирования запроса. Поиск производится в Google, AllTheWeb, Altavista, Yahoo, Open Directory. Результаты сортируются по разделам.


Ixquick Metasearch

Система по умолчанию обращается к 14 ведущим поисковым средствам, за исключением Google. В запросе используется традиционный синтаксис, в точности соответствующий используемому в Alta Vista. Перечень поисковых систем, к которым происходит обращение, может быть легко задан пользователем. Обеспечивает также поиск в новостях, разыскание иллюстраций и аудиофайлов.


KartOO

Отличительной особенностью является использование в интерфейсе flash-технологии. За счет этого достигается быстрая загрузка страницы, а также визуализация связей между сайтами, посвященными конкретной теме.


Mamma Meta Search

Относительно новая разработка. Наряду с текстовым поиском, обеспечивает выявление мультимедийных файлов. Имеет простой интерфейс, который, однако, не поддается настройке.


MetaСrawler

Ветеран метапоискового сервиса. По умолчанию обращается к 14 самым авторитетным поисковым средствам. Допускает поиск по любому слову запроса, всем словам или точной фразе. Имеет самые богатые возможности по настройке (пункт верхнего меню - Customize).


Vivisimo

Система обладаем множеством настраиваемых опций. Результаты поиска автоматически сортируются по разделам. Позволяет просматривать превью найденных страниц непосредственно из перечня результатов.


Web Crawler

Ветеран поискового сервиса, перешедший из самостаятельных поисковых ситем в метапоисковый сервис. Отличается высокой скоростью работы и достаточно высоким уровнем релевантности ссылок.

Национальные и региональные справочники и поисковые системы

В настоящее время в большинстве развитых стран существует минимум две-три справочника и поисковых систем, отражающих содержание ресурсов Интернет конкретного государства. Их использование наиболее эффективно при выявлении материалов, расположенных на серверах определенной страны. Российские инструменты поиска отражены .

Африка Wo Yaa Africa Search (http://www.woyaa.com)

Южная Африка Ananzi (http://www.ananzi.co.za)
Zebra (http://www.zebra.co.za)
Aadvark (http://www.aardvark.co.za)

Другие страны EgyptSearch Египет (http://www.egyptsearch.com) Справочник.
Maroc Search Марокко (http://www.maroc.net/search)
Азия 1001sites Ближний Восток и арабские страны Африки(http://www.1001sites.com) Справочник.
Arab Net Ближний Восток (http://www.arab.net)
Asiaco (http://www.asiaco.com) Справочник.
Search Dragon (http://www.searchdragon.com) Справочник.
Китай Ah Shun (http://www.ahshun.com) Справочник.
Network Compass (http://compass.net.edu.cn:8010) Нет англоязычного интерфейса.
ResearchSystem.com (http://www.researchsystem.com) Справочник.
Surf China (http://www.surfchina.com) Справочник.
WhatSite Китай, Тайвань, Гонконг (http://web.whatsite.com) Сервер находится в США. Справочник.
Индия 123India’s Premier search engine (http://www.123india.com)
Khoj (http://www.khoj.com) Справочник.
Гонгонг Balaa (http://www.balaa.com) Справочник.
Globepage - Asian Search Service (http://www.globepage.com)
Goyoyo (http://www.goyoyo.com.hk) Нет англоязычного интерфейса.
Search HK (http://search.hk.org)
Timway (http://www.timway.com) Справочник.
Япония Dragon Next (http://www.dragon.co.jp) Нет англоязычного интерфейса.
Fresh Eye (http://fresheye.com) Нет англоязычного интерфейса.
Goo (http://www.goo.ne.jp) Нет англоязычного интерфейса.
Moshix2 (http://www.moshix2.net)
Okay Japanese! (http://www.okay.co.jp/jpn)
Senrigan (http://senrigan.ascii.co.jp)
Сингапур Golden Village (http://www.goldenvillage.com) Справочник.
NetNet Multimedia Search Engine (http://www.netnet.com.sg)
Poyin (http://poyin.com)
TechnoFIND (http://www.technofind.com.sg)
Южная Корея AnySearch (http://www.anysearch.com) Справочник. Нет англоязычного интерфейса.
Naver (http://www.naver.com) Нет англоязычного интерфейса.
Тайвань SINANET.com (http://www.sinanet.com) Справочник.
YamWeb Navigator (http://taiwan.iis.sinica.edu.tw/en/yam) Справочник.
Другие страны BanglaSearch Бангладеш (http://www.banglasearch.com) Справочник.
CARI Малазия (http://www.cari.com.my)
iGuide Израиль (http://www.iguide.co.il) Справочник.
IndonesiaNet Индонезия (http://www.indonesianet.com/search.htm)
Libanis Ливан (http://libanis.com) Справочник.
Yehey Филлипины (http://www.yehey.com)

Австралия, Новая Зеландия, Океания AccessNZ Новая Зеландия (http://accessnz.co.nz) Справочник.
ANZWERS Австралия (http://www.anzwers.com.au) Uses Inktomi mechanism.

1. Особенности поисковой системы «Яндекс».

Поисковая система «Яндекс» является четвертой среди крупнейших поисковых систем мира и первой крупной неанглоязычной поисковой системой. Среди стран СНГ и бывшего СССР Яндекс занимает ведущие позиции по количеству обрабатываемых поисковых запросов, именно с этим связаны отдельные его особенности. Как и Google Яндекс регулярно совершенствует свои поисковые процессы, позволяя находить наиболее релевантные результаты поиска.

Изначально Яндекс придерживался следующих правил, для результата выдачи:

Уникальность контента на сайте.

Исключение сайтов-близнецов из результатов поиска.

Создание статистики релевантности для интернет ресурсов.

Исключение сайтов с переоптимизацией или с использованием черных методов оптимизации.

Основным отличием поисковой системы «Яндекс» является учет морфологии сложного и могучего русского языка. Не маловажным является и тот факт, что домены расположенные в зонах ru, su, ua индексируются данной поисковой системой более приоритетно и сразу же после их создания, домены, расположенные в других зонах, начинают индексироваться только через месяц.

В 2009 году Яндекс стал использовать технологию под названием «Снежинск», благодаря которой удалось реализовать поиск по географическому расположению пользователя.

Яндекс очень большое внимание уделяет релевантности и уникальности контента сайта, алгоримы Яндекса положительно выделяют ресурсы с плотностью слов-ключей в тексте от 4% до 6%. Специально для более результативного поиска Яндекс разработал способы индексирования текста внутри приложений, весом до 10мб, различных форматов, находящихся на ресурсе.

При определении уровня релевантности сайта поисковая система «Яндекс» учитывает данные, размещенные в файле robot.txt, а так же некоторые метатеги. Следует отметить, что поисковым роботом Яндекса не просматриваются такие метатеги, как Revisit-After и Keywords.

Описания в результатах поискового запроса от «Яндекс» формируется на основании выдержек из текстового контента ресурса, т.е. можно сделать вывод, что тег Description не очень важен для данного поисковика. В отдельных случаях, если описание в теге в большой мере релевантно запросу, то описание под результатом выдачи может браться из тега.

Как утверждают сотрудники Яндекса метатег кодировки не важен для данной поисковой системы, ибо она сама может определять кодировку документов.

К особенностям Яндекса так же относят и тот факт, что он не индексирует ссылки, созданные на сайте при использовании скриптов JavaScript.

Очень большим плюсом данной поисковой системы является учет возраста интернет-ресурса, т.е. если вы создали свой сайт, расположили на нем уникальный контент, а через 2-3 месяца какой-то умник скопировал ваш текст к себе на ресурс, то Яндекс будет индексировать ваш сайт, а сайт копипастера нет.

2. Особенности поисковой системы Google.

Поисковая система Google является самой крупной во всем мире, её используют пользователи сети Интернет в большинстве современных стран, очень много крупных компаний и корпораций используют её как корпоративную поисковую систему. В настоящий момент компания Google это крупная инновационная корпорация, занимающаяся различными IT проектами в разных направлениях. Стоит отметить, что все свои разработки компания старается связывать друг с другом, делать взаимодействие между проектами наиболее тесным.

Если рассматривать Google, с точки зрения поиска, то можно узнать много интересных фактов, но об этом вы можете почитать и в википедии. Я же хочу обратить внимание на особые отличия поисковой системы Google от других поисковых систем. Итак, почему же эта система так популярна, почему другим поисковикам тяжело с ней конкурировать? Все очень просто, причина такой популярности в скорости поиска. На данный момент, эта поисковая система самая быстрая, результаты по введенному пользователю запросу генерируются в считанные доли секунды. Этого удается достичь за счет технологии под названием PageRank, заключающейся в копировании определенной информации с Интернет-ресурсов на сервера компании Google, таким образом, для поиска релевантного сайта, роботу Google не надо обходить и анализировать все сайты в Интернете, ему достаточно обратиться к базе копий, и по ним выдать результат. Именно из-за использования этой технологии компания Google является крупнейшим владельцем серверных компьютеров в мире.

Однако PageRank это не только копирование информации и поиск по ней, это так же и поиск, основывающийся на качестве внешних ссылок на ваш сайт, своеобразный аналог сервиса Яндекс цитирования.

Так же стоит обратить внимание на глобальность поисковой системы Google. Если, например, Яндекс имеет фильтр по региону пользователя, то Google в свою очередь данного фильтра не имеет, и он производит поиск во всемирном масштабе.

К особенностям Google так же относят использование «паука» под названием Googlebot. Данному поисковому роботу можно как запретить индексировать ваш сайт, так и ускорить шанс индексации им, для этого необходимо испрользовать файл robot.txt или различные стандартные метатеги. Google так же использует специфический тег:. Этот тег используется поисковиком для исключения вашего ресурса из его кэш памяти и благодоря этому пользователи могут просматривать вашу страницу на вашем сервере, а в кэше поисковика. Это позволит вашим пользователям регулярно получать свежие обновления вашего контента, без участия Googlebot’а.

Как следствие глобальности поисковой системы Google имеет огромную базу проиндексированных документов, поэтому нет гарантии, что ваш сайт будет проиндексирован после включения его в каталог ресурсов Google с использованием формы AddURL, скорее всего бот поисковика найдет ваш сайт раньше и проиндексирует его самостоятельно. Большое значение для индексации поисковым ботом Google имеет наличие вашего ресурса в каталоге DMOZ, который просматривается поисковым ботом регулярно.

Еще одной, пожалуй, отрицательной чертой поисковой системы Google является тот факт, что динамические страницы Google индексирует не в полном объеме, а если на страницах используются сессии, то индексация не происходит совсем.

Очень большое влияние на релевантность ваших интернет-страниц оказывают такие факторы внешней оптимизации ресурса, как:

Плотность ключевых слов в документе (оптимально от 5% до 20%).

Имя домена.

Текст ссылок на ваш сайт с внешних ресурсов.

Содержимое атрибута ALT у изображений на вашем сайте.

Смысловое наполнение тега.

Выделение ключевых слов в контенте при помощи использования специальных тегов, таких как , .

3. Особенности поисковой системы go.mail.ru.

В данном разделе речь пойдет о молодой поисковой системе go.mail.ru, являющейся частью крупного портала mail.ru. До недавних пор, данный портал и сама поисковая система использовала в своей работе то сервис поиска «Яндекс», то Google. Сейчас же портал начал использовать для поиска по зарубежным ресурсам результаты поиска Google, а для поиска по отечественным ресурсам был разработан собственный движок в 2006 году под названием GoGo.ru и каждый год он подлежит совершенствованию. О принципах работы и особенностях данного поисковика еще малоизвестно, но кое-какие моменты все-таки пользователи знают.

Пожалуй, к особенностям поисковика портала mail.ru можно отнести социализацию. Это связанно с тем, что портал включает в себя социальные сети, такие как МойМир и Одноклассники, а так же другие форумы и вопросники, где люди общаются друг с другом и обмениваются информацией. Инновационными функциями социализации поиска на портале mail.ru является поиск людей в соц. сетях, поиск товаров на сервисе mail.ru, поиск в проекте «Ответы Mail.ru».

Поиск go.mail.ru очень чувствителен к наличию ссылочной массы на ваш ресурс, если ссылочная масса большая, то ждите большой трафик с этого поисковика.

В будущем разработчики обещают интегрировать в поисковик функцию поиска по регионам, но пока это лишь обещания.

E-mail: [email protected]

Министерство образования и науки Российской Федерации

Федеральное агентство по образованию

МАОУ «Лицей №5»

Реферат на тему:

Поисковая система Яндекс

Выполнил ученица 11 класса

МАОУ «Лицея №5»

Барабанов Антон Михайлович

Руководитель

1 Введение 3

2 Поисковый запрос 4

3 Основные характеристики поисковой системы 6

4 Что умеет Yandex 8

4.2 Морфологический анализ слов 9

5 История Yandex 12

6 Руководство 13

8 Список литературы 15

Введение

Актуальность. Мы в нашем современном мире не можем представить жизни без Интернета, с его помощью мы покупаем разнообразные товары, знакомимся, общаемся, работаем, слушаем музыку, смотрим фильмы и т.д. Возможности Всемирной Паутины безграничны, надежными помощниками в виртуальных лабиринтах выступают поисковые системы. Нет ничего проще, чем написать в строке поисковика нужный запрос, и поисковая система выдаст огромное количество предложений по внесенным словам или фразе. Еще совсем недавно о подобном даже не мечтали.

Российские граждане о возможностях Интернета узнали всего лишь несколько лет назад, несмотря на такой короткий срок, в настоящее время Всемирная Паутина становится доступной даже в отдаленных уголках нашей большой страны. Например, среди жителей Москвы девяносто процентов молодежи до 30 лет являются активными пользователями Интернета. С каждым днем по всей стране их количество стремительно возрастает, значительно увеличивается и скоростная способность каналов.

Умение использовать возможности поиска в интернете является информационной компетентностью любого современного человека.

Цель работы: формирование представления о возможностях и принципах работы поисковой системы Yandex.

Задачи:

· Изучить литературу

· Исследовать принцип работы поисковой системы Yandex

Методы исследования : сбор информации, изучение литературы, анализ.

Поисковой запрос

Рассмотрим подробнее понятие поискового запроса на примере поисковой системы «Яндекс». Поисковый запрос должен быть сформулирован пользователем в соответствии с тем, что он хочет найти, максимально кратко и просто. Допустим, мы хотим найти информацию в «Яндексе» о том, как выбрать автомобиль. Для этого, открываем главную страницу «Яндекса», и вводим текст поискового запроса «как выбрать автомобиль». Далее, наша задача сводится к тому, чтобы открыть предоставленные по нашему запросу ссылки на источники информации в Интернет. Однако, вполне можно и не найти нужную нам информацию. Если таковое произошло, то либо нужно перефразировать свой запрос, либо в базе поисковой системе действительно нет никакой актуальной информации по нашему запросу (такое может быть при задании очень «узких» запросов, как, например «как выбрать автомобиль в Перми»)
Первоочередная задача любой поисковой системы – доставлять людям именно ту информацию, которую они ищут. А научить пользователей делать «правильные» запросы к системе, т.е. запросы, соответствующие принципам работы поисковых систем, невозможно. Поэтому разработчики создают такие алгоритмы и принципы работы поисковых систем, которые бы позволяли находить пользователям искомую ими информацию.

Это означает, поисковая система должна «думать» так же, как думает пользователь при поиске информации. Когда пользователь обращается с запросом к поисковой машине, он хочет найти то, что ему нужно, максимально быстро и просто. Получая результат, он оценивает работу системы, руководствуясь несколькими основными параметрами. Нашел ли он то, что искал? Если не нашел, то сколько раз ему пришлось перефразировать запрос, чтобы найти искомое? Насколько актуальную информацию он смог найти? Насколько быстро обрабатывала запрос поисковая машина? Насколько удобно были представлены результаты поиска? Был ли искомый результат первым или же сотым? Как много ненужного мусора было найдено наравне с полезной информацией? Найдется ли нужная информация, при обращении к поисковой системе, скажем, через неделю, или через месяц?

Основные характеристики поисковой системы

Для того, чтобы удовлетворить ответами все эти вопросы, разработчики поисковых машин постоянно совершенствуют алгоритмы и принципы поиска, добавляют новые функции и возможности, всячески пытаются ускорить работу системы.
Основные характеристики поисковой системы.
Опишем основные характеристики поисковых систем:
Полнота
Полнота - одна из основных характеристик поисковой системы, представляющая собой отношение количества найденных по запросу документов к общему числу документов в сети Интернет, удовлетворяющих данному запросу. К примеру, если в Интернете имеется 100 страниц, содержащих словосочетание «как выбрать автомобиль», а по соответствующему запросу было найдено всего 60 из них, то полнота поиска будет 0,6. Очевидно, что чем полнее поиск, тем меньше вероятность того, что пользователь не найдет нужный ему документ, при условии, что он вообще существует в Интернете.
Точность
Точность - еще одна основная характеристика поисковой машины, которая определяется степенью соответствия найденных документов запросу пользователя. Например, если по запросу «как выбрать автомобиль» находится 100 документов, в 50 из них содержится словосочетание «как выбрать автомобиль», а в остальных просто наличествуют эти слова («как правильно выбрать магнитолу и установить в автомобиль»), то точность поиска считается равной 50/100 (=0,5). Чем точнее поиск, тем быстрее пользователь найдет нужные ему документы, тем меньше различного рода «мусора» среди них будет встречаться, тем реже найденные документы не будут соответствовать запросу.

Актуальность
Актуальность - не менее важная составляющая поиска, которая характеризуется временем, проходящим с момента публикации документов в сети Интернет, до занесения их в индексную базу поисковой системы. Например, на следующий день после появления интересной новости, большое количество пользователей обратились к поисковым системам с соответствующими запросами. Объективно с момента публикации новостной информации на эту тему прошло меньше суток, однако основные документы уже были проиндексированы и доступны для поиска, благодаря существованию у крупных поисковых систем так называемой «быстрой базы», которая обновляется несколько раз в день.
Скорость поиска
Скорость поиска тесно связана с его устойчивостью к нагрузкам. Например, по данным ООО «Яндкес Интернет Холдинг», на сегодняшний день в рабочие часы к поисковой машине Яндекс приходит около 90 запросов в секунду. Такая загруженность требует сокращения времени обработки отдельного запроса. Здесь интересы пользователя и поисковой системы совпадают: посетитель желает получить результаты как можно быстрее, а поисковая машина должна отрабатывать запрос максимально оперативно, чтобы не тормозить вычисление следующих запросов.

Что умеет Yandex

Программные продукты серии Yandex (Языковый index) - набор средств полнотекстовой индексации и поиска в текстовых данных с учетом морфологии русского языка.
Yandex включает модули морфологического анализа и синтеза, индексации и поиска, а также набор вспомогательных модулей, таких, как анализатор документов, языки разметки, конверторы форматов, сетевой "паук".
Алгоритмы морфологического анализа и синтеза, основанные на базовом словаре, умеют нормализовать слова, то есть находить их начальную форму, а также строить гипотезы для слов, не содержащихся в базовом словаре. Система полнотекстового индексирования позволяет создавать компактный индекс и быстро осуществлять поиск с учетом логических операторов.
Yandex предназначен для работы с текстами как в локальной так и в глобальной сети (технологии Intranet и Internet) , а также может быть подключен как модуль к другим системам.

4.1. Индексация
Создаваемый индекс составляет около 1/3 объема текста (без картинок, tag"ов и пр.), при этом записывается подробный адрес слова - с точностью до позиции в тексте, что потом позволяет искать с учетом близости. В базу входят нормализованные формы слов текста, сами документы не хранятся.

4.2. Морфологический анализ слов

4.2. Морфологический анализ слов текста происходит одновременно с индексацией, что дает возможность снятия омонимии.
Скорость индексации - не менее 2 Мб/минуту. Написан свой робот для обхода Web"а.

10
Организация изменения индекса (полное либо частичное обновление, слияние).
Идет индексирование по всем словам, стоп-слова определяются статистически.
1.2. Поиск
Язык запросов: скобки; логическое И (в пределах одного абзаца); логическое ИЛИ; оператор И НЕ (в пределах одного абзаца); близость - расстояние в словах.
Список выданных документов упорядочивается по релевантности - по количеству найденных слов. В каждом документе выделяются (подсвечиваются) найденные слова.
1.3. Работа с языком
Для интеллектуализации поиска используется словарь на 90 тыс. слов. При индексации происходит нормализация, то есть слово ставится в свою исходную форму (для существительных - именительный падеж единственного числа, для глаголов - неопределенная форма и т.д.) и в таком виде учитывается в базе. Алгоритм морфологического разбора умеет корректно обрабатывать и слова, не найденные в словаре. Морфология работает для русского и английского языка. Также индексируются числа.

1.4.Результаты поиска.
На странице результатов поиска Яндекса есть тексты, поясняющие результаты поиска, и ссылки, дающие возможность сортировать найденное или уточнять запрос.

1.5.Если в результате запроса Яндекс нашел много документов, но по более широкой теме, чем вам хочется, вы можете сократить этот список, уточнив запрос. Еще один вариант - включить флажок в найденном в форме поиска, задать дополнительные ключевые слова, и следующий поиск будет вестись только по тем документам, которые были отобраны в предыдущем поиске. Например, чтобы найти страницы про кондиционеры - средства, предназначенные для ухода за волосами (а не климатическую технику), можно задать запрос кондиционеры, для определения области поиска. А затем, поставив галочку в найденном, - слово «волосы»

1.6.Адрес сайта.
Яндекс позволяет искать информацию только по интересующему вас сайту, задав соответствующие параметры в расширенном поиске, с помощью Яндекс.Бара или нажав на ссылку «Еще с сайта» . Тогда рядом с поисковой формой появляется напоминание, что результаты получены поиском по одному сайту. Если вы хотите продолжить поиск по всем сайтам, достаточно перед очередным запросом снять флажок.

1.7.Выбор региона.
Поиск можно ограничить сайтами в нужном вам регионе или относящимися к интересной вам теме. Для поиска по всем сайтам снимите флажок в регионе.

1.8.Выбор диапазона дат.
Задав временной интервал, к которому должны относиться искомые документы, вы можете затем его исправить в результатах поиска, введя новые числа в формате «День-Месяц-Год».

История Яндекс

«Яндекс» - российская ИТ-компания, владеющая одноимённой системой поиска в Сети и интернет-порталом. Поисковая система «Яндекс» является 5-ой среди поисковых сайтов мира по количеству обработанных поисковых запросов (более 3 млрд, 1,7 % от мирового количества, статистика за сентябрь 2011 года). По состоянию на 16 ноября 2012 года, согласно рейтингу Alexa.com, по популярности сайт yandex.ru занимает 18-е место в мире и 1-е место в России.

Поисковая система Yandex.ru была официально анонсирована 23 сентября 1997 года, и первое время развивалась в рамках компании CompTek International. Как отдельная компания «Яндекс» образовался в 2000 году. В мае 2011 года Яндекс провёл первичное размещение акций, заработав на этом больше, чем какая-либо из Интернет-компаний со времён IPO поисковика Google в 2004 году.

Основным и приоритетным направлением компании является разработка поискового механизма, но за годы работы «Яндекс» стал мультипорталом. В 2011 году «Яндекс» предоставляет более 30 сервисов.

Руководство

Руководство:

· Аркадий Волож - генеральный директор.

· Илья Сегалович - директор по технологиям и разработке.

· Шульгин, Александр - финансовый директор

· Алексей Третьяков - коммерческий директор.

· Андрей Себрант - директор по маркетингу сервисов.

· Екатерина Фадеева - директор по правовым вопросам.

· Аркадий Борковский - CTO of Yandex Labs.

· Максим Киселёв - директор по развитию бизнеса.

Вывод

Теперь подытожим все вышесказанное.
Первоочередная задача любой поисковой системы – доставлять людям именно ту информацию, которую они ищут.
Основные характеристики поисковых систем:
1. Полнота
2. Точность
3. Актуальность
4. Скорость поиска
5. Наглядность

В состав поисковой системы входят компоненты:
1. Модуль индексирования
2. База данных
3. Поисковый сервер

Список литературы

1. Е. Колмановская, CompTek International, Яndex: система русского поиска Internet/Intranet.
2. Абросимов А.Г., Абрамов Н.В., Мотовилов Н.В., Корпоративные экономические информационные системы, уч. пос. СГЭА, 2005.
3. Информационно-поисковые системы. – http://www.comptek.ru/yandex/yand_about.html.
4. Аликберов А. Поисковые машины. – http://citforum.ru/win/internet/search/index.shtml.
5. Талантов М. Поиск информации в Интернете: подводные камни // КомпьютерПресс.– № 9, 1999.

Самое простое применение поисковой системы, это поиск текстовых файлов на собственном компьютере. Нечто вроде дополнения к файловому менеджеру. Вещь очень нужная и полезная. Вы вводите слова, содержащиеся в тексте документа, вам выдается список файлов. Такие системы, пригодны для поиска в массиве из нескольких тысяч небольших документов, расположенных на ПК пользователя. Эти системы ищут только документы, для поиска информации, например справочного характера, они непригодны.

Поисковые системы для корпоративных пользователей. Такие программы предназначены для работы с массивами текстовых документов предприятия имеющих объемы от нескольких гигабайт до нескольких десятков гигабайт. Кроме того, такие программы обязательно реализованы в сетевом варианте, при котором доступ к базе данных на сервере локальной сети, осуществляется с рабочих станций сотрудников.

Поисковые системы для интернет проектов. Предназначены для поиска htmlдокументов в Интернете. Рассчитаны на упрощенный поиск в большом количестве небольших документов. Результат поиска в таких системах – список ссылок наhtmlфайлы в сети плюс короткие цитаты из контекста, обычно по одной. Из-за больших объемов информации в сети эти программы должны иметь очень высокую скорость поиска. Из-за большого количества мусора в сети, необходима сортировка выдачи по степени релевантности или другим критериям (например рейтингу сайта).

Самое сложная задача, это поиск информации в больших полнотекстовых массивах. В базы данных таких систем могут закачиваться любые текстовые источники информации, в том числе большого объема: энциклопедии, справочники, архивы периодических изданий, целые библиотеки специальной литературы, архивы документов корпораций, специализированные архивы типа исторических, патентных, судебных, расшифровки разговоров, протоколы и многое другое. Если в ответ на Ваш конкретный запрос система выдаст ссылку на энциклопедию, то это Вряд ли Вас обрадует. Если в этой энциклопедии сто ответов на запрос, то система должна обработать каждый и выдать отдельно все соответствующие тексты. Такая система должна искать не просто документы, а информацию, содержащуюся в них.

Если поисковая система предназначена для индексации и поиска информации в глобальной сети или для доступа к большим хранилищам текстовой информации, объёмом до десятков терабайт, то программное обеспечение системы разрабатывается специально для комплекса серверов, в качестве которых используются мощные специализированные компьютеры типа кластерных систем, имеющих десятки параллельно работающих процесооров и большой объем оперативной памяти. Например, поисковая система Google в качестве аппаратной базы использует сеть из нескольких тысяч таких суперкомпьютеров, размещенных по всему миру.

Программы для различных категорий пользователей

Программа для реализации собственного проекта. Обычно создается для поисковой системы в интеренете, интранет сети большой организации, крупного банка текстовых данных с доступом через сеть (например национальная библиотека). Для реализации проекта создается команда проектировщиков, программистов и т.п., которая самостоятельно или с посторонней помощью создает, сопровождает и развивает систему.

В случае успешно созданного проекта, комплекс программ может быть доработан до необходимой степени универсальности и использован для разработки поисковых систем на заказ. Самостоятельно такой программный комплекс не поставляется, так как требует конфигурации и настройки программных средств под требования заказчика, частичной доработки программ, постоянного сопровождения на случай сбоев системы.

Если программный комплекс доработан настолько, что -покрывает потребности большого круга пользователей, не требует постоянного сопровождения разработчиков, имеет программный интерфейс, доступный программистам среднего уровня, сопровождается качественной документацией, не использует чужих компонентов без лицензии, то он может поставляться на рынок как инструментарий разработчика. В этом случае фирма-поставщик имеет более-менее определенные цены на свою продукцию. Обычно имеется несколько стандартных версий, представляющих урезанные варианты полной конфигурации.

Программы для конечного пользователя. Представляют собой готовый коммерческий продукт. Имеют хорошо отработанный пользовательский интерфейс, позволяющий обычному пользователю управлять всеми функциями системы. Обычно разработаны «с нуля», без использования «чужих» программных средств. Такие программы распространяются в «коробочном» варианте по определенной цене.

Поисковые системы Google, Yahoo, Яндекс, Rambler, Nigma, Aport... служат для обнаружения необходимого ресурса в сети Интернет по ключевым словам. Эти системы, или, как их иначе называют, поисковые машины, ежедневно перебирают миллионы WWW серверов, индексируют и каталогизируют найденные ресурсы. Возможность поиска ресурса в Интернет очень удобна, но нельзя забывать о том, что Сеть живет своей жизнью - каждый день появляются тысячи новых страниц, некоторые старые исчезают... Поэтому, поисковые системы не всегда выдают самую точную информацию.

Средства поиска и структурирования, иногда называемые поисковыми механизмами, используются для того, чтобы помочь людям найти информацию, в которой они нуждаются. Средства поиска типа агентов, пауков, кроулеров и роботов используются для сбора информации о документах, находящихся в Сети Интернет. Это специальные программы, которые занимаются поиском страниц в Сети, извлекают гипертекстовые ссылки на этих страницах и автоматически индексируют информацию, которую они находят для построения базы данных. Каждый поисковый механизм имеет собственный набор правил, определяющих, как cобирать документы. Некоторые следуют за каждой ссылкой на каждой найденной странице и затем, в свою очередь, исследуют каждую ссылку на каждой из новых страниц, и так далее. Некоторые игнорируют ссылки, которые ведут к графическим и звуковым файлам, файлам мультипликации; другие игнорируют cсылки к ресурсам типа баз данных WAIS; другие проинструктированы, что нужно просматривать прежде всего наиболее популярные страницы.

Поисковые системы -- веб-сайт, предоставляющий возможность поиска информации в Интернете. Большинство поисковых систем ищут информацию на сайтах Всемирной паутины, но существуют также системы, способные искать файлы на ftp-серверах, товары в интернет-магазинах, а также информацию в группах новостей Usenet.

Как правило, основной частью поисковой системы является поисковые машины-- комплекс программ, обеспечивающий функциональность поисковой системы. Основными критериями качества работы поисковой машины являются релевантность (степень соответствия запроса и найденного, то есть уместность результата), полнота базы, учёт морфологии языка. Индексация информации осуществляется специальными поисковыми роботами. В последнее время появился новый тип поисковых движков, основанных на технологии RSS, а также среди XML-данных разного типа.

Улучшение поиска -- это одна из приоритетных задач сегодняшнего Интернета (см. про основные проблемы в работе поисковых систем в статье Глубокая паутина).

По данным компании Net Applications в декабре 2007 года использование поисковых систем на Западе распределялось следующим образом (приложение 2, рисунок 2):

Google -- 77,04 %, Yahoo -- 12,46 %, MSN -- 3,33 %, Microsoft Live Search -- 2,57 %, AOL -- 2,12 %, Ask -- 1,38 %, AltaVista -- 0,13 %, Excite -- 0,07 %, Lycos -- 0,02 %, All the Web -- 0,02 %.

В вышеприведенный отчёт не входят российские поисковики, такие как, например, Яндекс, Рамблер или Nigma.

Одним из первых инструментов поиска в интернете (до WWW) был Archie. Первой поисковой системой для Всемирной паутины был «Wandex», уже не существующий индекс, который создавал «World Wide Web Wanderer» -- бот, разработанный Мэтью Грэем (англ. Matthew Gray) из Массачусетского технологического института в 1993. Также в 1993 году появилась поисковая система «Aliweb», работающая до сих пор. Первой полнотекстовой (т. н. «crawler-based», то есть индексирующей ресурсы при помощи робота) поисковой системой стала «WebCrawler», запущенная в 1994. В отличие от своих предшественников, она позволяла пользователям искать по любым ключевым словам на любой веб-странице -- с тех пор это стало стандартом во всех основных поисковых системах. Кроме того, это был первый поисковик, о котором было известно в широких кругах. В 1994 был запущен «Lycos», разработанный в университете Карнеги Мелона.

Вскоре появилось множество других конкурирующих поисковых машин, таких как «Excite», «Infoseek», «Inktomi», «Northern Light» и «AltaVista». В некотором смысле они конкурировали с популярными интернет-каталогами, такими, как «Yahoo!». Позже каталоги соединились или добавили к себе поисковые машины, чтобы увеличить функциональность. В 1996 году русскоязычным пользователям интернета стало доступно морфологическое расширение к поисковой машине Altavista и оригинальные российские поисковые машины Rambler и Aport. 23 сентября 1997 была открыта поисковая машина Яндекс.

В последнее время завоёвывает всё большую популярность практика применения методов кластерного анализа и метапоиска. Из международных машин такого плана наибольшую известность получила «Clusty» компании Vivisimo. В 2005 году на российских просторах при поддержке МГУ запущен поисковик Nigma, поддерживающий автоматическую кластеризацию. В 2006 году открылась российская метамашина Quintura, предлагающая визуальную кластеризацию в виде облака ключевых слов. Nigma тоже экспериментировала с визуальной кластеризацией.

Помимо поисковых машин для Всемирной паутины, существовали и поисковики для других протоколов, такие как Archie для поиска по анонимным FTP-серверам и «Veronica» для поиска в Gopher.

Популярные поисковые системы

Всеязычные: Google (34,4 % Русскоязычного сегмента); Bing (0,9 % Русскоязычного сегмента); Yahoo! (0,2 % Рунета) и принадлежащие этой компании поисковые машины: Inktomi, AltaVista, Alltheweb.

Англоязычные и международные: AskJeeves (механизм Teoma).

Русскоязычные -- большинство «русскоязычных» поисковых систем индексируют и ищут тексты на многих языках -- украинском, белорусском, английском и др. Отличаются же они от «всеязычных» систем, индексирующих все документы подряд, тем, что в основном индексируют ресурсы, расположенные в доменных зонах, где доминирует русский язык или другими способами ограничивают своих роботов русскоязычными сайтами. Яндекс (46,3 % Рунета), Mail.ru (8,9 % Рунета), Rambler (3,3 % Рунета), Nigma (0,5 % Рунета), Генон (0,1 % Рунета), Gogo.ru (<0,1 % Рунета), Aport (<0,1 % Рунета). Мета (приложение 2, рисунок 3).

Из перечисленных поисковых систем не все имеют собственный поисковый алгоритм -- так Mail.ru и QIP.ru используют поисковый механизм Яндекса, а Nigma сочетает в себе как свой алгоритм, так и сборную выдачу от других поисковиков.

Главный плюс любой поисковой машины кроется в механизме ее работы. В отличие от каталогов, поисковики, для добавления сайтов в свою базу данных, используют специального робота-паука, который вполне удачно просматривает и индексирует все общедоступные сайты своей Глобальной Паутины. Но для удачного поиска нам будет мало лишь огромной базы нашего спутника, ведь среди всех этих терабайт информации нам нужно найти именно нужную нам.

Важнейшим фактором и залогом нашего успеха является правильность поискового запроса.

Исключение из поиска

Поисковую машину можно не только «заставлять» искать нужный текст, но и исключать некоторые слова из запроса. Если вы не хотите, что бы при поиске реферата на тему История Древнего Египта вам были предложены документы с его Культурой, просто введите в поисковое поле Google: история древнего египта -культура. В Яндексе вместо знака «-» используется сочетание знаков «~~». При таком запросе, слово «культура» было полностью исключено из критериев поиска.

Поиск с учетом регистра

Поисковые системы не учитывают регистр, все заглавные символы воспринимаются машинами как строчные, за исключением использования специального операнда. Таковым является знак восклицания «!», стоящий перед словом. Эта функция очень полезна для поиска сел или городов с распространенными названиями, к примеру «село!Кошки». В данном случае, поисковик не будет искать сайты, где речь ведется о селе, где живут кошки, а будет вести поиск с учетом заглавной буквы.



Эта статья также доступна на следующих языках: Тайский

  • Next

    Огромное Вам СПАСИБО за очень полезную информацию в статье. Очень понятно все изложено. Чувствуется, что проделана большая работа по анализу работы магазина eBay

    • Спасибо вам и другим постоянным читателям моего блога. Без вас у меня не было бы достаточной мотивации, чтобы посвящать много времени ведению этого сайта. У меня мозги так устроены: люблю копнуть вглубь, систематизировать разрозненные данные, пробовать то, что раньше до меня никто не делал, либо не смотрел под таким углом зрения. Жаль, что только нашим соотечественникам из-за кризиса в России отнюдь не до шоппинга на eBay. Покупают на Алиэкспрессе из Китая, так как там в разы дешевле товары (часто в ущерб качеству). Но онлайн-аукционы eBay, Amazon, ETSY легко дадут китайцам фору по ассортименту брендовых вещей, винтажных вещей, ручной работы и разных этнических товаров.

      • Next

        В ваших статьях ценно именно ваше личное отношение и анализ темы. Вы этот блог не бросайте, я сюда часто заглядываю. Нас таких много должно быть. Мне на эл. почту пришло недавно предложение о том, что научат торговать на Амазоне и eBay. И я вспомнила про ваши подробные статьи об этих торг. площ. Перечитала все заново и сделала вывод, что курсы- это лохотрон. Сама на eBay еще ничего не покупала. Я не из России , а из Казахстана (г. Алматы). Но нам тоже лишних трат пока не надо. Желаю вам удачи и берегите себя в азиатских краях.

  • Еще приятно, что попытки eBay по руссификации интерфейса для пользователей из России и стран СНГ, начали приносить плоды. Ведь подавляющая часть граждан стран бывшего СССР не сильна познаниями иностранных языков. Английский язык знают не более 5% населения. Среди молодежи — побольше. Поэтому хотя бы интерфейс на русском языке — это большая помощь для онлайн-шоппинга на этой торговой площадке. Ебей не пошел по пути китайского собрата Алиэкспресс, где совершается машинный (очень корявый и непонятный, местами вызывающий смех) перевод описания товаров. Надеюсь, что на более продвинутом этапе развития искусственного интеллекта станет реальностью качественный машинный перевод с любого языка на любой за считанные доли секунды. Пока имеем вот что (профиль одного из продавцов на ебей с русским интерфейсом, но англоязычным описанием):
    https://uploads.disquscdn.com/images/7a52c9a89108b922159a4fad35de0ab0bee0c8804b9731f56d8a1dc659655d60.png