| Версия | 1.0 |
|---|---|
| Издатель | SqrBox |
| Дата выпуска | 18 мар. 2013 г. |
| Дата добавления | 18 мар. 2013 г. |
| Требования ОС | Windows |
| Требования | .NET Framework 3.5 |
| Всего скачиваний | 292 |
| Цена | Free |
Описание
Существует бесконечное количество причин, по которым человек или компания могут захотеть использовать программное обеспечение для поиска в Интернете. Этот тип программы просматривает веб-страницы определенным способом, который может быть автоматизированным, методичным или упорядоченным. Если вы плохо знакомы с термином «программное обеспечение для веб-краулера», возможно, вы слышали о пауках, ботах, муравьях, автоматических индексах, роботах или скаттерах? Они все в основном одно и то же!
Назначение программного обеспечения веб-краулера
Когда вы думаете о программном обеспечении для веб-сканирования, вы, вероятно, представляете такие известные поисковые системы, как Google, Bing и Yahoo. Их боты сканируют веб-страницы, чтобы определить содержание, релевантность и индексацию. Создавая копию посещенных страниц, они могут обеспечить более быстрый и точный поиск. SqrBox скажет вам, что вам, конечно же, не нужно быть поисковой системой, чтобы иметь потребность в программном обеспечении для веб-краулера. Вы просто должны быть кем-то, у кого есть необходимость собрать большие объемы или чрезвычайно сложную информацию.
Типы программного обеспечения веб-краулера
Если вы планируете пользоваться услугами профессиональной компании, такой как SqrBox, вам не нужно беспокоиться о сложном жаргоне программного обеспечения для веб-краулера. Тем не менее, полезно понять некоторые вещи об этом.
Целенаправленное сканирование. Цель этого типа программного обеспечения веб-краулера состоит в том, чтобы загружать страницы, которые, по-видимому, содержат аналогичную информацию. Однако с этим методом часто связаны некоторые недостатки, и фактическая производительность сканера и результат зависят от того, насколько богаты ссылки на эту конкретную тему, по которой выполняется поиск. Этот тип программного обеспечения для веб-сканеров часто используется в качестве отправной точки для сужения поиска для дальнейшего сканирования.
Нормализация URL-адресов. Программное обеспечение веб-краулера часто выполняет некоторый уровень нормализации URL-адресов, что помогает уменьшить повторяющееся сканирование одного и того же источника более одного раза.
Ограничение переходов по ссылкам. В некоторых случаях программное обеспечение веб-краулера может захотеть избегать определенного веб-контента и искать только страницы .html. Для этого URL-адрес часто проверяется, а затем ресурсы будут запрашиваться только в том случае, если в URL-адресе есть определенные символы, такие как .html, .asp, .htm, .php, .aspx, .jspx или .jsp. Программное обеспечение веб-сканера обычно игнорирует ресурсы со знаком «?» чтобы избежать ловушек для пауков.