Р. Митчелл | Скрапинг веб-сайтов с помощью Python (2016) [PDF]
Автор: Р. Митчелл
Издательство: ДМК Пресс
ISBN: 978-5-97060-223-2
Жанр: Программирование на Python
Формат: PDF
Качество: Удовлетворительный скан и eBook
Иллюстрации: Цветные и черно-белые
Описание:Изучите методы скрапинга и краулинга веб-сайтов, чтобы получить доступ к неограниченному объему данных в любом уголке Интернета в любом формате. С помощью этого практического руководства вы узнаете, как использовать скрипты Python и веб-API, чтобы одновременно собрать и обработать данные с тысяч или даже миллионов веб-страниц.
Идеально подходящая для программистов, специалистов по безопасности и веб-администраторов, знакомых с языком Python, книга знакомит не только с основными принципами работы веб-скраперов, но и углубляется в более сложные темы, такие, как анализ сырых данных или использование скраперов для тестирования интерфейса веб-сайта. Примеры программного кода, приведенные в книге, помогут разобраться в этих принципах на практике.
Торрент обновлен!
Добавлена версия в изначально компьютерном формате.
Просьба всем перекачать торрент! - выполнять парсинг сложных HTML страниц;
- сканировать веб-страницы и сайты;
- работать с API;
- применять несколько методов хранения собранных данных;
- скачивать, обрабатывать и извлекать данные из документов;
- использовать инструменты и методы для очистки плохо отформатированных данных;
- читать и записывать естественные языки;
- выполнять краулинг с использованием регистрационных форм;
- выполнять скрапинг Javascript-кода;
- обрабатывать изображения и распознавать текст.
Инструменты и примеры, приведенные в этой книге, позволяют легко автоматизировать несколько повторяющихся задач, высвобождая время для решения более насущных проблем. Это легко читаемая, ориентированная на конкретный результат книга, рассказывающая о реальных проблемах и решениях.
Спасибо
reddisk0s2014 за предоставленный им скан изначально.
Спасибо
Bistriibob за предоставленный им скан после выложенного
reddisk0s2014.
Файлы к книге Скриншоты:
Время раздачи: с 9:00 до 21:00 (до появления первых 3-5 скачавших)