Миграция данных из различных RDBMS в Hadoop. Cтатья экспертов Neoflex для Хабр
В нашей очередной статье для Хабр рассматриваем процесс экспорта данных в Hadoop из различных РСУБД посредством фреймворка Spark. Для взаимодействия с данным фреймворком используется язык программирования Python с применением api PySpark. Кроме того, эксперты Neoflex поэтапно проанализировали процесс выполнения исполняемого кода, а также рассмотрели возможные методы и опции для оптимизации и ускорения процесса выгрузки данных. В частности, привели пример важной задачи на проекте по переносу больших данных между системами, когда необходимо построить различные аналитические витрины на основании таблиц, содержащих десятки Тб данных. В том числе, речь идет о наиболее удобном формате хранения данных – Parquet:
- файлы, с которыми легко работать, перемещать, бэкапить и реплицировать;
- колончатый вид позволяет значительно ускорить работу аналитика;
- нативная поддержка в Spark из коробки обеспечивает возможность сохранить файл в любимое хранилище.
Подробности читайте в статье
Контакты для МЕДИА
Если у вас есть вопросы или нужна дополнительная информация о компании, напишите нам по адресу пресс-службы:
pr@neoflex.ru