Неофлекс

Миграция данных из различных RDBMS в Hadoop. Cтатья экспертов Neoflex для Хабр

28 октября 2021

В нашей очередной статье для Хабр рассматриваем процесс экспорта данных в Hadoop из различных РСУБД посредством фреймворка Spark. Для взаимодействия с данным фреймворком используется язык программирования Python с применением api PySpark. Кроме того, эксперты Neoflex поэтапно проанализировали процесс выполнения исполняемого кода, а также рассмотрели возможные методы и опции для оптимизации и ускорения процесса выгрузки данных. В частности, привели пример важной задачи на проекте по переносу больших данных между системами, когда необходимо построить различные аналитические витрины на основании таблиц, содержащих десятки Тб данных. В том числе, речь идет о наиболее удобном формате хранения данных – Parquet:

  • файлы, с которыми легко работать, перемещать, бэкапить и реплицировать;
  • колончатый вид позволяет значительно ускорить работу аналитика;
  • нативная поддержка в Spark из коробки обеспечивает возможность сохранить файл в любимое хранилище.




Подробности читайте в статье


Контакты для МЕДИА

Если у вас есть вопросы или нужна дополнительная информация о компании, напишите нам по адресу пресс-службы:

pr@neoflex.ru