Неофлекс

Spark shemaEvolution на практике. Статья команды бизнес-направления Big Data Solutions для Хабр

20 октября 2020

В блоге «Неофлекс» на Хабре вышел новый материал от команды бизнес-направления Big Data Solutions, о вариантах построения витрин переменной структуры с использованием Apache Spark.


В материале подробно описаны потенциальные проблемы и способы их решения при построении витрин на основе слабо структурированных данных. После прочтения статьи вы будете уметь:



  • добавлять партиции в витрину, избавившись от служебных файлов;
  • разбираться с пустыми полями в исходных данных, которые Spark типизировал;
  • приводить простые типы к строке;
  • приводить названия полей к нижнему регистру;
  • разделять выгрузку данных и регистрацию таблицы в Hive (создание DDL);
  • экранировать названия полей, которые могут быть несовместимы с Hive;
  • обновлять регистрацию таблицы в Hive.



Подробнее читайте в материале на Хабре.


Контакты для МЕДИА

Если у вас есть вопросы или нужна дополнительная информация о компании, напишите нам по адресу пресс-службы:

pr@neoflex.ru