Spark shemaEvolution на практике. Статья команды бизнес-направления Big Data Solutions для Хабр
20 октября 2020
В блоге «Неофлекс» на Хабре вышел новый материал от команды бизнес-направления Big Data Solutions, о вариантах построения витрин переменной структуры с использованием Apache Spark.
В материале подробно описаны потенциальные проблемы и способы их решения при построении витрин на основе слабо структурированных данных. После прочтения статьи вы будете уметь:
- добавлять партиции в витрину, избавившись от служебных файлов;
- разбираться с пустыми полями в исходных данных, которые Spark типизировал;
- приводить простые типы к строке;
- приводить названия полей к нижнему регистру;
- разделять выгрузку данных и регистрацию таблицы в Hive (создание DDL);
- экранировать названия полей, которые могут быть несовместимы с Hive;
- обновлять регистрацию таблицы в Hive.
Подробнее читайте в материале на Хабре.
Контакты для МЕДИА
Если у вас есть вопросы или нужна дополнительная информация о компании, напишите нам по адресу пресс-службы:
pr@neoflex.ru