Неофлекс

Apache Spark: оптимизация производительности на реальных примерах. Статья Алексея Попова для Хабр

20 сентября 2021

Алексей Попов, ведущий эксперт центра компетенций Big Data Solutions, рассказывает в новой статье для Хабр про Apache Spark – фреймворк для обработки больших данных, который давно уже стал одним из самых популярных и часто встречаемых в проектах, связанных с Big Data.

Используя Apache Spark, разработчик ведет работу с данными на достаточно высоком уровне и, кажется, нет ничего сложного в том, чтобы соединить два набора данных, написав всего одну строку кода. А что на самом деле происходит в кластере при соединении двух наборов данных? Обычно Spark со всем справляется быстро, но если данных действительно много, необходимо понимать – что происходит уровнем ниже – и использовать это знание, чтобы помочь Spark работать в полную силу. Автор на реальных примерах рассказывает о том, как сделать так, чтобы ваше приложение работало быстро и использовало все ресурсы, которые вы запросили для него. В частности, эксперт рассматривает модуль Spark SQL, работу оптимизатора Spark, а также файлы формата parquet.

Подробнее читайте в статье на Хабр

Контакты для МЕДИА

Если у вас есть вопросы или нужна дополнительная информация о компании, напишите нам по адресу пресс-службы:

pr@neoflex.ru