Неофлекс

Узкие места больших данных и как их обойти. Интервью Артема Меркулова изданию Computerworld

09 октября 2019

Артём Меркулов, руководитель бизнес-направления Big Data Solutions компании «Неофлекс» рассказал изданию Computerworld об основных сложностях, возникающих в проектах больших данных, и о путях их преодоления.

Какие аспекты систем больших данных вызывают наибольшие трудности у заказчиков?

Артём Меркулов: Многие организации сейчас находятся на начальной стадии освоения области больших данных и ведут пилотные проекты. Им часто не хватает внутренней экспертизы в первую очередь по администрированию приложений, конфигурированию системных компонентов, кластеров. Нехватка квалифицированных кадров – пожалуй, главная проблема на сегодня.

Что касается технических аспектов, то поскольку до 80% всех объемов работ составляет предварительная подготовка и обработка данных (об этом говорят и оценки экспертов, и наши собственные наблюдения), то эти процессы требуют у заказчиков наибольшего напряжения.


Какие компоненты систем больших данных оказываются наиболее трудоемкими в реализации?

Артём Меркулов: Всегда в них присутствует рутинная часть – такая, например, как загрузка информационного «сырья» в хранилище или озеро данных. Ее нужно автоматизировать, и мы в нашей платформе Datagram эту функцию реализовали. Вторая группа трудоемких компонентов – те, что связаны со сложной настройкой трансформации данных. Зачастую загрузка происходит отдельно, а преобразование – отдельно (например, средствами языка Scala). Наша платформа позволяет использовать трансформацию любой сложности, при необходимости прибегая к помощи внешних инструментов. Третья группа связана с DevOps, непрерывной интеграцией и развертыванием создаваемых приложений. Эти инструменты должны пронизывать всё решение, поддерживая работу большой, в том числе распределенной команды. Реализация таких инструментальных конвейеров с помощью одного лишь ПО с открытым кодом оказывается весьма трудоемкой.


Какие компоненты являются наиболее дорогостоящими?

Артём Меркулов: Аппаратные компоненты систем больших данных по стоимости сопоставимы с теми, что применяются в «традиционных» проектах, при этом ПО зачастую обходится практически бесплатно, поскольку для работы с большими данными широко применяются продукты с открытым кодом. Самое дорогое – это высококвалифицированный персонал. Такие специалисты дефицитны, поэтому их труд ценится. Даже если вы готовы предложить им достаточно денег, найти этих сотрудников на рынке и привлечь их всё равно будет сложно, потому что специалистов высокого уровня немного.


Нередко компаниям приходится анализировать данные из новых источников. Насколько трудоемкой и затратной оказывается интеграция с ними?

Артём Меркулов: Просто подключить новый источник и обеспечить загрузку данных из него несложно – это вопрос нескольких дней или, возможно, недель. Гораздо труднее интегрировать данные из него в существующие системы. Ключевой фактор здесь – прозрачность алгоритмов, по которым планируется объединять данные. Если основой объединения служат простые ключи – это одна задача, если же требуется дополнить информацию о клиентах данными из соцсетей – значительно более сложная.

Нередко, подключая новые источники, приходится изменять бизнес-процессы заказчика – это нужно либо для того, чтобы полученные данные были задействованы и использовались, либо чтобы сотрудники им доверяли. Как известно, изменение бизнес-процессов – процесс достаточно трудоемкий и болезненный для любой организации.


Как влияет на архитектуру и реализацию систем больших данных требование анализировать данные Интернета вещей?

Артём Меркулов: Интернет вещей характеризуется двумя ключевыми особенностями. Первая – обработка потоков данных в реальном времени. Если система изначально не была спроектирована в расчете на потоковую аналитику, то, скорее всего, в нее придется внести серьезные изменения. Насколько это необходимо, будет зависеть от задачи, которую нужно решить. Одно дело – сбор потоковых данных и их анализ с определенной периодичностью (например, раз в сутки) и совсем другое – обработка данных «на лету», чтобы, к примеру, выявлять некие аномалии или иные события, на которые надо реагировать немедленно, здесь требуется другая архитектура.

Вторая особенность – объемы данных: при подключении источников Интернета вещей они растут очень быстро, и чтобы справляться с ними, нужна масштабируемая архитектура. Если ее возможности масштабирования недостаточны, то проблемы неизбежны – это касается и оборудования, и нагрузок на системные компоненты ПО. Проектируя системы больших данных для Интернета вещей, необходимо это учитывать и закладывать в них некоторый запас.


Как правило, в проектах больших данных приходится сталкиваться с большим разнообразием источников, типов и форматов данных и с разными требованиями к их хранению и обработке. Охватить их одним ИТ-инструментарием часто не удается, поэтому решения получаются сложными. Как можно уменьшить эту сложность?

Артём Меркулов: Первый, широко распространенный путь – использование готовых дистрибутивов Hadoop. Наиболее популярны среди них два: первый – от Cloudera, объединившейся с Hortonworks, второй – от российской компании Arenadata. В эти дистрибутивы включены компоненты, которые покрывают около 80% потребностей задач, возникающих на предприятиях, к тому же они уже интегрированы между собой. Это существенно упрощает реализацию проектов и снижает их стоимость. Недостающие компоненты можно найти на рынке, заказать или разработать самостоятельно.

Второй путь основан на умении работать с различными источниками данных, придерживаясь единых форматов и подходов. Для этого мы в нашей платформе Datagram унифицировали подключение ко всем источникам, в том числе потоковым, чтобы инженеры по данным и аналитики могли объединить и трансформировать данные из всех источников с помощью единого интерфейса.



Какие имеются пути для снижения общей стоимости владения решениями для работы с большими данными?

Артём Меркулов: Здесь можно выделить две области. Первая – вычислительные мощности: для проектов больших данных можно применять стандартные серверы среднего и нижнего уровня производительности, объединяя их в легко масштабируемые кластеры. Вторая область –использование облачных сервисов: заказчик арендует те объемы для хранения данных, которые ему реально нужны, и таким образом эффективно управляет своими запасами.

Сэкономить на ПО позволяют компоненты с открытыми кодами – их на рынке сейчас очень много, дистрибутивы многих из них бесплатны. Еще на стадии пилотного проекта заказчик оценивает, поддержка каких компонентов ему потребуется в ходе дальнейшей эксплуатации системы, и затем приобретает только эти услуги. Снизить совокупную стоимость владения помогает также модель приобретения ПО по подписке, ее сегодня применяют многие вендоры, в том числе и наша компания.

Контакты для МЕДИА

Если у вас есть вопросы или нужна дополнительная информация о компании, напишите нам по адресу пресс-службы:

pr@neoflex.ru