Неофлекс
Data-Lake-na-baze-tekhnologiy-Hadoop-v-banke-VTB.png

Data Lake для построения рисковых ML-моделей для Банка ВТБ на платформе Cloudera CDH

Решение

Data Lake построен на платформе Cloudera CDH, задачи по загрузке данных решаются с использованием Apache Oozie, Apache Spark, Apache Sqoop. Данные из внутренних систем банка и внешних источников сохраняются в self-describing data формате, например, JSON, Apache Parquet. Унифицированный доступ, используя SQL, к сырым данным и витринам данных осуществляется с помощью технологий Apache Spark SQL и Apache Impala.

Для решения задач исследования данных были развернуты и внедрены инструменты machine and deep learning такие как scikit-learn, Apache Spark MLLib, H2O, TensorFlow, keras. Также были внедрены Apache Zeppelin, JupiterHub – инструменты исследования и визуализации данных, в которых data scientist’ам были доступны все необходимые сведения из Data Lake и библиотек исследования данных. Пользователи получили объединенные в одном пространстве больше разнообразных данных для более глубокого и качественного анализа клиентов на высокопроизводительной и масштабируемой платформе Apache Hadoop.

Чтобы реализовать проект за 3 месяца, было решено организовать процесс по методологии Scrum, используя инструменты и принципы DevOps. Специалисты Банка ВТБ и «Неофлекс» работали совместно в единой Scrum-команде, под контролем Scrum-коуча. Благодаря тесному сотрудничеству инженеров удалось развернуть всю необходимую инфраструктуру для разработки, внедрения и эксплуатации ПО, а также построить процессы непрерывной конвейерной доставки обновлений (CI/CD).

Отзыв заказчика

Maksim-Kondratenko.png
Максим Кондратенко
Член правления банка ВТБ

Мы получили успешный опыт интеграции разрозненных внешних и внутренних данных в единую информационную среду для повышения качества и скорости оценки рисков, применения комбинированных подходов к анализу и обработки информации: от классического статистического анализа до методов машинного обучения, использования преимуществ opensource технологий, развития компетенций в управлении проектами. Этот пилотный проект потребовал не столько финансовых инвестиций, сколько готовности к изменениям на уровне устоявшихся процессов, мышления и внутренней культуры. Многое свидетельствует о том, что получилось выработать адаптивность к непрерывному усовершенствованию, экспериментам и инновациям.

Результаты

Создание Data Lake помогло собирать, накапливать в едином пространстве и обрабатывать данные из разнородных источников. Созданная инфраструктура обеспечивает Банку ВТБ высокую скорость и качество мониторинга факторов кредитного риска корпоративных клиентов банка, а также предоставляет инструменты для всестороннего анализа данных, их визуализации, построения прогнозов и разработки новых моделей. Благодаря использованию Hadoop, развитие и масштабирование решения не требует капитальных вложений в отличии от хранилища, построенного с использованием классических технологий.