
Data Science платформа для разработки и внедрения моделей машинного обучения для Mediascope
Решение
Для построения платформы выбрано решение Kubeflow с открытым исходным кодом, предоставляющее централизованные средства для разработки ML-моделей, пайплайнов и управления артефактами. Кроме того, используется Argo Workflow, как наиболее развитый оркестратор рабочих процессов на Kubernetes, входящий в Kubeflow и облегчающий процесс использования разработанных моделей.
В платформе настроены процессы MLOps (версионирование моделей, experiment tracking, сборка исполняемых сервисов на базе разработанных моделей) с возможностью отслеживания происхождения артефактов. Архитектура платформы обеспечивает автоматизированный процесс разработки и внедрения моделей, их перенос в промышленную среду, а также предоставляет инструменты для визуализации метрик экспериментов. Это позволяет сократить срок разработки, добиться воспроизводимости результатов и повысить надёжность комплексных конвейеров по обработке данных, элементами которых являются ML-сервисы.
В части DevOps была спроектирована и развёрнута инфраструктура для разработки и валидации моделей машинного обучения, а также их запуска в промышленную эксплуатацию в пакетном режиме. Для этой инфраструктуры были настроены средства мониторинга и журналирования. Также был реализован конвейер непрерывной интеграции и доставки, включающий следующие задачи: сборка образов Docker для моделей ML и шагов пайплайна для их применения, тестирование шагов пайплайна, публикация артефактов в централизованный реестр, валидация модели и публикация пайплайна её применения для промышленной эксплуатации.
Mediascope – технологичная компания, использующая большое количество сложных ML-моделей для обработки данных и получения аналитики. Поэтому было особенно важно разработать решение, которое бы полностью удовлетворяло высоким технологическим стандартам заказчика, и при этом было бы удобным в ежедневном использовании дата-сайентистами. Внедрение новой Data Science платформы позволит Mediascope сократить time-to-market для новых аналитических продуктов, основанных на моделях машинного обучения, а также снизить трудозатраты команд по валидации и выводу моделей в промышленную эксплуатацию.
Отзыв заказчика

В компании имеется отлаженный процесс и собственные инструменты по развёртыванию моделей машинного обучения как сервисов и включению их в конвейеры обработки данных, однако для повышения возможностей масштабирования, прозрачности процесса и сокращения времени по выводу исследовательских алгоритмов в промышленную эксплуатацию было решено разработать новую DS-платформу. Это даёт возможность как для более тесной интеграции внутренних команд, так и при необходимости, для оперативного подключения внешних команд к разработке новых моделей с автоматизированной валидацией качества предложенных решений.
Результаты
В результате проекта компания получила масштабируемое и управляемое пространство для разработки ML-моделей, которое позволяет оперативно подключать внутренние команды дата-сайентистов с возможностью оценки результатов их работы. С помощью платформы компания также сможет быстро и с минимальными трудозатратами привлекать внешние ML-команды для увеличения количества решаемых задач и разрабатываемых моделей. Кроме того, специалистам станет доступен централизованный каталог готовых пайплайнов с упрощением последующей разработки моделей за счёт переиспользования готовых компонентов.
