Вы присоединитесь к проекту одного из ведущих международных консалтинговых игроков, работающего с крупнейшими организациями по всему миру. Проект связан с развитием высоконагруженной платформы обработки данных для кредитного скоринга. Команда строит промышленную data-платформу для обработки больших объемов данных, автоматизации ETL-процессов и развития аналитической инфраструктуры.
Задачи
Разрабатывать и сопровождать ETL/ELT-пайплайны на Python/PySpark и Apache Spark
Оптимизировать SQL-запросы и процессы обработки больших объемов данных
Работать с OLAP-СУБД (ClickHouse, StarRocks или аналогичные), настраивать загрузку и обновление данных
Внедрять и поддерживать оркестрацию пайплайнов (Airflow, Dagster или Prefect)
Эксплуатировать Spark-кластеры и инфраструктуру обработки данных в Linux-среде
Контейнеризировать сервисы (Docker), поддерживать CI/CD (GitLab CI) и мониторинг (Prometheus, Grafana)
Обеспечивать надежность, отказоустойчивость и производительность data-платформы
Мы ожидаем 5+ лет опыта в Data Engineering. 3+ года практического опыта с Apache Spark в промышленной эксплуатации
Опыт работы с большими объемами данных в банках, финтехе или телекоме