Gemini — глобальная криптовалютная и Web3-платформа, основанная Кэмероном и Тайлером Уинклвоссами в 2014 году; компания предоставляет криптопродукты и сервисы частным лицам и организациям более чем в 70 странах. Команда данных проектирует и эксплуатирует инфраструктуру данных, которая обеспечивает аналитику, отчётность, аналитические решения и машинное обучение во всём бизнесе.
☑️ Чем предстоит заниматься
- Проектировать, создавать и поддерживать инфраструктуру данных и пайплайны для пакетной обработки и потоковых / real-time нагрузок, участвуя в архитектурных решениях
- Строить и поддерживать масштабируемые, эффективные и надёжные ETL/ELT-пайплайны с использованием Python, SQL, Spark, Flink, Beam или аналогов
- Работать над решениями для данных в реальном или почти реальном времени (например, CDC, стриминг, micro-batch) для сценариев, где важна своевременность данных
- Сотрудничать с data scientists, ML-инженерами, аналитиками и продуктовыми командами: уточнять требования к данным, определять SLA и поставлять согласованные data products, которыми другие смогут пользоваться самостоятельно
- Выстраивать фреймворки качества данных, валидации, наблюдаемости и мониторинга (аудит данных, алертинг, обнаружение аномалий, lineage данных)
- Разбираться и устранять сложные проблемы в production: root cause analysis, узкие места по производительности, целостность данных, отказоустойчивость
- Документировать потоки данных, словари данных, архитектурные паттерны и операционные runbook’и
☑️ Наши пожелания к кандидатам
- 5+ лет опыта в data engineering (или смежных ролях)
- Уверенный опыт проектирования, реализации и оптимизации ETL/ELT-пайплайнов
- Глубокая экспертиза в Python и SQL, умение писать production-код: поддерживаемый и тестируемый
- Опыт работы с крупномасштабными хранилищами данных (например, Databricks, BigQuery, Snowflake)
- Твёрдые основы software engineering, структур данных и системного мышления
- Практический опыт моделирования данных (dimensional modeling, нормализация, проектирование схем)
- Опыт построения систем с данными в реальном времени или стримингом (например, Kafka, Kinesis, Flink, Spark Streaming), знакомство с CDC-фреймворками
- Опыт с оркестрацией / workflow-фреймворками (например, Airflow)
- Знакомство с data governance, lineage, метаданными, каталогизацией и практиками качества данных