Компания BSS — системно значимая российская ИТ-компания, специализирующаяся на разработке, внедрении и поддержке решений по цифровизации клиентского обслуживания для банков, финтех-компаний, госсектора, телекома, ритейла, медицины, сферы ЖКХ в России и СНГ. Мы разрабатываем системы речевой аналитики, развиваем платформы дистанционного банковского обслуживания, а также оказываем услуги по заказной и аутсорс разработке. Мы практикуем наиболее востребованные рынком технологические решения: от машинного обучения до разработки 1С.
Сейчас мы находимся в поиске Data инженера на проект сроком 6 месяцев.
Чем нужно будет заниматься:
- Проектирование архитектуры данных: разработка и описание целевой архитектуры хранилищ (OLAP/OLTP), определение моделей данных, выбор форматов хранения и стратегий партиционирования;
- Разработка Data Pipelines: проектирование и реализация ETL/ELT-пайплайнов: построение DAG в Apache Airflow, написание кастомных операторов и сенсоров на Python, настройка ретраев, алертинга и зависимостей;
- Стриминг и батч-обработка: разработка стриминговых джоб на Apache Flink и батч-процессинга на Apache Spark;
- Оптимизация производительности: практический опыт поиска и устранения узких мест, оптимизация медленных SQL-запросов (анализ execution plans, индексы, партиционирование), тюнинг конфигурации движков обработки (Flink, Spark) и баз данных для минимизации потребления ресурсов (CPU, RAM, I/O);
- Обеспечение качества данных: организация тестирования трансформаций данных, внедрение механизмов проверки целостности и актуальности данных, реализация процессов нормализации и дедупликации;
- Интеграции: разработка и поддержка интеграций между системами: REST/gRPC API, базы данных, message brokers (Kafka, MQTT), файловые хранилища (S3), Timeseries DB;
- Работа с Jira: ведение задач, управление статусами и связями между задачами;
- Поддержка технической и бизнес-команд: обработка заявок на поддержку существующих потоков данных или разработку новых, заведение и контроль исполнения заявок внутренних команд;
- Поддержка команды в систематизации и автоматизации процессов;
- Взаимодействие с разработчиками и тестировщиками для уточнения технических ограничений и требований;
- Обеспечение прозрачности статуса технических задач и процессов для всей команды.
Что мы ждём от кандидата:
- Опыт работы на позиции Data Engineer от 4 лет в сфере разработки ПО;
- DBMS & Warehouses: уверенная работа с Postgres и MSSQL; опыт настройки и оптимизации OLAP-движков (Trino, StarRocks) и современных хранилищ (Cassandra, Redis);
- Data Flow Tools: практический опыт работы с Apache Airflow (написание DAG, кастомные операторы); опыт использования Apache Kafka (producer/consumer) и Apache Flink (разработка стриминговых джоб, состояние, чекпоинты);
- Data Lake / Lakehouse: опыт работы с Apache Iceberg, понимание архитектуры lakehouse, использование Lakekeeper для управления метаданными, работа с объектным хранилищем S3;
- CDC: опыт реализации Change Data Capture паттернов для синхронизации данных между системами;
- Глубокие знания в области архитектуры данных и баз данных: понимание принципов нормализации и денормализации, проектирование relational и columnar моделей, стратегии управления данными (lifecycle, retention, versioning);
- Уверенное владение Python: написание скриптов, модулей, работа с асинхронностью при необходимости; опыт написания DAG в Apache Airflow, включая кастомные операторы, hooks, sensors;
- Навыки оптимизации: умение профилировать процессы, находить bottlenecks, оптимизировать SQL-запросы и настраивать ресурсы кластеров под нагрузку;
- Владение Jira и Confluence на уровне confident user (структура страниц, шаблоны, макросы, связки задач и документации);
- Опыт организации хранения данных для последующих задач OLAP / OLTP с учетом требований (consistency / integrity);
- Опыт организации обработки данных в рамках задач OLAP / OLTP с применением различных паттернов (batch processing, CDC);
- Понимание ключевых особенностей и сценариев применения различных паттернов организации интеграционных потоков (batch processing, CDC) с учетом их характеристик (3V+);
- Опыт заведения и сопровождения заявок в сервис-деске;
- Умение структурировать информацию, работать с требованиями, документировать технические решения;
- Английский - на уровне чтения и написания технической документации.
Будет плюсом:
- Опыт работы с Timeseries базами данных (InfluxDB, TimescaleDB, TDengine и др.);
- Глубокий опыт эксплуатации кластеров (Hadoop, YARN, Kubernetes) в production-среде;
- Знание SQL на продвинутом уровне (оптимизация сложных запросов, window functions, CTE);
- Опыт работы с CI/CD для data-пайплайнов;
- Понимание принципов DDD, event-driven архитектуры;
- Опыт работы с Apache NiFi.
-
Что мы предлагаем:
- Срок проекта 6 месяцев (с возможной пролонгацией);
- Трудоустройство по ТК РФ (срочный договор на срок проекта);
- Удаленный формат работы по РФ;
- Расширенный ДМС со стоматологией;
- Бесплатное обучение английскому языку вам и вашим детям;
- Скидки в фитнес-клубы;
- Предоставляем всю необходимую технику для работы.