Digital Chief — IT-хаб новой ecom-платформы от Альфа-Банка, где мы объединяем экспертизу по построению процессов и технологий вокруг нового продукта на рынке.
Мы строим независимый e-com — единый мультиканальный сервис Альфа-Ecom
Он объединит инструменты для работы на маркетплейсах , полный спектр решений для создания собственного интернет – магазина и управление кросс - канальными продажами в одном пространстве.
Наша ключевая задача — помочь селлерам снизить зависимость от отдельных площадок и выстроить устойчивую стратегию развития бизнеса.
Мы уже запустили e-com в Альфа-Банке и нашими продуктами воспользовались более 4000 селлеров.
Сейчас в команде у нас открыта позиция «DevOps / SRE Engineer».
Обязанности:
- Сопровождение и развитие процессов CI/CD
- Настройка и поддержка контейнерных и оркестрационных систем (Docker, Kubernetes и др.)
- Сопровождение тестовых и продуктивных сред: поддержка сервисов в production, проведение обновлений и обеспечение их стабильной работы
- Участие в дежурствах on-call по согласованному графику, включая внерабочее время: реагирование на оповещения, диагностика инцидентов и оперативное восстановление работоспособности продуктивных сервисов
- Анализ причин инцидентов, влияющих на безопасность и стабильность систем, и внедрение мер для предотвращения их повторения
- Автоматизация инфраструктуры и операций (Infrastructure as Code, self-healing)
- Развитие единой системы мониторинга и логирования для всех ключевых сервисов, создание кастомных экспортеров и настройка оповещений
- Обеспечение отказоустойчивости и масштабируемости тестовых и продуктивных систем
- Организация резервного копирования, проверка восстановления и обеспечение непрерывности бизнес-процессов
- Внедрение метрик и практик SRE (SLI/SLO, error budget) для повышения надёжности сервисов
- Реализация политик безопасности и контроль доступа к инфраструктурным ресурсам
Требования:
- Опыт работы в роли DevOps/SRE Engineer от 5 лет
- Уверенное знание Linux, опыт диагностики системных и сетевых проблем, настройки балансировки нагрузки и отказоустойчивости
- Опыт работы с Docker и Kubernetes в production, использования Helm для развёртывания и управления приложениями
- Опыт эксплуатации высоконагруженных продуктивных систем с требованиями к высокой доступности и производительности
- Опыт реагирования на инциденты в production: диагностика, восстановление работоспособности сервисов, анализ первопричин и предотвращение повторных сбоев
- Готовность участвовать в дежурствах on-call по согласованному графику
- Опыт администрирования и оптимизации PostgreSQL, MongoDB, Kafka, Redis и OpenSearch
- Опыт построения и сопровождения процессов CI/CD с использованием GitLab CI
- Навыки построения мониторинга, логирования и оповещений с использованием Prometheus, VictoriaMetrics, Grafana и ELK. Понимание принципов observability
- Опыт автоматизации инфраструктуры с помощью Terraform и Ansible, навыки написания скриптов на Bash и/или Python
- Понимание практик SRE
- Опыт настройки резервного копирования и проверки восстановления, понимание показателей RPO/RTO
- Опыт работы с Yandex Cloud и инфраструктурой в собственных дата-центрах
- Знание принципов управления доступом, работы с секретами и обеспечения безопасности инфраструктуры
Что мы предлагаем:
- Гибридный или удаленный формат работы
- Оформление по ТК РФ
- Работа в аккредитованной компании
- Дружелюбная атмосфера и команда лучших профессионалов
- График с 10.00 до 19.00 по мск (суббота и воскресенье- выходные дни)
- ДМС после прохождения испытательного срока