Мы в топ-3
музыкальных
сервисов*
У нас умные рекомендации и очень много контента, который
рядом целый день на множестве устройств
О роли
Мы ищем того, кто готов решать сложные задачи, погружаться в детали, быть хранителем стабильности и надежности наших сервисов. Если ты считаешь, что совершенство — это не цель, а путь, готов предлагать новые решения и внедрять передовые технологии, мы будем рады видеть тебя в нашей команде.
Почему это важно
Наша главная цель — поддерживать такие условия, при которых пользователи могут наслаждаться стабильностью и надежностью наших сервисов, открывая для себя новые горизонты звука.
Чем предстоит заниматься:
- Надежность и инциденты: Работа с инцидентом на всех этапах. Учавствовать в активных инцидентах в качестве координатора и/или инженера починки. Расследовать инциденты, проводить Post-mortem встречи с командами Dev/QA/OPS. Разрабатывать и актуализировать: планы восстановления, инструкции для дежурных, DRP. Проводить мероприятия на снижение MTTR, количество инцидентов. Участие в коммуникации с партнерами в рамках общих инцидентов;
- SLA/SLO и Error Budget: Внедрять и контролировать метрики надежности SLI/SLO/SLA внутренние и внешние. Участвовать в приоритизации бэклога разработки на основе анализа Error Budget;
- Observability (Наблюдаемость): Развивать системы мониторинга и трейсинга совместно с подразделением мониторинга (настраивать сбор метрик, дашборды в Grafana);
- Инфраструктура и K8s: Администрировать Kubernetes кластеры (ресурсы, автоскейлинг). Управлять сервис-мешем (Istio): настраивать сетевые политики, traffic routing, rate limiting, circuit breakers. Управление конфигурацией location nginx;
- Дежурства в рабочее время: контроль сетки релизов, реагирование на обращения коллег DEV по проблемам в межсервисном взаимодействии. Анализировать логи и трейсы в Jaeger/Tempo, Kibana/Loki;
- Дежурства в НЕрабочее время: реагирование и подключение на инциденты во внерабочее время. На текущем этапе команда переходит от добровольной к плановой системе дежурств. Нужно быть готовым к дежурствам в праздничные дни и каникулы. Все часы дежурств и вызовов во внерабочее время оплачиваются дополнительно.
Успех в роли обеспечат:
- Опыт в SRE / DevOps от 2-3 лет. Понимание идеологии SRE, опыт работы с SLI/SLO/SLA и Error Budget на практике. Опыт работы в production окружениях;
- уверенное администрирование. Понимание того, как работают операторы, сетевые модели и механизмы отказоустойчивости на уровне Pod/Deployment;
- опыт участия в дежурствах или роли Incident Commander. Умение не просто «тушить пожары», а системно устранять их первопричины;
- опыт настройки алертинга, опыт написания инструкций и DRP;
- уверенное написание скриптов и небольших сервисов/ботов на Go или Python и Bash.
Условия и формат работы
ДМС со стоматологией с первого рабочего дня
Предоставляем сессии с психологом
из сервиса «Ясно»
Компенсируем расходы на спорт
Работаем
в стильных офисах
в пяти минутах
от м. Кутузовская
Предоставляем бонусы аккредитованной IT-компании
Поддерживаем гибридный или офисный формат работы
Оплачиваем больничный на 100% —
до 7 дней
в году
Участвуем в конференциях и отправляемся
на обучение
Помогаем новым коллегам адаптироваться с поддержкой бадди
Дарим очень много скидок от партнёров и проходки
на концерты
Предлагаем здоровые перекусы и вкусные завтраки
*На основании данных Mediascope по российским музыкальным
сервисам за апрель 2026 г., основные критерии —
количество пользователей и знание бренда