Мы разрабатываем высоконагруженную платформу на базе искусственного интеллекта GigaChat, которая позволит улучшить пользовательский опыт в продуктах Сбера.
Мы строим инфраструктуру, которая должна быть надежной, масштабируемой и устойчивой к высоким нагрузкам. Поэтому нам нужен SRE-инженер, который будет заниматься развитием инфраструктуры, надежностью сервисов, мониторингом и поиском причин сложных инцидентов.
Обязанности
- развивать и поддерживать инфраструктуру платформы
- обеспечивать надежность, доступность и производительность сервисов
- участвовать в проектировании и эксплуатации высоконагруженных систем
- настраивать мониторинг, алертинг и наблюдаемость сервисов.
- анализировать и устранять инциденты, включая поиск первопричин.
- оптимизировать производительность приложений и инфраструктуры.
- работать с контейнеризированными приложениями и Kubernetes-кластерами.
- частвовать в автоматизации рутинных операций и эксплуатационных процессов.
- взаимодействовать с разработчиками при разборе проблем производительности и надежности.
Требования
- уверенные знания Linux.
- практический опыт работы с Docker и Kubernetes.
- опыт работы с системами мониторинга и наблюдаемости:
- VictoriaMetrics;
- Zabbix;
- Grafana;
- Kibana.
- хорошее понимание Kafka и принципов работы распределенных очередей/стриминговых систем.
- опыт работы с PostgreSQL.
- уверенная работа с Git.
- опыт настройки и эксплуатации Nginx.
- понимание принципов построения отказоустойчивых систем.
- умение самостоятельно проводить диагностику проблем и находить их первопричину.
Будет большим плюсом
- опыт эксплуатации высоконагруженных систем.
- глубокое понимание сетевого взаимодействия: TCP/IP, DNS, HTTP/HTTPS, TLS.
- умение диагностировать проблемы сети с помощью Wireshark, tcpdump и стандартных Linux-инструментов.
- опыт работы с HashiCorp Vault и системами управления секретами.
- опыт работы с in-memory cache: Redis и аналогичными решениями.
- понимание принципов работы Kubernetes на уровне control plane, networking и storage.
- опыт автоматизации на Python, Bash или другом скриптовом языке.
- опыт работы с CI/CD.
- понимание принципов SLI/SLO/SLA и error budget.
- опыт проведения postmortem и анализа первопричин инцидентов.
Условия
- стабильный оклад и премии по результатам работы, ежегодный пересмотр зарплаты
- комфортный современный офис рядом с м.Кутузовская
- гибридный формат работы: встречаемся очно в офисе 1 раз в неделю
- корпоративный спортзал и зоны отдыха
- уникальная система обучения Сбера для профессионального и карьерного развития
- программа адаптации и помощь руководителя на старте
- расширенный ДМС и льготное страхование семьи
- гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
- бесплатная подписка СберПрайм, скидки на продукты компаний-партнеров
- вознаграждение за рекомендацию друзей в команду Сбера
- корпоративная пенсионная программа