Веду подбор ведущего DevOps-инженера для компании под NDA. Компания развивает инфраструктуру цифровых сервисов для финансовых и телекоммуникационных проектов, платформ обработки данных, ML/LLM-сервисов и корпоративных систем. Кандидат будет отвечать за промышленную эксплуатацию, автоматизацию поставки изменений и надёжность сервисов.
Обязанности:
- Проектировать и развивать инфраструктуру в облаках и on-premise, поддерживать self-hosted сервисы, физические серверы, виртуальные машины и отказоустойчивые распределённые системы.
- Администрировать Linux и Windows Server, эксплуатировать Kubernetes и контейнерные приложения: развёртывание, обновление, Helm-чарты, диагностика и масштабирование.
- Создавать и поддерживать CI/CD-пайплайны: сборка, тестирование, доставка артефактов, развёртывание и откат. Развивать GitOps, применять blue-green и canary-релизы.
- Описывать инфраструктуру как код, автоматизировать конфигурацию и регламентные операции, писать скрипты и внутренние инструменты, сокращать объём ручной работы.
- Настраивать мониторинг, алерты, дашборды, централизованный сбор логов и распределённую трассировку; повышать качество сигналов и снижать шум алертов.
- Определять и контролировать SLI, SLO, SLA и error budget. Измерять доступность, задержки, нагрузку, время восстановления и результаты изменений.
- Диагностировать production-инциденты, восстанавливать сервисы, проводить RCA и postmortem, устранять первопричины и предотвращать повторные аварии.
- Оптимизировать производительность и стоимость инфраструктуры, выполнять профилирование, capacity planning и планирование масштабирования.
- Настраивать сети, маршрутизацию, DNS, TLS, балансировку, Ingress, VPN и Service Mesh; диагностировать прохождение трафика.
- Сопровождать базы данных, кэши, очереди и платформы данных: репликация, отказоустойчивость, настройка производительности и устранение сбоев.
- Организовывать backup/restore и disaster recovery, регулярно проверять восстановление и достижение целевых RPO и RTO.
- Проводить миграции и обновления сервисов и платформ с проверкой совместимости, планом отката и контролем простоя.
- Управлять доступами, сертификатами и секретами, выполнять hardening, внедрять проверки безопасности в CI/CD и участвовать в аудитах инфраструктуры.
- Развивать MLOps, GPU- и LLM-инфраструктуру, сопровождать развёртывание моделей.
- Работать с разработкой, QA, Data/ML-командами и информационной безопасностью, развивать platform engineering, объяснять технические риски и согласовывать изменения.
- Вести документацию архитектуры, серверов, IP-адресов и связей сервисов, runbooks и инструкции. Участвовать в код-ревью, наставничестве и передаче знаний.
- Участвовать в оплачиваемых дежурствах on-call, включая внерабочее время, для круглосуточного реагирования на критические инциденты.
Требования:
- Более 5 лет опыта в DevOps, SRE или инфраструктурной инженерии. Практический опыт промышленной эксплуатации высоконагруженных и распределённых систем, самостоятельного сопровождения облачной и on-premise инфраструктуры.
- Операционные системы: Ubuntu, Debian, RHEL/Red Hat/Rocky Linux, Astra Linux, AlmaLinux; Windows Server. Администрирование, обновление и диагностика серверов, анализ CPU, RAM и I/O.
- Скриптинг: Bash, Python, Go, PowerShell; SQL. Умение читать код, собирать и диагностировать сервисы на Java, PHP, TypeScript.
- Контейнеры: Docker, Kubernetes, Helm, OpenShift, K3s, RKE/RKE2 и Rancher. Эксплуатация кластеров и диагностика контейнерной среды.
- Сборка и поставка: Git, GitLab, GitHub Actions,. Работа с Nexus, JFrog Artifactory, Maven и Gradle; разработка и оптимизация пайплайнов.
- GitOps и релизы: Argo CD и Argo Workflows, blue-green и canary-развёртывания.
- Инфраструктура как код (IaC): Terraform (OpenTofu), Terragrunt, Ansible.
- Облачные платформы: AWS, Google Cloud/GCP, Yandex Cloud, Selectel. Управление ресурсами, VPC, сетями, IAM и managed-сервисами, сопровождение инфраструктуры через код.
- Серверы и виртуализация: bare metal, VMware ESXi/vSphere, Proxmox.
- Хранилища: MinIO, Ceph, Longhorn, LVM и RAID. Настройка, диагностика и обеспечение сохранности данных.
- Мониторинг и алерты: Grafana, VictoriaMetrics, Alertmanager, Datadog, Thanos; проектирование дашбордов и правил оповещения.
- Логи и трассировка: ELK/OpenSearch, Loki, Kibana, Vector и Promtail; OpenTelemetry, Tempo и Sentry.
- Сети: TCP/IP, DNS, HTTP/HTTPS, NAT, BGP, VPN, WireGuard, iptables и nftables; Nginx, HAProxy, Envoy, Ingress, Keepalived. Service Mesh, Istio, Cilium; диагностика сетевого взаимодействия.
- Доступы и секреты: HashiCorp Vault, Keycloak, FreeIPA. Управление сертификатами и безопасностью сервисных взаимодействий.
- Безопасность: WAF и SIEM, SAST, DAST, SCA, SBOM, SonarQube и Trivy.
- Базы данных и кэши: PostgreSQL (Patroni), Redis и etcd. Репликация, backup/restore.
- Очереди: Kafka, RabbitMQ, Airflow.
- MLOps и AI-инфраструктура: MLflow, Kubeflow, KServe и Seldon; эксплуатация LLM, VLM и RAG-сервисов, self-hosted inference на vLLM и Ollama. Работа с NVIDIA GPU, CUDA и GPU-нодами Kubernetes, MIG/MPS.
- Практики SRE: SLI, SLO, SLA, error budget, MTTR, RPO и RTO. Умение использовать показатели для оценки надёжности, нагрузки и результата изменений.
- Опыт работы в банковских или финансовых системах с требованиями информационной безопасности и аудита.
- Высшее техническое образование. Английский язык от B1 для чтения документации и профессионального общения.
Условия:
- Полная занятость, трудоустройство в штат компании-работодателя по ТК РФ, оплачиваемые отпуск и больничные.
- Удалённая работа с территории России. График 5/2, с гибким началом дня c 8:00 до 12:00 по GMT+3.
- Дежурства on-call по заранее согласованной ротации, отдельно оплачиваются.
- Компания предоставляет рабочее оборудование (MacOS, Windows, Linux), ДМС после испытательного срока и бюджет на профильное обучение и сертификации.
- Участие в выборе технических решений и развитии инфраструктуры, работа с инженерными командами и обмен знаниями.
- Премии по результатам работы.
Linux, Kubernetes, Docker, Helm, CI/CD, GitLab CI, Git, Ansible, Terraform, Python, Bash, Prometheus, Grafana, VictoriaMetrics, GitOps, Argo CD, PostgreSQL, Redis, Kafka, SQL, Nginx, Vault, AWS, SRE, SLI/SLO/SLA, Высокая доступность, Управление инцидентами, MLOps, GPU/CUDA