Обязанности: Развитие стека observability: Prometheus/VictoriaMetrics (long-term storage, vmagent/vminsert/vmselect), Loki + Promtail, Grafana Alloy, OpenTelemetry Collector, Tempo, Alertmanager.
– Настройка алертинга: SLO/SLI, разумные пороги, эскалации (без «шумных» алертов), интеграция с on-call (PagerDuty/Opsgenie/Telegram).
– Разворачивание и оптимизация vLLM на серверах с GPU A100/H100/B200 — NVLink, multi-GPU inference, батчинг, KV-cache tuning.
– Работа с AI-агентами: мониторинг их работы, логирование вызовов, трейсинг через OTel/Tempo, изоляция workload'ов через gVisor/runc RuntimeClass (безопасное исполнение недоверенного/агентского кода).
– Поддержка сетевого слоя: Cilium (CNI, Hubble, network policies), Traefik + Gateway API, желательно знание Istio (service mesh, mTLS, traffic shaping).
– Автоматизация через Ansible, управление Proxmox-виртуализацией (VM lifecycle, GPU passthrough, NUMA-тюнинг, шаблоны, HA).
– Диагностика инцидентов на всех уровнях стека: от control-plane Kubernetes до python/node.js-приложений.
Требования: Опыт работы в DevOps/SRE от 3 лет.
– Опыт с Kubernetes в production, развёртывание кластеров на bare-metal серверах.
– Глубокое знание Prometheus/VictoriaMetrics/Grafana/Loki, умение писать PromQL/LogQL.
– Опыт настройки алертинга без «alert fatigue» — приоритизация, дедупликация, роутинг.
– Понимание GPU-инфраструктуры: драйверы NVIDIA, GPU Operator, MIG/passthrough.
– Опыт деплоя LLM inference серверов (vLLM, TGI, Triton).
– Ansible на уровне идемпотентных playbook'ов, Proxmox API.
– Понимание Cilium/eBPF, Gateway API; Istio Service Mesh.
– Уверенный Linux (systemd, cgroups, iptables/nftables, дисковая и сетевая подсистема).
– Docker/containerd: сборка образов, дебаг контейнеров, работа с runtime-классами (runc, gVisor, kata).
– Умение дебажить Python-приложения (трейсбеки, py-spy, cProfile, asyncio/GIL-специфика).
– Умение дебажить Node.js-приложения (heap dump, CPU profile, event loop lag, memory leaks).
– Навыки низкоуровневой диагностики: strace/ltrace/tcpdump/perf.
– Понимание сетевых протоколов и инструментов для отладки проблем в кластерах.
Будет плюсом:
– Опыт с AI-агентами (LangChain,
LlamaIndex, кастомные оркестраторы) в
контексте инфраструктуры
– Опыт troubleshooting reliability проблем в
etcd/control-plane
– Опыт миграции с чистого Prometheus на
VictoriaMetrics
– Опыт работы с песочницами/sandbox-
исполнением кода (gVisor, Firecracker, Kata
Containers)
Условия: Официальное трудоустройство в соответствии с ТК РФ;
Стабильная «белая» заработная плата, выплаты два раза в месяц (5 и 20 число), уровень зарплаты обсуждается по итогам интервью;
Комфортный офис в центре города (новый айти-парк);
График работы, 5/2;
Поддержка профессионального развития;
Участие в конференциях и обучающих мероприятиях за счет компании;
Демократичный, молодой коллектив.
Неформальные встречи и корпоративные мероприятия.
Бронирование через военкомат при наличии военного билета (для военнообязанных) и айти-отсрочка.
Дресс-код casual
Будьте осторожны: если работодатель просит войти через Google, iCloud или Госуслуги, прислать код или пароль, запустить ПО или перевести деньги — это мошенники.