Мы — группа IT-компаний Lad: 34 года помогаем бизнесу автоматизировать процессы и внедрять новые технологии, более 500 специалистов в команде. В 2025 году вошли в ТОП-100 работодателей России и заняли 1 место среди IT-компаний Нижегородской области.
Ladcraft — платформа автономных ИИ-агентов для бизнеса. Разворачивается на серверах заказчика в изолированной сети, без доступа в интернет, и работает в Kubernetes; часть инсталляций использует локальный инференс моделей на GPU. Ваша задача — обеспечивать стабильную работу этой инфраструктуры.
Чем предстоит заниматься:
- Анализировать логи и метрики заказчиков: системные логи, логи сервисов, дашборды Grafana, метрики Prometheus.
- Обновлять компоненты по инструкциям от команды разработки: пакеты, сервисы, бандлы.
- Готовить хосты к установке: базовая настройка ОС (Альт Сервер 10.4 / Debian / Ubuntu / Astra SE 1.7, 1.8), проверка ресурсов, сети и файловых систем.
- Настраивать и диагностировать GPU: доступность видеокарт, драйверы, распределение видеопамяти между LLM-моделями, контроль температур и загрузки.
- Разбирать инциденты в Kubernetes: падающие поды, нехватка ресурсов, OOMKill, CrashLoopBackOff, проблемы с Ingress, ConfigMaps, Secrets, PVC.
- Локализовать лёгкие и средние инциденты, применять типовые решения и эскалировать с полным контекстом: логи, метрики, шаги, гипотезы.
- Взаимодействовать с DevOps и разработкой, готовить репродукции проблем.
- Общаться с заказчиком в чатах и по почте: собирать данные по инциденту, согласовывать окна обновлений, отчитываться о результатах.
- Развертывать платформу в закрытых контурах.
- Первоначальная настройка контура.
Что мы ожидаем:
- Linux на уровне уверенного пользователя: процессы и нагрузка, службы, файловые системы и сетевые соединения.
- Уверенное владение Kubernetes: архитектура кластера, работа с kubectl, диагностика подов, понимание Ingress, Services, ConfigMaps, Secrets, PVC/StorageClass, ResourceQuota, HPA. Умение читать манифесты и понимать, что в них не так.
- Понимание сетей: TCP/UDP, DNS, MTU, базовая диагностика.
- Опыт работы с мониторингом: Prometheus, Grafana, Loki — чтение дашбордов, поиск аномалий.
- Понимание HTTP-кодов ошибок (502, 504) и их причин в инфраструктуре с прокси и балансировщиком.
- Базовый bash для простых скриптов диагностики.
- Понимание принципов systemd: unit-файлы, зависимости, статусы служб.
- Понимание работы локального инференса: видеопамять и требования моделей, диагностика нехватки видеопамяти, знакомство с утилитами мониторинга GPU.
- Умение самостоятельно выстраивать план диагностики: ОС → Kubernetes → приложение → сеть.
- Коммуникационные навыки: чётко формулировать вопросы, собирать нужные данные и объяснять статус и дальнейшие шаги инженерам и руководителям проектов заказчика.
- Готовность вовремя признавать незнание и эскалировать, спокойствие в инцидентах: сначала факты, потом действия.
Мы предлагаем:
- Официальное трудоустройство, полная занятость.
- Удалённый формат работы, в Нижнем Новгороде возможен гибрид.
- Гибкое начало рабочего дня (9:00–11:00 по МСК).
- Команда разработки и DevOps рядом: помогают, но ожидают самостоятельности в своей зоне.
- Обучение и развитие: Lad Универ, внешние тренинги и митапы, выстроенный онбординг, индивидуальный план развития.
- ДМС, чекапы, компенсация спорта.
- Оплачиваемый выходной в день рождения, магазин мерча.