Ищем Senior DevOps / MLOps в команду больших языковых моделей и машинного обучения в VICTORY IT. Будем строить платформу распределённых вычислений, которая объединит CPU/GPU и другие вычислительные ресурсы в единую инфраструктуру для ML-задач.
Над чем предстоит работать:
- проектировать и с нуля строить распределённую вычислительную платформу на ~1000 машин;
- развивать инфраструктуру на Kubernetes / Nomad для запуска и управления ML workload'ами;
- работать с GPU-кластерами и вычислительными ресурсами разных типов — GPU, CPU, MPS;
- развивать распределённые вычисления на Ray и инфраструктуру для distributed training;
- автоматизировать размещение и запуск задач, управление ресурсами и их загрузкой;
- заниматься масштабированием, производительностью, отказоустойчивостью, CI/CD и мониторингом;
- тесно работать с ML-командой над инфраструктурой для обучения и запуска нейросетей.
Что ожидает от кандидата:
- 3–5+ лет опыта в DevOps / MLOps / Platform Engineering;
- уверенный Kubernetes и/или Nomad;
- опыт работы с большими production-кластерами и распределёнными системами;
- практический опыт с GPU-инфраструктурой;
- понимание обучения нейросетей и distributed training;
- опыт с Docker / Docker Registry, CI/CD, Linux, мониторингом;
- опыт проектирования и создания инфраструктуры с нуля.
- будет большим плюсом опыт с HPC, суперкомпьютерами, GPU-фермами, Ray и крупными вычислительными кластерами.