DevOps / SRE-инженер в платформу ИИ-агентов
Удалённо · проект/контракт на 3–6 месяцев с возможностью продления
О проекте
Мы создаём платформу для бизнеса: на ней создают, обучают и ведут ИИ-агентов — виртуальных администраторов, менеджеров, хостес и других сотрудников, которые берут на себя клиентское общение, продажи и контроль.
Сейчас продукт тестируется в реальном бизнес-контуре. Первые агенты работают в IT, продажах и бьюти-сфере, дальше — стоматологии, автосервисы, клиники и другие направления. Продукт ориентирован на рынок США, им пользуются живые люди.
О роли
Вы возьмёте на себя инфраструктуру, релизы и надёжность платформы: серверы, контейнеры, базы данных, CI/CD. Работать будете вместе с командой разработки и напрямую влиять на то, насколько стабильно и безопасно продукт работает каждый день.
Первым этапом будет аудит: инвентаризация сервисов, хостов, зависимостей, секретов и единых точек отказа, отчёт с приоритетами и сметой. Дальше — релизный процесс, безопасность и отказоустойчивость.
Чем предстоит заниматься
- Провести аудит инфраструктуры: разобрать сервисы, хосты, зависимости, секреты и единые точки отказа; оформить проблемы с приоритетами, трудозатратами и стоимостью решения.
- Наладить релизы: версионирование, сборка неизменяемых Docker-образов, проверка именно того артефакта, который едет в прод, выкатка и откат одной командой.
- Заняться безопасностью: секреты и их ротация, доступы и принцип наименьших привилегий, firewall, сканирование уязвимостей, подписи образов.
- Сделать систему отказоустойчивой: репликация PostgreSQL, восстановление на точку времени, второй узел приложения, балансировка, отказоустойчивые очереди и кеш.
- Настроить мониторинг и алерты: Prometheus, Grafana, Alertmanager, контроль бэкапов, репликации и свободного места на дисках.
- Взаимодействовать с командой: объяснять решения разработчикам и заказчику, писать runbook'и, чтобы операцию мог повторить дежурный без автора.
Что мы ждём
- От 5 лет опыта в DevOps/SRE/инфраструктуре, значительная часть — на продакшене с реальными пользователями.
- Docker и Docker Compose в мультисервисных конфигурациях, несколько хостов и окружений (dev/prod).
- PostgreSQL на прод-нагрузке: бэкапы, восстановление, потоковая репликация, WAL-архивация и PITR.
- Redis и RabbitMQ: персистентность, репликация, отказоустойчивые очереди.
- CI/CD без GitHub Actions (Woodpecker, Jenkins, GitLab CI) и OCI-реестры с пиннингом образов по digest.
- Управление секретами (docker secrets, SOPS/age, Vault) и ротация ключей без потери данных.
- Linux-hardening, firewall, least privilege, SSH-доступы и их отзыв.
- Мониторинг и алертинг: Prometheus, Grafana, Alertmanager, разбор инцидентов и post-mortem.
- Уверенный Bash и умение читать чужой код и конфигурации.
Будет плюсом
- Python для инфраструктурных скриптов и проверок.
- Ansible, Terraform/OpenTofu для воспроизводимого провижининга.
- Kubernetes и GitOps (Argo CD, Flux).
- Телефония: Asterisk, SIP, RTP, WebRTC, coturn.
- Опыт миграции с одного хоста на отказоустойчивую схему без длительного простоя.
- Нагрузочное тестирование (k6, Locust).
- Понимание требований GDPR и работы с персональными данными.
- Понимание AI/LLM-стека: LLM-шлюзы, RAG, векторные базы данных.
- IT-образование или смежная специальность, сертификаты (RHCE, CKA, AWS/Azure).
Вам не подойдёт эта роль, если
- вам нужен подробный список задач или вы работаете только «по ТЗ»;
- вы считаете, что «это не моя зона ответственности»;
- вы постоянно ждёте менеджера;
- вы не умеете работать в неопределённости;
- вам важнее стабильность, чем скорость и рост;
- вы хотите просто обменивать часы на зарплату.
Условия
- Удалённая работа, оплата в любую точку мира.
- Проектная работа / контракт на 3–6 месяцев с возможностью продления.
- Испытательный срок 2 месяца: оцениваем результат, который получим на выделенное время.
- Небольшая команда, прямая коммуникация без бюрократии.
- Возможность влиять на архитектуру, выбирать инструменты и выстраивать инфраструктуру от аудита до отказоустойчивого контура.
- Участие в создании нового инструмента для автоматизации клиентских продаж.
Как откликнуться
В сопроводительном письме опишите релевантный опыт и напишите фразу: «хочу в команду».
Ключевые навыки: Linux, Docker, Docker Compose, PostgreSQL, Redis, RabbitMQ, CI/CD, GitLab CI, Jenkins, Ansible, Prometheus, Grafana, Alertmanager, Bash, Python, Git, Nginx, Traefik, HAProxy, Patroni, pgBackRest, WAL-G, HashiCorp Vault, Trivy, Cosign, OCI-реестры