Мы ищем опытного ML/NLP разработчика для работы над сложной диалоговой системой и голосовым пайплайном. Вашей главной задачей станет эволюция нашего продукта: поэтапный переход от классических графовых сценариев к современному LLM-based диалогу, а также глубокая оптимизация речевого стека (ASR/TTS) под low-latency.
Чем предстоит заниматься:
Развитие диалогового движка: Поэтапный перевод системы с графа сценариев и скиллов на управляемый LLM-based диалог.
Траблшутинг и дебаг: Работа с голосовым пайплайном — поиск и устранение причин high latency, галлюцинаций LLM, проблем с передачей аудио и графовых ошибок.
Архитектура: Оперативное принятие архитектурных решений и их самостоятельная реализация в коде.
Работа с NLP-стеком:
Поддержка и быстрая отладка few-shot классификации сценариев (на базе Qwen) и классификаторов на BERT.
Учёт краевых случаев, исправление ошибочных срабатываний интентов.
Finetuning локальных LLM для специфических задач (извлечение сущностей, строгое следование инструкциям).
Работа с речевым стеком:
Интеграция и поддержка ASR (на базе GigaAMv2), отладка качества распознавания, работы VAD и стриминга текста.
Дообучение и настройка инференса собственных и open-source TTS, а также систем клонирования голоса для достижения идеального звучания и высокой скорости работы.
Наши ожидания (Hard Skills):
NLP и LLM:
Уверенный опыт работы с LLM/SLM (Few-shot learning, Prompt engineering) и BERT.
Практический опыт finetuning LLM (PEFT, LoRA/QLoRA) под узкие прикладные задачи.
Уверенный дебаг LLM: умение быстро понять причину некорректного ответа и исправить её промптом, гиперпараметрами или дообучением.
Голосовой стек: Опыт дообучения и оптимизации TTS-моделей; опыт работы и интеграции современных ASR-систем.
Диалоговые системы: Опыт работы как с графовыми/сценарийными движками, так и с LLM-агентами. Высокая скорость диагностики проблем в инференсе.
Backend и Оптимизация (Python + Go):
Уверенное владение Python (PyTorch, HuggingFace, фреймворки инференса).
Опыт оптимизации инференса под low-latency (vLLM, TensorRT-LLM, Triton Inference Server, ONNX Runtime).
Практика работы с потоковым аудио в реальном времени (streaming ASR/TTS, gRPC-контракты).
GoLang:
Понимание дизайна сервисов и принципов SOLID, DRY, KISS.
Знание базовых типов (строки, числа, слайсы, мапы) и работы с указателями.
Уверенная работа с примитивами синхронизации и конкурентностью (горутины, каналы).
Понимание принципов Observability.
Будет плюсом:
Опыт работы с gRPC.
Умение настраивать инфраструктуру, опыт работы с k8s/inventory.
Глубокое понимание принципов работы TCP.
Будьте осторожны: если работодатель просит войти через Google, iCloud или Госуслуги, прислать код или пароль, запустить ПО или перевести деньги — это мошенники.