Глобальный разработчик продуктов и решений на основе
разговорного искусственного интеллекта, машинного обучения
и компьютерного зрения
Технологический эксперт в области речевых технологий,
генеративного искусственного интеллекта, лицевой и голосовой
биометрии. В России решения ЦРТ работают в крупнейших
банках, телеком-компаниях, ТЭК, госсекторе, АПК «Безопасный
город». Технологии распознавания речи, голосовой биометрии
и выявления дипфейков, разработанные в ЦРТ, занимают
лидирующие позиции на российском рынке*.
-
лет на рынке технологий ИИ
-
сотрудников в штате компании
-
офиса: в Москве и Санкт-Петербурге
-
проектов по всему миру, в т.ч. проекты национального
масштаба
Мы запустили новый продукт - LLM-платформу для наших клиентов из госсектора и enterprise-сегмента и развиваем его.
Сейчас мы усиливаем усиливаем продуктовую команду и ищем
Ведущего инженера данных, который будет отвечать за организацию и подготовку данных для AI-решений (от подключения внешних источников и проектирования модели данных до подготовки данных для поиска и RAG).
КАКИЕ ЗАДАЧИ НЕОБХОДИМО РЕШАТЬ: - Определять источники данных для AI-решений: базы данных, документы, API, файловые хранилища, внешние системы и потоки обновлений
- Проектировать модели данных: сущности и связи, версии, метаданные, lineage, права доступа и правила актуализации
- Организовывать сбор и обработку данных из внешних источников: очистку, нормализацию, дедупликацию, классификацию и разметку
- Формировать единое эталонное представление объекта (golden record) при объединении данных из нескольких источников
- Подготавливать данные для поиска и RAG: chunking, embeddings, индексация, векторный и гибридный поиск
- Настраивать retrieval и reranking, обеспечивать обновление индексов при изменении исходных данных
- При необходимости готовить датасеты для обучения или дообучения моделей, если задача не решается с помощью RAG
- Определять показатели качества данных и retrieval, организовывать их мониторинг: полнота, актуальность, precision/recall, latency и другие показатели
- Взаимодействовать с LLM-инженерами, аналитиками и разработчиками при проектировании AI-решений
НАШИ ОЖИДАНИЯ:
- От 4 лет опыта в Data Engineering, Data Platform, Data Architecture или смежной области
- Уверенное знание SQL и реляционных баз данных
- Опыт построения ETL/ELT-процессов и data pipelines
- Опыт интеграции данных из различных источников: БД, API, файлов и внешних систем
- Практический опыт проектирования моделей данных и работы с качеством данных, метаданными и версиями
- Опыт работы с большими объёмами данных
- Практический опыт подготовки данных для поиска, ML или LLM/RAG-систем
- Понимание принципов chunking, embeddings, vector search и hybrid search
- Опыт работы с векторными хранилищами или поисковыми системами
- Умение самостоятельно разбираться в структуре и качестве новых источников данных
БУДЕТ ПЛЮСОМ:
- Опыт разработки и эксплуатации RAG-систем в production
- Опыт оптимизации retrieval и reranking
- Python для обработки данных и разработки data pipelines
- Kafka или другие системы потоковой обработки данных
- Airflow или аналогичные инструменты оркестрации
- PostgreSQL, ClickHouse, Elasticsearch/OpenSearch, векторные хранилища и аналогичные технологии
- Опыт подготовки датасетов для supervised learning / fine-tuning
- Понимание метрик оценки RAG: retrieval quality, groundedness, faithfulness, coverage
Аккредитованная ИТ‑компания
Сильная команда профессионалов, амбициозные задачи
и масштабные проекты
ДМС с первого дня и льготное страхование
для близких
Корпоративное обучение и конференции за счет компании,
доступ к образовательной платформе
Бесплатная подписка Прайм+
Программа наставничества для профессиональной адаптации
новых сотрудников
Спортивные занятия и активности в кругу
единомышленников
Бесплатное посещение Ленинградского зоопарка
*CNews Analytics, ComNews Awards, Хрустальная гарнитура, Коммерсантъ
и пр. за 2024–2026 гг.