Качественные данные — основа машинного обучения. От того, насколько датасет полон, точен, репрезентативен и актуален, напрямую зависит качество модели в продукте.
Мы создаём датасеты, которые помогают 2ГИС находить дорожные знаки, выделять здания на спутниковых снимках, отличать фотографии меню от интерьеров и оценивать привлекательность контента. Работаем с задачами Computer Vision, NLP и AI.
Ищем менеджера по качеству данных, который будет отвечать за создание, развитие и валидацию датасетов для ML-моделей. Ты будешь проектировать процессы сбора и разметки данных, выстраивать контроль качества, автоматизировать повторяемые этапы и вместе с ML-командами улучшать данные на основе результатов моделей.
Чем предстоит заниматься
- проектировать, запускать и поддерживать процессы сбора, обработки, разметки и валидации данных;
- формулировать требования к датасетам совместно с командами Computer Vision, NLP и AI;
- определять критерии качества данных, организовывать проверки разметки и анализировать ошибки;
- оценивать скорость, стоимость и качество разметки; находить узкие места и улучшать процесс;
- проводить эксперименты с подходами к разметке, автоматизации и контролю качества, анализировать результаты и принимать решения на их основе;
- использовать LLM и другие инструменты автоматизации для ускорения подготовки и проверки данных;
- работать с асессорами и заказчиками: объяснять требования, собирать обратную связь, устранять проблемы в процессе;
- развивать типовые пайплайны и масштабировать успешные решения на новые задачи;
- поддерживать датасеты после запуска: расширять их при дрейфе данных, появлении новых сценариев и изменении требований к качеству модели;
- писать понятные инструкции для асессоров, правила разметки и промпты для LLM.
Мы ожидаем, что ты
- работал (а) с краудсорсинговыми проектами, разметкой данных или контролем качества разметки;
- умеешь декомпозировать неопределённую задачу на измеримый процесс: определить входные данные, правила, критерии приёмки и метрики качества;
- умеешь оценивать и сопоставлять качество, скорость и стоимость разных подходов к разметке;
- владеешь Python на уровне, достаточном для анализа данных, подготовки выборок и написания скриптов для автоматизации;
- умеешь формулировать и тестировать промпты для LLM, оценивать качество результатов и учитывать ограничения такого подхода;
- можешь вести несколько задач одновременно, расставлять приоритеты и прозрачно управлять ожиданиями;
- умеешь вовлекать нужных участников в решение задачи и объяснять сложные вещи понятным языком.
Будет плюсом, если ты
- знаком (а) с основными принципами машинного обучения и жизненным циклом ML-моделей;
- работал (а) с датасетами для задач Computer Vision, NLP или генеративного AI;
- знаешь HTML, CSS и JavaScript — это поможет при работе с интерфейсами и инструментами разметки;
- имеешь опыт разработки или доработки внутренних инструментов для разметки, валидации либо контроля качества данных;
- работал (а) с метриками качества разметки, inter-annotator agreement, аудитами ошибок или активным обучением.
Что важно знать
Мы не ждём совпадения со всеми пунктами. Если тебе близки задачи на стыке данных, процессов, качества и машинного обучения — откликайся. Для нас важны системное мышление, ответственность за результат и готовность разбираться в новых типах ML-задач.
Откликнуться
ОткликнутьсяМы используем cookies, чтобы сайт работал лучше.