Наша команда занимается офлайн-оценкой больших языковых моделей: как внутренних моделей Алисы, так и моделей других разработчиков. На заранее подготовленных наборах запросов мы проверяем, какие сильные и слабые стороны есть у каждой модели.
Для нас важно не только получить результаты оценки, но и обеспечить простоту самого процесса: запустить необходимые инструменты, если что-то идёт не так; разобраться в сбое; понять, что произошло с данными или логами, и сделать следующий запуск предсказуемее.
Прокачка моделей
Вам предстоит прокачивать наборы запросов через внутренние инструменты для оценки внутренних и внешних моделей.
Поддержка инструментов оценки
Вы будете настраивать и запускать внутренние инструменты оценки моделей, находить причины сбоев и исправлять то, что мешает работе. Также нужно будет развивать надстройки над инфраструктурой прокачки, чтобы другие аналитики могли легко делать то же самое.
Исследование новых моделей и данных
Вам нужно будет изучать особенности поведения новых моделей, разбирать непривычные данные и форматы логов. Здесь задачи меняются: вчера проблема была в данных Алисы, сегодня — в странном формате ответа новой модели, завтра — в инструменте оценки. Предстоит быстро погружаться в малознакомую систему и находить причину проблемы.
Помощь с улучшением процесса оценки
Замечать повторяющиеся ошибки, оформлять понятные баг-репорты и предлагать улучшения инструментов и процесса оценки — это также будет входить в ваши задачи.
Больше об аналитике в Яндексе — в канале Yandex for Analytics
Будьте осторожны: если работодатель просит войти через Google, iCloud или Госуслуги, прислать код или пароль, запустить ПО или перевести деньги — это мошенники.