Наша команда развивает систему оценки Alice AI LLM — технологии, которая лежит в основе Алисы и других продуктов Яндекса. Нам важно понимать не только фактическую корректность ответов модели, но и то, насколько они полезны, естественны, уместно проявляют инициативу и учитывают контекст пользователя. Для оценки таких свойств мы создаём LLM-судей — модели, которые воспроизводят человеческие критерии качества.
Наши LLM-судьи уже используются для сбора обучающих данных и валидационных сравнений моделей. Сейчас мы строим единую систему их разработки и поддержки: следим за качеством существующих метрик, улучшаем их и добавляем новые аспекты оценки.
Почему у нас классно:
Создание и развитие LLM-судей
Вам предстоит проектировать схемы LLM-судей, экспериментировать с моделями и архитектурами, сравнивать подходы и проверять, насколько хорошо они воспроизводят человеческие критерии оценки.
Оценка и мониторинг качества
Вы будете проводить регулярные замеры на новых моделях и типах запросов, находить слабые места и систематические смещения, разбирать регрессии и проверять качество новых версий.
Развитие системы оценки
Вы начнёте добавлять новые аспекты и возможности оценки, превращать экспериментальные решения в воспроизводимые вычислительные графы для других команд.
Работа с исследованиями
Ждём, что вы будете следить за свежими статьями, разбираться в новых подходах к LLM-оценке и проверять их пользу на реальных задачах.
Больше об аналитике в Яндексе — в канале Yandex for Analytics
Будьте осторожны: если работодатель просит войти через Google, iCloud или Госуслуги, прислать код или пароль, запустить ПО или перевести деньги — это мошенники.