Она соединяет возможности нейросетей, учитывает пользовательский контекст и живет в разных сервисах и устройствах.
Вокруг Алисы мы создаём единый опыт на стыке софта, моделей и железа: ассистент рассуждает, ведёт диалог в чате, выбирает нужные инструменты и помогает пользователю в повседневных сценариях. А умные устройства становятся частью этого опыта — чтобы управление было естественным, сценарии выполнялись надёжно, а взаимодействие с агентом было бесшовным.
УсловияИнференс LLM в масштабе — это сложная инфраструктурная задача: GPU работают на пределе, возникают сетевые задержки, возможны сбои оборудования. Мы создаём решения, чтобы эти события минимально влияли на доступность и latency нашего сервиса инференса.
Какие задачи вас ждут:
Оптимизация инференсных движков
Вам предстоит повышать эффективность и снижать latency при выполнении LLM-инференса на GPU.
Развитие инструментов диагностики
Вы будете создавать и улучшать инструменты для быстрого выявления и устранения инфраструктурных проблем, которые влияют на стабильность и скорость инференса.
Исследование и внедрение
Вам предстоит работать с методами оптимизации инференса (квантованием, прунингом) и современными подходами к параллелизацииБудьте осторожны: если работодатель просит войти через Google, iCloud или Госуслуги, прислать код или пароль, запустить ПО или перевести деньги — это мошенники.