Яндекс · Алиса
Разработчик инфраструктуры RL-обучения Alice AI LLM
Навыки
- C++
- CUDA / ONNX / TensorRT
- Распределённые системы
- Embedded
- LLM
- Инференс LLM
- Machine Learning
Ещё 4
- MLOps
- Python
- PyTorch
- SRE-практики
О компании и продукте
- Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLМ) моделей, которые используются в Алисе, Поиске, Рекламе и других сервисах Яндекса. Современное обучение таких моделей — это сложная система, которая включает десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать эту систему максимально эффективной, рационально используя вычислительные ресурсы и минимизируя риски сбоев
- Наша команда работает на стыке ML-математики и «железной» инфраструктуры: мы должны понимать и особенности аппаратного обеспечения (GPU, сети, шины данных, диски, память), и нюансы самого процесса обучения: составные части, взаимодействие компонентов, узкие места. Один из популярных подходов к обучению LLM — обучение с подкреплением, Reinforcement Learning, RL
Задачи
- Разработчик инфраструктуры RL-обучения Alice AI LLM
- Обучение моделей превратилось в задачу управления сложными распределёнными системами
- Нужно обеспечивать отказоустойчивость, эффективную доставку данных и минимизировать задержки в коммуникациях
- Чем сложнее система, тем больше точек отказа, а чем больше ресурсов нужно на обучение, тем выше накладные расходы на запуск
- С ростом популярности этого метода появляются всё более сложные подходы, увеличивается потребность в вычислительных ресурсах — и, как следствие, возникает необходимость строить специализированную инфраструктуру
- Какие задачи вас ждут Оптимизация инфраструктуры RL-обучения
- Вам предстоит улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, оптимизировать коммуникации между блоками обучения, повышать эффективность работы внутри блоков
- Развитие инструментов диагностики
- Вы будете создавать и совершенствовать инструменты, которые позволят быстро выявлять и устранять инфраструктурные проблемы
- Повышение отказоустойчивости инфраструктуры
- Предстоит реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к различным ошибкам и сбоям
- Исследование и внедрение современных решений
- Будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность и внедрять в реальные проекты
- Больше о бэкенде в Яндексе — в канале Yandex for Backend
Требования
- Знаете Python и имеете опыт системного программирования, разработки библиотек или фреймворков
- Хорошо знакомы и работали на практике с фреймворком PyTorch и распределённым обучением через torch.distributed
- Владеете подходами параллелизации: понимаете data parallelism, tensor parallelism, pipeline parallelism, expert parallelism для распределённого инференса или обучения
- Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшне
- Умеете эффективно работать в команде и делиться знаниями
- От 3 лет
- Владеете C++ и имеете опыт низкоуровневого программирования и оптимизации
- Имеете опыт с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton
Будет плюсом
- Участвовали в создании инфраструктуры обучения ML-моделей
- Внедряли и оптимизировали RL-решения
- Работали с библиотеками RL-обучения для LLM: veRL, slime, NeMo-RL, SkyRL и другими, а также с библиотеками инференса: vLLM, SGLang и TRTLLM
- Как в Яндексе проходят алгоритмические секции собеседований
- Как мы нанимаем бэкенд-разработчиков
- Задачи для подготовки к собеседованиям
Паспорт вакансии
История публикации
Появилась в Вакандии27 дней
Перепубликациинетпубликовалась один раз
Проверяли на источникеВидели сегодня
Среди похожихНет данныху карточки не хватает полей, чтобы найти похожие
Откуда что взялось
Отмечено то, что вывели мы. Без пометки — значение назвал работодатель.
ГрейдMiddleвыведено из другого признака
Формат работыне указан
Географияне указана
Зарплатане указана
Почему на этом месте в выдаче
Порядок выдачи объявлен контрактом: свежесть решает между днями, полнота и зарплата — внутри дня.
Полнота карточки251 из 4 полей: грейд, формат, география, зарплата
Зарплата названа0вилки нет вовсе
Проверка Вакандии
Источники и свежесть
- Тип источника
- Карьерный сайт работодателя
- Найдено публикаций
- 1
Посмотреть публикации и даты
- careerОсновная публикация · 2026-05-28
Безопасность
Отклик уходит на сайт источника
Вакандия показывает вакансию, но не отправляет отклик и не проверяет работодателя. Сам отклик вы оставляете на внешнем сайте — yandex.ru.
Признаки мошенничества
- Просят предоплату, «залог» или деньги за обучение и оборудование.
- Требуют код из SMS, данные банковской карты или доступ к «Госуслугам».
- Быстро уводят в мессенджер и торопят с решением.
- Обещают большой доход без опыта и без деталей задач.
Настоящий работодатель не просит денег и платёжных данных до трудоустройства.
Продолжить поиск
Похожие вакансии
Причина сходства указана на каждой карточке
Подробнее - Подробнее
Почему похожа: похожая специализация
Fabrique — Python-разработчик (Django, DRF)
- Junior
- Удалённо из России
- Москва, Россия