Яндекс · Алиса

Разработчик инфраструктуры RL-обучения Alice AI LLM

Middle · Английский не нужен

Не указано: формат работы, география

Навыки

  • C++
  • CUDA / ONNX / TensorRT
  • Распределённые системы
  • Embedded
  • LLM
  • Инференс LLM
  • Machine Learning
Ещё 4
  • MLOps
  • Python
  • PyTorch
  • SRE-практики

О компании и продукте

  • Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLМ) моделей, которые используются в Алисе, Поиске, Рекламе и других сервисах Яндекса. Современное обучение таких моделей — это сложная система, которая включает десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать эту систему максимально эффективной, рационально используя вычислительные ресурсы и минимизируя риски сбоев
  • Наша команда работает на стыке ML-математики и «железной» инфраструктуры: мы должны понимать и особенности аппаратного обеспечения (GPU, сети, шины данных, диски, память), и нюансы самого процесса обучения: составные части, взаимодействие компонентов, узкие места. Один из популярных подходов к обучению LLM — обучение с подкреплением, Reinforcement Learning, RL

Задачи

  • Разработчик инфраструктуры RL-обучения Alice AI LLM
  • Обучение моделей превратилось в задачу управления сложными распределёнными системами
  • Нужно обеспечивать отказоустойчивость, эффективную доставку данных и минимизировать задержки в коммуникациях
  • Чем сложнее система, тем больше точек отказа, а чем больше ресурсов нужно на обучение, тем выше накладные расходы на запуск
  • С ростом популярности этого метода появляются всё более сложные подходы, увеличивается потребность в вычислительных ресурсах — и, как следствие, возникает необходимость строить специализированную инфраструктуру
  • Какие задачи вас ждут Оптимизация инфраструктуры RL-обучения
  • Вам предстоит улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, оптимизировать коммуникации между блоками обучения, повышать эффективность работы внутри блоков
  • Развитие инструментов диагностики
  • Вы будете создавать и совершенствовать инструменты, которые позволят быстро выявлять и устранять инфраструктурные проблемы
  • Повышение отказоустойчивости инфраструктуры
  • Предстоит реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к различным ошибкам и сбоям
  • Исследование и внедрение современных решений
  • Будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность и внедрять в реальные проекты
  • Больше о бэкенде в Яндексе — в канале Yandex for Backend

Требования

  • Знаете Python и имеете опыт системного программирования, разработки библиотек или фреймворков
  • Хорошо знакомы и работали на практике с фреймворком PyTorch и распределённым обучением через torch.distributed
  • Владеете подходами параллелизации: понимаете data parallelism, tensor parallelism, pipeline parallelism, expert parallelism для распределённого инференса или обучения
  • Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшне
  • Умеете эффективно работать в команде и делиться знаниями
  • От 3 лет
  • Владеете C++ и имеете опыт низкоуровневого программирования и оптимизации
  • Имеете опыт с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton

Будет плюсом

  • Участвовали в создании инфраструктуры обучения ML-моделей
  • Внедряли и оптимизировали RL-решения
  • Работали с библиотеками RL-обучения для LLM: veRL, slime, NeMo-RL, SkyRL и другими, а также с библиотеками инференса: vLLM, SGLang и TRTLLM
  • Как в Яндексе проходят алгоритмические секции собеседований
  • Как мы нанимаем бэкенд-разработчиков
  • Задачи для подготовки к собеседованиям

Паспорт вакансии

История публикации

Появилась в Вакандии27 дней
Перепубликациинетпубликовалась один раз
Проверяли на источникеВидели сегодня
Среди похожихНет данныху карточки не хватает полей, чтобы найти похожие

Откуда что взялось

Отмечено то, что вывели мы. Без пометки — значение назвал работодатель.

ГрейдMiddleвыведено из другого признака
Формат работыне указан
Географияне указана
Зарплатане указана

Почему на этом месте в выдаче

Порядок выдачи объявлен контрактом: свежесть решает между днями, полнота и зарплата — внутри дня.

Полнота карточки251 из 4 полей: грейд, формат, география, зарплата
Зарплата названа0вилки нет вовсе

Проверка Вакандии

Источники и свежесть

Тип источника
Карьерный сайт работодателя
Найдено публикаций
1
Посмотреть публикации и даты
  • careerОсновная публикация · 2026-05-28

Работодатель

Яндекс

50 активных вакансий · вилка работодателя указана в 1%

Открыть профиль компании

Безопасность

Отклик уходит на сайт источника

Вакандия показывает вакансию, но не отправляет отклик и не проверяет работодателя. Сам отклик вы оставляете на внешнем сайтеyandex.ru.

Признаки мошенничества
  • Просят предоплату, «залог» или деньги за обучение и оборудование.
  • Требуют код из SMS, данные банковской карты или доступ к «Госуслугам».
  • Быстро уводят в мессенджер и торопят с решением.
  • Обещают большой доход без опыта и без деталей задач.

Настоящий работодатель не просит денег и платёжных данных до трудоустройства.

Продолжить поиск

Похожие вакансии

Причина сходства указана на каждой карточке

  1. Почему похожа: похожая специализация · тот же грейд

    CSSSR

    DevOps-инженер

    • Middle
    • Удалённо
    Подробнее