Сбер

Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat

Гибрид · Москва, Россия · Английский не нужен

Не указано: грейд

Навыки

  • Самостоятельность
  • Code review
  • EdTech
  • Дообучение моделей
  • LLM
  • Инференс LLM
  • Machine Learning
Ещё 3
  • Ответственность за результат
  • Python
  • PyTorch

О компании и продукте

  • Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat
  • 22 июля 2026 • г Москва • ПАО Сбербанк • Информационные технологии:Программист, разработчик
  • Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели.

Задачи

  • разрабатывать и улучшать методы online RL
  • реализовывать и дорабатывать подходы post-training и online RL
  • проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин
  • разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач
  • следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру
  • строить и развивать инфраструктуру обучения
  • разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели
  • обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций
  • оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест
  • выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять
  • работать с данными и системой оценки качества
  • участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки
  • строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек
  • анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения
  • тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры
  • брать на себя ответственность за целые куски системы: от идеи до результата в проде
  • делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества
  • отличное владение Python и PyTorch
  • практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях
  • опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы
  • понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги
  • Умение писать чистый, надёжный, production-ready код
  • способность разбираться в сложных системах и самостоятельно находить и устранять узкие места

Будет плюсом

  • опыт работы с reward-моделями, process reward models, LLM-as-a-judge
  • опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач
  • опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang и т.д.)
  • понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL и др.)
  • публикации, open-source вклад или сильный прикладной track record

Условия

  • возможность выбрать удобный формат работы: гибрид или офис
  • ежегодный пересмотр зарплаты, годовая премия
  • корпоративный спортзал и зоны отдыха
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • ипотека выгоднее до 7% для каждого сотрудника
  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера

Паспорт вакансии

История публикации

Появилась в Вакандии26 дней
Перепубликациинетпубликовалась один раз
Проверяли на источникеВидели 25 дней назад
Среди похожихНет данныху карточки не хватает полей, чтобы найти похожие

Откуда что взялось

Отмечено то, что вывели мы. Без пометки — значение назвал работодатель.

Грейдне указан
Формат работыГибридвычитано из текста вакансии
ГеографияМосква, Россиявычитано из текста вакансии
Зарплатане указана

Почему на этом месте в выдаче

Порядок выдачи объявлен контрактом: свежесть решает между днями, полнота и зарплата — внутри дня.

Полнота карточки502 из 4 полей: грейд, формат, география, зарплата
Зарплата названа0вилки нет вовсе

Проверка Вакандии

Источники и свежесть

Тип источника
Карьерный сайт работодателя
Найдено публикаций
1
Посмотреть публикации и даты
  • careerОсновная публикация · дата неизвестна

Работодатель

Сбер

50 активных вакансий · вилка работодателя указана в 37%

Открыть профиль компании

Безопасность

Отклик уходит на сайт источника

Вакандия показывает вакансию, но не отправляет отклик и не проверяет работодателя. Сам отклик вы оставляете на внешнем сайтеrabota.sber.ru.

Признаки мошенничества
  • Просят предоплату, «залог» или деньги за обучение и оборудование.
  • Требуют код из SMS, данные банковской карты или доступ к «Госуслугам».
  • Быстро уводят в мессенджер и торопят с решением.
  • Обещают большой доход без опыта и без деталей задач.

Настоящий работодатель не просит денег и платёжных данных до трудоустройства.

Продолжить поиск

Похожие вакансии

Причина сходства указана на каждой карточке