Сбер

MLE (Online RL) / Post-Training LLM (Middle+ / Senior)

Senior · Офис · Москва, Россия · Английский не нужен

Навыки

  • Самостоятельность
  • Code review
  • Дообучение моделей
  • Финтех и платежи
  • LLM
  • Инференс LLM
  • Machine Learning
Ещё 4
  • Ответственность за результат
  • 152-ФЗ / персональные данные
  • Python
  • PyTorch

О компании и продукте

  • Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат.

Задачи

  • Разрабатывать и улучшать методы online RL
  • Реализовывать и дорабатывать подходы post-training и online RL
  • Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин
  • Разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач
  • Следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру
  • Строить и развивать инфраструктуру обучения
  • Разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели
  • Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций
  • Оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест
  • Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять
  • Участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки
  • Строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек
  • Анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения
  • Тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры
  • Брать на себя ответственность за целые куски системы: от идеи до результата в проде
  • Делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества

Требования

  • Отличное владение Python и PyTorch
  • Практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях
  • Опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы
  • Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги
  • Умение писать чистый, надёжный, production-ready код
  • Способность разбираться в сложных системах и самостоятельно находить и устранять узкие места

Будет плюсом

  • Опыт работы с reward-моделями, process reward models, LLM-as-a-judge
  • Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач
  • Опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang и т.д.)
  • Понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL и др.)
  • Публикации, open-source вклад или сильный прикладной track record

Условия

  • Сильные и сложные задачи на переднем крае развития русскоязычных LLM
  • Прямое влияние на качество модели: результаты твоей работы видны в бенчмарках и в продукте
  • Команду сильных инженеров и исследователей, у которых есть чему поучиться
  • Возможность совмещать инженерную и исследовательскую работу
  • Конкурентную компенсацию, премии и расширенный соцпакет

Паспорт вакансии

История публикации

Появилась в Вакандии28 дней
Перепубликациинетпубликовалась один раз
Проверяли на источникеВидели 28 дней назад
Среди похожихНет данных60 из 30 · у похожих вакансий почти одинаковый возраст — сравнивать нечего

Откуда что взялось

Отмечено то, что вывели мы. Без пометки — значение назвал работодатель.

ГрейдSeniorвычитано из текста вакансии
Формат работыОфисвычитано из текста вакансии
ГеографияМосква, Россиявычитано из текста вакансии
Зарплатане указана

Почему на этом месте в выдаче

Порядок выдачи объявлен контрактом: свежесть решает между днями, полнота и зарплата — внутри дня.

Полнота карточки753 из 4 полей: грейд, формат, география, зарплата
Зарплата названа0вилки нет вовсе

Проверка Вакандии

Источники и свежесть

Тип источника
Агрегатор вакансий
Найдено публикаций
1
Посмотреть публикации и даты
  • getmatchОсновная публикация · 2026-07-31

Работодатель

Сбер

50 активных вакансий · вилка работодателя указана в 37%

Открыть профиль компании

Безопасность

Отклик уходит на сайт источника

Вакандия показывает вакансию, но не отправляет отклик и не проверяет работодателя. Сам отклик вы оставляете на внешнем сайтеgetmatch.ru.

Признаки мошенничества
  • Просят предоплату, «залог» или деньги за обучение и оборудование.
  • Требуют код из SMS, данные банковской карты или доступ к «Госуслугам».
  • Быстро уводят в мессенджер и торопят с решением.
  • Обещают большой доход без опыта и без деталей задач.

Настоящий работодатель не просит денег и платёжных данных до трудоустройства.

Продолжить поиск

Похожие вакансии

Причина сходства указана на каждой карточке