Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat
Гибрид · Москва, Россия · Английский не нужен
Не указано: грейд
Навыки
Самостоятельность
Code review
EdTech
Дообучение моделей
LLM
Инференс LLM
Machine Learning
Ещё 3
Ответственность за результат
Python
PyTorch
О компании и продукте
Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat
22 июля 2026 • г Москва • ПАО Сбербанк • Информационные технологии:Программист, разработчик
Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели.
Задачи
разрабатывать и улучшать методы online RL
реализовывать и дорабатывать подходы post-training и online RL
проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин
разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач
следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру
строить и развивать инфраструктуру обучения
разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели
обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций
оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест
выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять
работать с данными и системой оценки качества
участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки
строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек
анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения
тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры
брать на себя ответственность за целые куски системы: от идеи до результата в проде
делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества
отличное владение Python и PyTorch
практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях
опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы
понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги
Умение писать чистый, надёжный, production-ready код
способность разбираться в сложных системах и самостоятельно находить и устранять узкие места
Будет плюсом
опыт работы с reward-моделями, process reward models, LLM-as-a-judge
опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач
опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang и т.д.)
понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL и др.)
публикации, open-source вклад или сильный прикладной track record
Условия
возможность выбрать удобный формат работы: гибрид или офис
ежегодный пересмотр зарплаты, годовая премия
корпоративный спортзал и зоны отдыха
более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
ипотека выгоднее до 7% для каждого сотрудника
бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
вознаграждение за рекомендацию друзей в команду Сбера
Паспорт вакансии
История публикации
Появилась в Вакандии26 дней
Перепубликациинетпубликовалась один раз
Проверяли на источникеВидели 25 дней назад
Среди похожихНет данныху карточки не хватает полей, чтобы найти похожие
Откуда что взялось
Отмечено то, что вывели мы. Без пометки — значение назвал работодатель.
Грейдне указан
Формат работыГибридвычитано из текста вакансии
ГеографияМосква, Россиявычитано из текста вакансии
Зарплатане указана
Почему на этом месте в выдаче
Порядок выдачи объявлен контрактом: свежесть решает между днями, полнота и зарплата — внутри дня.
Полнота карточки502 из 4 полей: грейд, формат, география, зарплата
Зарплата названа0вилки нет вовсе
Проверка Вакандии
Источники и свежесть
Тип источника
Карьерный сайт работодателя
Найдено публикаций
1
Посмотреть публикации и даты
careerОсновная публикация · дата неизвестна
С
Работодатель
Сбер
50 активных вакансий · вилка работодателя указана в 37%