Сбер

Senior RL-Engineer (GigaChat Vision)

Senior · Гибрид · Москва, Россия · Английский не нужен

Навыки

  • Аналитическое мышление
  • Самостоятельность
  • Code review
  • Анализ данных
  • EdTech
  • Дообучение моделей
  • Финтех и платежи
Ещё 6
  • Лидерство
  • LLM
  • Machine Learning
  • 152-ФЗ / персональные данные
  • Работа со стейкхолдерами
  • Управление командой

О компании и продукте

  • Первый этап отбора на эту вакансию — общение с AI-рекрутером. После отклика вам на почту и в чат на платформе HeadHunter придет приглашение пройти первичное интервью с ГигаРекрутером в Telegram. Диалог займёт примерно 10 минут. Его задача — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. ГигаРекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным!

Задачи

  • Разрабатывать и улучшать RL-подходы для обучения VLM/LLM-моделей: выбор алгоритмов, постановка экспериментов и анализ результатов
  • Проектировать reward-функции и пайплайны обучения, выстраивать стратегии масштабирования под разные домены и сценарии, напрямую влияя на метрики качества
  • Определять требования к данным для RL: участвовать в построении пайплайнов сбора, фильтрации и подготовки датасетов
  • Развивать систему оценки reasoning-качества: внедрять и улучшать метрики в существующем eval-фреймворке, предлагать новые способы измерения качества под новые возможности модели
  • Работать на стыке с Pretrain / SFT / Infra: обеспечивать согласованность решений и перенос экспериментов в продакшн-пайплайн
  • Следить за состоянием области и переводить свежие идеи из статей в проверяемые эксперименты и инженерные решения
  • Глубоко погружаться в технические задачи: дебажить эксперименты, разбирать аномалии в обучении, находить узкие места и доводить решения до результата
  • Делиться экспертизой с командой: участвовать в код-ревью, помогать улучшать качество решений и подходы к экспериментам
  • Развивать инфраструктуру для RL

Требования

  • Глубокое понимание RL для LLM/VLM (RLHF, GRPO, PPO) и практический опыт
  • Понимание полного цикла обучения VLM/LLM (pretrain → SFT → RL) и того, как решения на каждом этапе влияют на финальные метрики
  • Опыт с распределённым обучением (DeepSpeed, FSDP) и inference-фреймворками
  • Сильный практический опыт постановки, проведения и анализа RL-экспериментов
  • Умение работать в условиях неопределённости и самостоятельно двигать сложные технические задачи
  • Умение выстраивать процессы в условиях неопределённости
  • Опыт взаимодействия со смежными командами и стейкхолдерами
  • Системное мышление: способность видеть картину целиком — от данных и reward-дизайна до eval и продакшн-метрик

Будет плюсом

  • Опыт менторинга или технического лидерства в рамках отдельных проектов
  • Публикации или open-source вклад в области RL/LLM/VLM
  • Опыт вывода RL-обученных моделей в продакшн и поддержки их качества

Условия

  • Крупнейшее DS&AI community — более 600 DS-специалистов банка
  • Дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира
  • Возможность быть соавтором НИРов и статей для международных конференций
  • Возможность выбрать удобный формат работы: гибрид или офис
  • Ежегодный пересмотр зарплаты, годовая премия
  • Корпоративный спортзал и зоны отдыха
  • Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • Ипотека выгоднее до 7% для каждого сотрудника
  • Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
  • Вознаграждение за рекомендацию друзей в команду Сбера

Паспорт вакансии

История публикации

Появилась в Вакандии28 дней
Перепубликации1 разпубликаций всего: 2
Проверяли на источникеВидели 28 дней назад
Среди похожихНет данных198 из 30 · у похожих вакансий почти одинаковый возраст — сравнивать нечего

Откуда что взялось

Отмечено то, что вывели мы. Без пометки — значение назвал работодатель.

ГрейдSeniorвычитано из текста вакансии
Формат работыГибридвычитано из текста вакансии
ГеографияМосква, Россиявычитано из текста вакансии
Зарплата≈ 371 820 RUB в месяцнаша оценка, в вакансии не названа

Почему на этом месте в выдаче

Порядок выдачи объявлен контрактом: свежесть решает между днями, полнота и зарплата — внутри дня.

Полнота карточки1004 из 4 полей: грейд, формат, география, зарплата
Зарплата названа0вилки работодателя нет, показана наша оценка

Проверка Вакандии

Источники и свежесть

Тип источника
Агрегатор вакансий
Найдено публикаций
2
Посмотреть публикации и даты
  • getmatchПовторная публикация · 2026-08-14
  • getmatchОсновная публикация · 2026-08-15

Работодатель

Сбер

50 активных вакансий · вилка работодателя указана в 37%

Открыть профиль компании

Безопасность

Отклик уходит на сайт источника

Вакандия показывает вакансию, но не отправляет отклик и не проверяет работодателя. Сам отклик вы оставляете на внешнем сайтеgetmatch.ru.

Признаки мошенничества
  • Просят предоплату, «залог» или деньги за обучение и оборудование.
  • Требуют код из SMS, данные банковской карты или доступ к «Госуслугам».
  • Быстро уводят в мессенджер и торопят с решением.
  • Обещают большой доход без опыта и без деталей задач.

Настоящий работодатель не просит денег и платёжных данных до трудоустройства.

Продолжить поиск

Похожие вакансии

Причина сходства указана на каждой карточке

  1. Почему похожа: похожая специализация · тот же грейд

    Gurtam

    Senior Python Developer – Vilnius

    • Senior
    • Гибрид
    • Вильнюс, Литва
    Подробнее