17 августа 2026 • г Москва • ПАО Сбербанк • Информационные технологии:Дата-сайентист
Мы - команда Disrupt в Сбере, часть блока ГенИИ. Отвечаем за все новые воплощения Гиги на рынках и работаем в формате фабрики гипотез: ищем перспективные сценарии, запускаем MVP, масштабируем лучшие продукты.
Задачи
Запускать и поддерживать распределённый инференс LLM на кластере GPU
Тюнить движки (vLLM, SGLang, TensorRT-LLM или аналоги) для максимальной скорости и утилизации железа
Снижать задержки генерации, повышать пропускную способность и эффективно работать с длинным контекстом в MoE-моделях
Применять квантизацию (FP8/INT8), speculative decoding и другие оптимизации без потери качества ответов
Находить узкие места по памяти (VRAM/HBM) и сети (NVLink/InfiniBand), устранять OOM и сбои узлов
Упаковывать сервисы в Kubernetes/Docker, настраивать автоскейлинг, выкаты и откаты
Строить мониторинг метрик вывода (задержки, токены/сек, стоимость за 1М токенов)
Проводить нагрузочное тестирование и планировать мощности
Требования
От двух лет опыта в ML Engineering, MLOps или высоконагруженном бэкенде. Обязательно хотя бы один свой GPU-сервис, доведенный до продакшена
Уверенное владение Python и Linux. Знание Docker, Git, CI/CD и базовая работа с Kubernetes
Практический опыт запуска моделей на PyTorch под NVIDIA GPU
Опыт работы минимум с одним production-стеком для инференса (vLLM, Triton, TensorRT-LLM, SGLang, TGI или аналоги)
Понимание того, как устроена память GPU, что такое mixed precision, батчинг, KV-кэш и параллелизм моделей
Умение замерять производительность, читать профилировщики (PyTorch Profiler, Nsight, DCGM) и находить баланс между скоростью, качеством ответов и стоимостью вывода
Базовое понимание распределенных систем: таймауты, повторы запросов, отказоустойчивость при падении узла и выкат без простоев
Будет плюсом
Умение писать CUDA/Triton kernels, работать с NCCL и быстрой связкой узлов (NVLink/InfiniBand, GPUDirect/RDMA)
Опыт запуска MoE-моделей с экспертным параллелизмом и очень длинным контекстом
Знакомство с KServe или Ray Serve
сбор метрик через Prometheus/Grafana, GPU Operator или DCGM Exporter
Навыки конвертации весов моделей, проведения quantization-aware evaluation и сравнения разных движков инференса
Базовый C++ или Go для написания быстрых компонентов control/data plane
Условия
комфортный современный офис рядом с м. Кутузовская
ежегодный пересмотр зарплаты, годовая премия
корпоративный спортзал и зоны отдыха
система обучения для профессионального и карьерного развития
расширенный полис ДМС с первого дня работы и страхование для семьи
льготная программа ипотеки для сотрудников
бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
вознаграждение за рекомендацию друзей в команду Сбера
Паспорт вакансии
История публикации
Появилась в Вакандии26 дней
Перепубликациинетпубликовалась один раз
Проверяли на источникеВидели сегодня
Среди похожихНет данныху карточки не хватает полей, чтобы найти похожие
Откуда что взялось
Отмечено то, что вывели мы. Без пометки — значение назвал работодатель.
Грейдне указан
Формат работыОфисвычитано из текста вакансии
ГеографияМосква, Россиявычитано из текста вакансии
Зарплата≈ 250 000 RUB в месяцнаша оценка, в вакансии не названа
Почему на этом месте в выдаче
Порядок выдачи объявлен контрактом: свежесть решает между днями, полнота и зарплата — внутри дня.
Полнота карточки753 из 4 полей: грейд, формат, география, зарплата
Зарплата названа0вилки работодателя нет, показана наша оценка
Проверка Вакандии
Источники и свежесть
Тип источника
Карьерный сайт работодателя
Найдено публикаций
1
Посмотреть публикации и даты
careerОсновная публикация · дата неизвестна
С
Работодатель
Сбер
50 активных вакансий · вилка работодателя указана в 37%