Сбер

Data Engineer for VLM Training Data (GigaChat Vision)

Гибрид · Москва, Россия · Английский не нужен

Не указано: грейд

Навыки

  • Атрибуция
  • Самостоятельность
  • Дашборды и витрины
  • Анализ данных
  • Data Quality
  • Дисциплина
  • Docker
Ещё 9
  • EdTech
  • Git
  • Machine Learning
  • MLOps
  • OCR
  • PostgreSQL
  • Python
  • S3 (объектное хранилище)
  • Статистика

О компании и продукте

  • Мы ищем Data Engineer, который будет отвечать за инфраструктуру, пайплайны и качество данных для обучения современных Vision-Language Models. Роль находится на стыке data engineering и ML: нужно будет работать с большими мультимодальными датасетами, понимать потребности исследователей и ML-инженеров, строить пайплайны очистки, фильтрации, категоризации и генерации данных, а также обеспечивать воспроизводимый экспорт данных в формат для обучения моделей.

Задачи

  • Собирать и структурировать потребности ML-команды в данных: какие данные нужны для обучения, дообучения, оценки и улучшения VLM
  • Предлагать и реализовывать идеи пайплайнов очистки, фильтрации, дедупликации, категоризации и генерации данных
  • Ориентироваться в современных практиках построения датасетов для Vision-Language Models: image-text pairs, synthetic data, filtering, quality scoring, data mixture design, dataset versioning
  • Отвечать за инфраструктуру хранения и подготовки данных, включая: импорт данных из различных источников: production, Common Crawl, open-source datasets, generated data
  • валидацию и контроль качества данных
  • хранение и версионирование датасетов
  • экспорт данных в форматы, пригодные для обучения моделей
  • Проектировать и реализовывать пайплайны обработки данных на большом масштабе, включая десятки миллиардов изображений
  • Разрабатывать пайплайны генерации синтетических данных для обучения и улучшения VLM
  • Собирать статистику по данным, строить отчёты и визуализации для анализа состава, качества и покрытия датасетов
  • Обеспечивать воспроизводимость, наблюдаемость и надёжность data-процессов
  • Работать в тесной связке с ML-инженерами, исследователями и инфраструктурной командой

Требования

  • Сильный опыт в data engineering и построении production-grade data pipelines
  • Уверенное владение Python, включая multiprocessing, multithreading и async-подходы
  • Опыт работы с большими объёмами данных и распределённой обработкой
  • Практический опыт с объектными хранилищами, в частности S3 или аналогами
  • Опыт работы с YTsaurus или похожими системами для распределённого хранения и обработки данных
  • Понимание принципов валидации, очистки, дедупликации и версионирования датасетов
  • Опыт работы с DVC, Git, Docker
  • Опыт работы с PostgreSQL или другими реляционными базами данных
  • Умение проектировать устойчивые пайплайны: от импорта данных до финального экспорта в training-ready формат
  • Способность самостоятельно разбираться в нечетко сформулированных задачах и доводить их до работающего решения
  • Готовность работать на стыке engineering и ML research

Будет плюсом

  • Опыт работы с мультимодальными данными: изображения, текст, image-text pairs, captions, OCR, metadata
  • Понимание того, как устроены современные датасеты для обучения VLM / LMM / multimodal models
  • Опыт построения пайплайнов для synthetic data generation
  • Опыт реализации quality scoring, filtering, semantic deduplication, clustering или data attribution
  • Опыт визуализации статистики по большим датасетам и построения внутренних аналитических дашбордов
  • Опыт работы с Common Crawl, LAION-подобными датасетами, open-source vision-language datasets
  • Базовое понимание ML training pipeline и того, как качество данных влияет на качество модели
  • СберПрайм+, скидки на продукты компаний-партнеров вознаграждение за рекомендацию друзей в команду Сбера

Условия

  • СберУниверситета для профессионального и карьерного развития расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа ипотека выгоднее до 7% для каждого сотрудника бесплатная подписка

Паспорт вакансии

История публикации

Появилась в Вакандии28 дней
Перепубликациинетпубликовалась один раз
Проверяли на источникеВидели 28 дней назад
Среди похожихНет данныху карточки не хватает полей, чтобы найти похожие

Откуда что взялось

Отмечено то, что вывели мы. Без пометки — значение назвал работодатель.

Грейдне указан
Формат работыГибридвычитано из текста вакансии
ГеографияМосква, Россиявычитано из текста вакансии
Зарплатане указана

Почему на этом месте в выдаче

Порядок выдачи объявлен контрактом: свежесть решает между днями, полнота и зарплата — внутри дня.

Полнота карточки502 из 4 полей: грейд, формат, география, зарплата
Зарплата названа0вилки нет вовсе

Проверка Вакандии

Источники и свежесть

Тип источника
Агрегатор вакансий
Найдено публикаций
1
Посмотреть публикации и даты
  • hcareersОсновная публикация · 2026-08-13

Работодатель

Сбер

50 активных вакансий · вилка работодателя указана в 37%

Открыть профиль компании

Безопасность

Отклик уходит на сайт источника

Вакандия показывает вакансию, но не отправляет отклик и не проверяет работодателя. Сам отклик вы оставляете на внешнем сайтеhh.ru.

Признаки мошенничества
  • Просят предоплату, «залог» или деньги за обучение и оборудование.
  • Требуют код из SMS, данные банковской карты или доступ к «Госуслугам».
  • Быстро уводят в мессенджер и торопят с решением.
  • Обещают большой доход без опыта и без деталей задач.

Настоящий работодатель не просит денег и платёжных данных до трудоустройства.

Продолжить поиск

Похожие вакансии

Причина сходства указана на каждой карточке