Сбер

Pretrain Data LLM Researcher (GigaChat)

Lead · Гибрид · Москва, Россия · Английский не нужен

Навыки

  • Airflow
  • Самостоятельность
  • AWS
  • CI/CD
  • Computer Vision
  • Анализ данных
  • Data Quality
Ещё 17
  • Yandex DataLens
  • Финтех и платежи
  • GitLab
  • GitLab CI
  • Kubernetes
  • LLM
  • Machine Learning
  • 152-ФЗ / персональные данные
  • Polars / Dask
  • Python
  • PyTorch
  • Рекомендательные системы
  • Нацеленность на результат
  • S3 (объектное хранилище)
  • Spark
  • Постановка задач и ТЗ
  • Статистика

О компании и продукте

  • GigaChat обучает одна из крупнейших ML-команд страны. Мы знаем то же, что знают OpenAI и Anthropic: качество следующей версии модели определяют претрейн-данные. Поэтому мы ищем не «инженера по датасетам», а исследователя, который будет владеть данными как рычагом роста модели — от стратегии сбора до измеримого прироста на бенчмарках.
  • Контур влияния короткий и прямой: ваша гипотеза → эксперимент → обучающий прогон → прирост метрик модели, которой пользуются миллионы людей.

Задачи

  • Вести программу экспериментов с данными
  • Планировать, запускать и анализировать ablation-эксперименты: сравнивать версии смеси данных, фильтров и порядка обучения при фиксированном вычислительном бюджете
  • Вы автор эксперимента, а не исполнитель
  • Оптимизировать смесь и порядок использования данных
  • Отвечать на главный вопрос претрейна: какие данные, в какой пропорции и в каком порядке должна видеть модель
  • Применять интуицию scaling laws к распределению токенов
  • Измерять качество данных
  • Превращать расплывчатые «хорошие данные» в конкретные измеримые сигналы: классификаторы для отбора документов, насыщенных рассуждениями, кодом и знаниями
  • Курировать корпус на масштабе триллионов токенов
  • Проводить точную и fuzzy-дедупликацию, фильтрацию, очистку от утечек бенчмарков, html2text
  • Собирать данные для agentic-pretrain
  • Проводить поиск, сбор и генерацию траекторий использования инструментов, многошаговых рассуждений и взаимодействия со средой — чтобы агентные способности закладывались в модель уже на этапе претрейна, а не только в пост-обучении
  • Создавать рецепты подготовки синтетических данных
  • Генерировать синтетику под дефицитные способности модели (длинный контекст, рассуждения, код) — с количественной проверкой через эксперименты
  • Замыкать петлю: «данные → обучение → оценка»
  • Развивать контур бенчмарков и сетапов экспериментов для измерений, чтобы каждое изменение данных имело измеримый ответ

Требования

  • Нам нужны сильные исследователи, а не исполнители
  • Главное — умение самостоятельно задавать правильные вопросы, проектировать эксперименты и доводить гипотезы до измеримого результата
  • Опыт именно с LLM не обязателен, если у вас сильная экспериментальная практика в любой области ML — компьютерное зрение, рекомендательные системы, классический ML, наука — специфике больших языковых моделей мы научим
  • Сильные основы ML и статистики, культура контролируемого эксперимента: гипотеза → дизайн → измерение → вывод
  • Уверенный Python и опыт обучения моделей на PyTorch или аналогах
  • Самостоятельность в исследованиях: умение вести направление от вопроса до результата, а не ждать постановки задачи
  • Понимание цикла обучения LLM хотя бы на уровне теории: токенизация, scaling laws, влияние состава данных на качество
  • Знакомство с распределённой обработкой данных (Spark, Dask, Airflow, Kubernetes) и открытыми data-проектами (FineWeb, OLMo, Dolma) — как минимум представление о том, как это устроено
  • Не обязательно закрывать все вышеперечисленные пункты
  • Если вы сильный экспериментатор и хотите дорасти до владения всем циклом данных фронтирной модели — давайте поговорим
  • Что мы даём — и почему это редкость на рынке
  • Вычислительные ресурсы под ваши эксперименты
  • Один из крупнейших GPU-кластеров в стране
  • ablation-эксперименты — это обучающие прогоны, и вы сможете запускать их регулярно, а не «раз в квартал, если повезёт»
  • Претрейн с нуля, а не дообучение чужих весов
  • Мы обучаем собственную модель с первого токена — это значит, что ваши решения по данным определяют фундамент модели, а не косметику поверх чужого претрейна
  • Сейчас мы учим модели размером 400–700B параметров, и у нас есть амбиции выйти на масштаб 1.5–2T
  • Опенсорс и мировая планка
  • Мы выкладываем модели в открытый доступ, и наша цель — достичь мирового уровня среди опенсорс-моделей
  • Ваша работа будет видна всему сообществу и будет сравниваться с лучшими открытыми моделями мира
  • Полная ориентация на результат
  • Минимум бюрократии, максимум ответственности и свободы
  • Работу меряем не количеством задач, а приростом модели на бенчмарках при том же бюджете
  • Подтверждённая гипотеза попадает в обучение следующей модели
  • Развитая инфраструктура

Паспорт вакансии

История публикации

Появилась в Вакандии28 дней
Перепубликациинетпубликовалась один раз
Проверяли на источникеВидели 28 дней назад
Среди похожихНет данныху карточки не хватает полей, чтобы найти похожие

Откуда что взялось

Отмечено то, что вывели мы. Без пометки — значение назвал работодатель.

ГрейдLeadвычитано из текста вакансии
Формат работыГибридвычитано из текста вакансии
ГеографияМосква, Россиявычитано из текста вакансии
Зарплатаот 400 000 RUB в месяцвычитано из текста вакансии

Почему на этом месте в выдаче

Порядок выдачи объявлен контрактом: свежесть решает между днями, полнота и зарплата — внутри дня.

Полнота карточки1004 из 4 полей: грейд, формат, география, зарплата
Зарплата названа100вилку назвал источник

Проверка Вакандии

Источники и свежесть

Тип источника
Агрегатор вакансий
Найдено публикаций
1
Посмотреть публикации и даты
  • getmatchОсновная публикация · 2026-08-11

Работодатель

Сбер

50 активных вакансий · вилка работодателя указана в 37%

Открыть профиль компании

Безопасность

Отклик уходит на сайт источника

Вакандия показывает вакансию, но не отправляет отклик и не проверяет работодателя. Сам отклик вы оставляете на внешнем сайтеgetmatch.ru.

Признаки мошенничества
  • Просят предоплату, «залог» или деньги за обучение и оборудование.
  • Требуют код из SMS, данные банковской карты или доступ к «Госуслугам».
  • Быстро уводят в мессенджер и торопят с решением.
  • Обещают большой доход без опыта и без деталей задач.

Настоящий работодатель не просит денег и платёжных данных до трудоустройства.

Продолжить поиск

Похожие вакансии

Причина сходства указана на каждой карточке