ML‑разработчик в команду ядра детекции (Автономный транспорт)
Middle · Гибрид · Санкт-Петербург, Россия · Английский не нужен
Навыки
Самостоятельность
CUDA / ONNX / TensorRT
Computer Vision
Анализ данных
LLM
Machine Learning
PyTorch
Ещё 3
Робототехника
TensorFlow
Transformers / HuggingFace
О компании и продукте
ML‑разработчик в команду ядра детекции (Автономный транспорт)
Команда Detector Alignment входит в отдел восприятия Автономного транспорта. Наша задача — обеспечить, чтобы автомобиль правильно «видел» и понимал окружающую среду в любых условиях: днём и ночью, в дождь, снег и туман. Мы обрабатываем данные с камер, лидаров и радаров, разрабатываем нейросетевые алгоритмы и внедряем их в работу автомобиля. Сейчас в нашем стеке восприятия много разных компонентов с похожей семантикой: Occupancy Grid, Height Grids, лидарная семантическая сегментация, отдельные компоненты для работы со статикой и динамикой. Каждому из них нужна своя разметка, настройка и свой бюджет latency. При этом все они по сути описывают одно и то же: что и где занимает пространство вокруг машины. Мы считаем, что все эти компоненты можно объединить в единое представление: 3D Occupancy Grid
Нам нужен специалист, который возглавит эту работу — от создания исследовательского PoC до внедрения продакшен‑модели в автомобиль. Важный момент: разработка ведётся на новой query‑based модели восприятия. Мы отказываемся от набора независимых компонентов над плотными признаковыми картами и переходим к единому трансформерному бэкбону. В нём разные задачи будут выражаться через обучаемые queries. Это значит, что вам предстоит работать не с устаревшей архитектурой, а с системой, которая только формируется. Ваши решения по дизайну 3D OG в этой архитектуре во многом определят, как будет работать система восприятия автомобиля в ближайшие годы. Какие задачи вас ждут Анализ методов 3D Occupancy Prediction
Задачи
Вы будете изучать современные методы прогнозирования occupancy в 3D: и на основе данных с камеры (camera-only), и с объединением данных камеры и лидара (camera-lidar fusion)
Нужно оценить, насколько эти методы подходят для нашей сенсорной конфигурации и вычислительного бюджета, а также обосновать, какую архитектуру стоит выбрать
Интеграция 3D OG
Нужно спроектировать работу occupancy в трансформерной модели: разобраться в устройстве voxel/occupancy queries, понять, как функционирует cross-attention с признаками камер и лидара, выяснить, как задача разделяет бэкбон с детекцией и другими головами, а также найти способы избежать негативного transfer между задачами
Анализ пайплайна и работа с датасетом
Вы будете разбирать текущий пайплайн генерации псевдоразметки для статических и динамических объектов: поймёте, как он работает, какие у него ограничения и где есть возможности для развития
Также соберёте датасет карт занятости и создадите стабильный пайплайн, который позволит регулярно пополнять датасет
Обучение модели
Вы будете реализовывать и обучать модель, которая предсказывает 3D OG
Нужно продумать, как оценивать её работу: использовать метрики precision, recall, F1, IoU (по классам и по дальностным зонам), проанализировать предсказания визуально, а также честно сравнить разные подходы между собой и с текущими решениями
Унификация голов восприятия
Вы будете постепенно заменять разные типы голов — OG, AG, height grids, лидарную сегментацию — единым представлением в виде voxel grid
При этом важно сохранить качество работы в критичных сценариях
Оптимизация latency
Вы будете оценивать и оптимизировать стоимость инференса в рамках текущего бюджета, работать с realtime‑ограничениями на целевом оборудовании и доводить модель до стабильной работы на автомобиле
Улучшение детекции
Вы будете итеративно повышать качество детекции: работать с лоссами и семплированием, применять аугментации и self-/semi-supervised-подходы, использовать дистилляцию, анализировать ошибки и работать с длинным хвостом сценариев
Alignment и устойчивость
Вы будете обеспечивать, чтобы модели хорошо работали в разной погоде и освещённости, на различных сенсорных конфигурациях и в новых географических зонах
Также вам предстоит разрабатывать алгоритмы, которые определят, при каких условиях можно эксплуатировать систему (например, учитывать погоду, состояние дороги и деградацию сенсоров)
Больше об ML в Яндексе — в канале Yandex for ML
Требования
Уверенно обучаете нейросетевые модели и владеете PyTorch (или TensorFlow) и фреймворками поверх
Ориентируетесь в прикладном DL и компьютерном зрении: знаете теорию, но измеряете себя практическим результатом
Понимаете, как устроены трансформеры и attention изнутри — не только умеете их запускать, но и можете осознанно менять архитектуру
Умеете работать с 3D‑представлениями: BEV, voxel grids, проективная геометрия, калибровки, работа с облаками точек
Способны самостоятельно вести исследовательскую задачу: от обзора литературы и постановки метрик до понятных выводов
Понимаете особенности realtime‑ограничений и умеете думать о latency на этапе выбора архитектуры
Стремитесь использовать и распространять универсальные, масштабируемые практики
Читаете статьи с ML‑конференций и следите за развитием области
От 3 лет
Санкт-Петербург
Будет плюсом
Работали с query-based архитектурами восприятия: DETR-подобные детекторы, Deformable DETR, BEVFormer, StreamPETR, Mask2Former и аналоги
Работали с occupancy prediction или BEV-перцепцией (LSS, BEVFusion, TPVFormer, SurroundOcc, VoxFormer, FB-OCC и т. п.)
Работали с мультимодальными моделями (камера + лидар + радар) и sensor fusion
Обучали multi-task-модели с общим бэкбоном и умеете балансировать задачи между собой
Строили пайплайны автоматической разметки и псевдоразметки, работали с накоплением сцен и SLAM-выходами
Имели дело с большими моделями (LLM, VLM, Foundation Models) в иных доменах