ML-разработчик в команду ускорения инференса
Навыки
- API (интеграции)
- C++
- CUDA / ONNX / TensorRT
- LLM
- Инференс LLM
- Machine Learning
- NLP
Ещё 3
- Python
- PyTorch
- Статистика
О компании и продукте
- Мы ищем инженера-исследователя с опытом чтения и реализации статей, готового экспериментировать и внедрять методы ускорения инференса для современных и быстро меняющихся архитектур LLM. Какие задачи вас ждут Непрерывный разбор статей из ресёрча
Задачи
- ML-разработчик в команду ускорения инференса
- В зависимости от аудитории и нагрузки в сервисе может понадобиться от десятков до тысяч самых современных GPU
- Оптимизация даже десятков процентов ресурсов на таких объёмах уже представляет значимую ценность
- В первую очередь предстоит глубоко ознакомиться с серией статей по теме (более 20 публикаций), систематизировать их и зафиксировать самые перспективные
- Применение методов для Alice AI LLM
- Необходимо провести множество итераций экспериментов по проверке гипотез для Alice AI LLM, чтобы перейти к генерации и реализации новых подходов
- Также нужно будет подтвердить практическую применимость методов: замерить качество и ускорение
- Разработка универсальных инструментов
- И наконец, предстоит создать общее решение, которое будут переиспользовать ML-инженеры во всём Яндексе
- Больше об ML в Яндексе — в канале Yandex for ML
Требования
- Работали с современными LLM и понимаете, как устроена их архитектура
- Пишете на Python, имеете опыт разработки на Torch
- Глубоко разбираетесь в NLP
- Знакомы с пайплайном инференса генеративных моделей, знаете такие оптимизации, как KV-кеширование
- Понимаете, как изменяются вычисления при изменении batch_size
- Разбираетесь в пользовательских требованиях к API моделей: RPS, latency per token/sample, GPU VRAM, SM utilization
- От 3 лет
Будет плюсом
- Уверенно владеете C++ и знакомы с программированием на CUDA
Условия
- Гибридный
- Alice AI LLM всё глубже проникает в сервисы компании и решает самые разнообразные задачи, принося пользу людям
- Каждое внедрение ставит перед разработчиками уникальные вызовы, связанные с качеством и скоростью работы ML-моделей
- Но для каждого запуска неизменно одно: инференс моделей в production стоит очень дорого
Паспорт вакансии
История публикации
Появилась в Вакандии31 день
Перепубликациинетпубликовалась один раз
Проверяли на источникеВидели 27 дней назад
Среди похожихНет данных105 из 30 · у похожих вакансий почти одинаковый возраст — сравнивать нечего
Откуда что взялось
Отмечено то, что вывели мы. Без пометки — значение назвал работодатель.
ГрейдMiddleвыведено из другого признака
Формат работыГибридвычитано из текста вакансии
Географияне указана
Зарплата≈ 310 000 RUB в месяцнаша оценка, в вакансии не названа
Почему на этом месте в выдаче
Порядок выдачи объявлен контрактом: свежесть решает между днями, полнота и зарплата — внутри дня.
Полнота карточки753 из 4 полей: грейд, формат, география, зарплата
Зарплата названа0вилки работодателя нет, показана наша оценка
Проверка Вакандии
Источники и свежесть
- Тип источника
- Карьерный сайт работодателя
- Найдено публикаций
- 1
Посмотреть публикации и даты
- careerОсновная публикация · 2026-05-25
Безопасность
Отклик уходит на сайт источника
Вакандия показывает вакансию, но не отправляет отклик и не проверяет работодателя. Сам отклик вы оставляете на внешнем сайте — yandex.ru.
Признаки мошенничества
- Просят предоплату, «залог» или деньги за обучение и оборудование.
- Требуют код из SMS, данные банковской карты или доступ к «Госуслугам».
- Быстро уводят в мессенджер и торопят с решением.
- Обещают большой доход без опыта и без деталей задач.
Настоящий работодатель не просит денег и платёжных данных до трудоустройства.
Продолжить поиск
Похожие вакансии
Причина сходства указана на каждой карточке
Подробнее - Подробнее
Почему похожа: похожая специализация · тот же грейд
Business Analyst- Digital Transformation
- Middle
- Гонконг
- Подробнее
Почему похожа: похожая специализация · тот же грейд
системного аналитика — работа System Analyst
- Middle