Ведущий инженер по AI/LLM-платформе
Навыки
- AI-агенты
- AI-инструменты в работе
- API (интеграции)
- Работа с бэклогом
- Code review
- Многопоточность
- CUDA / ONNX / TensorRT
Ещё 17
- Отладка и поиск ошибок
- Распределённые системы
- Docker
- Grafana
- Внедрение систем
- Kubernetes
- Linux
- LLM
- Инференс LLM
- Machine Learning
- Prometheus
- Прототипирование
- Python
- Маршрутизация и NAT
- SRE-практики
- Техническая документация
- Автоматизация тестирования
О компании и продукте
- Мы развиваем внутреннюю корпоративную платформу для запуска open-weight LLM и агентных решений на собственной GPU-инфраструктуре. Ищем опытного инженера, готового работать на стыке эксплуатации LLM, распределённых систем, платформенной архитектуры и быстро развивающихся агентных технологий. Мы не ожидаем, что один человек будет одинаково глубоко разбираться во всех перечисленных областях. Важно иметь сильную экспертизу как минимум в двух-трёх направлениях и быть готовым погружаться в смежные задачи.
Задачи
- Следить за развитием open-weight LLM, систем инференса, coding agents и AI-инфраструктуры
- находить перспективные технологии и оценивать их готовность к внедрению
- Тестировать и сравнивать модели на GPU-серверах по качеству, скорости, задержкам, пропускной способности, нагрузке, потреблению памяти, сложности эксплуатации и стоимости инференса
- Переводить успешные прототипы в надёжные промышленные решения, повышать производительность, отказоустойчивость и наблюдаемость платформы
- Проектировать внутреннюю AI-платформу: LLM-роутер, механизмы маршрутизации, балансировки и управления нагрузкой, приоритизации, квотирования, кэширования, выбора моделей и graceful degradation
- Разрабатывать агентов, MCP-серверы, скиллы, интеграции с агентными фреймворками, системы оценки качества и другие платформенные компоненты
- Формировать архитектурные и инженерные стандарты для безопасности, разграничения прав, версионирования, тестирования, публикации, аудита и сопровождения компонентов AI-платформы
- Взаимодействовать с внутренними пользователями и инженерными командами, превращая их потребности в работающие платформенные решения
- Использовать coding agents и другие AI-инструменты для ускорения разработки, исследований, тестирования и подготовки документации, отвечая за качество результата
Требования
- Сильная инженерная база и опыт проектирования промышленных программных систем
- Опыт работы с LLM, ML-инфраструктурой, распределёнными системами, высокопроизводительными вычислениями или сопоставимыми по сложности технологиями
- Понимание ключевых аспектов LLM-инференса: latency, throughput, batching, concurrency, длина контекста, потребление памяти, квантизация, параллелизм и KV-кэш
- Опыт эксплуатации Linux-сервисов, контейнеров, систем мониторинга и современных практик развёртывания
- Понимание принципов распределённых систем: маршрутизация, балансировка, backpressure, admission control, retries, тайм-ауты, планирование ресурсов и отказоустойчивость
- Умение проектировать API, границы сервисов, потоки данных и эксплуатационные интерфейсы
- Уверенное владение хотя бы одним универсальным языком программирования
- Python будет преимуществом
- Навыки диагностики проблем производительности и надёжности на уровнях приложения, инфраструктуры, ОС, сети и GPU
- Опыт создания сопровождаемых систем с автоматизированным тестированием, code review, документацией, мониторингом и контролируемым выпуском изменений
- Практический опыт работы с coding agents или другими LLM-инструментами разработки: декомпозиция задач, подготовка контекста, проверка кода, тестирование, отладка и валидация результата
- Будет преимуществом опыт: Промышленного запуска open-weight LLM на SGLang, vLLM, TensorRT-LLM, TGI или аналогичных решениях
- Эксплуатации крупных dense- и MoE-моделей на многопроцессорных GPU-системах
- понимание tensor, pipeline, data, expert и sequence parallelism
- Опыт применения квантизации, speculative decoding, prefix caching, многоуровневого KV-cache и disaggregated inference
- Проектирования или эксплуатации OpenAI-совместимых API, потоковой генерации, structured output, tool calling, reasoning-моделей и продолжительных агентных сценариев
- Разработки маршрутизации между моделями, cache-aware routing, динамического выбора моделей, квот, приоритетов и управления многопользовательской нагрузкой
- Оценки coding-моделей, coding agents, tool-use и многошаговых агентных сценариев
- Разработки агентов, агентных рантаймов, MCP-клиентов и серверов, workflow-движков, портируемых скиллов и интеграций с агентными фреймворками
- Обеспечения безопасности агентных систем: управление учётными данными и правами, sandboxing, изоляция данных, approval flows, аудит и безопасность цепочки поставки
- Внедрения решений в крупных корпоративных или изолированных средах с повышенными требованиями к безопасности, соответствию регламентам, идентификации пользователей и сетевому доступу
- Опыт работы с Kubernetes, Docker Compose, Docker Swarm, Prometheus, Grafana, OpenTelemetry или аналогичными технологиями
- Участия в open-source-проектах, публикация технических материалов, создание публичных бенчмарков или разработка внутренних платформенных решений
- Инженерное мышление и независимость от конкретных фреймворков, вендоров и стеков
- Принятие решений на основе измерений, экспериментов и проверяемых данных
Условия
- Сплоченную команду профессионалов, в которой можно не только успешно реализовывать проекты, но и перенимать опыт и развиваться
- Обучение, участие в интересных проектах и расширение профессиональной экспертизы: мы участвуем в конференциях, митапах, публикуемся на Хабр и т.д
- Конструктивную и открытую рабочую атмосферу
- Полис добровольного медицинского страхования, обслуживаемый в лучших клиниках, а также чек-ап для сотрудников 40+
- Страхование жизни, страхование от несчастных случаев и критических заболеваний, страхование выезжающих за рубеж
- Материальную помощь
- Детские подарки
- Доплату по листу нетрудоспособности
- Корпоративные скидки на товары и услуги от партнеров компании
- Служебную сотовую связь
- Кафетерий льгот — возможность самостоятельно выбрать дополнительные корпоративные льготы и бонусы (спорт, здоровье, обучение, путешествия, транспорт и др.)
- Доступно после испытательного срока
- Формат работы удалённый на территории РФ
- Работа по московскому часовому поясу
Паспорт вакансии
История публикации
Появилась в Вакандии29 дней
Перепубликациинетпубликовалась один раз
Проверяли на источникеВидели 29 дней назад
Среди похожихНет данныху карточки не хватает полей, чтобы найти похожие
Откуда что взялось
Отмечено то, что вывели мы. Без пометки — значение назвал работодатель.
ГрейдLeadвычитано из текста вакансии
Формат работыУдалённо
Географияне указана
Зарплатане указана
Почему на этом месте в выдаче
Порядок выдачи объявлен контрактом: свежесть решает между днями, полнота и зарплата — внутри дня.
Полнота карточки502 из 4 полей: грейд, формат, география, зарплата
Зарплата названа0вилки нет вовсе
Проверка Вакандии
Источники и свежесть
- Тип источника
- Агрегатор вакансий
- Найдено публикаций
- 1
Посмотреть публикации и даты
- hcareersОсновная публикация · 2026-08-12
Безопасность
Отклик уходит на сайт источника
Вакандия показывает вакансию, но не отправляет отклик и не проверяет работодателя. Сам отклик вы оставляете на внешнем сайте — hh.ru.
Признаки мошенничества
- Просят предоплату, «залог» или деньги за обучение и оборудование.
- Требуют код из SMS, данные банковской карты или доступ к «Госуслугам».
- Быстро уводят в мессенджер и торопят с решением.
- Обещают большой доход без опыта и без деталей задач.
Настоящий работодатель не просит денег и платёжных данных до трудоустройства.
Продолжить поиск
Похожие вакансии
Причина сходства указана на каждой карточке
Подробнее Подробнее - Подробнее
Почему похожа: похожая специализация
Fabrique — Python-разработчик (Django, DRF)
- Junior
- Удалённо из России
- Москва, Россия