ML-разработчик в команду базового алайнмента Alice AI LLM
Навыки
- Дообучение моделей
- LLM
- Machine Learning
- NLP
О компании и продукте
- Наша команда занимается стадией алайнмента Alice AI LLM. Мы превращаем LLM, обученную предсказывать следующий токен в документах из интернета, в диалогового агента, способного выполнить широкий спектр запросов пользователя. Какие задачи вас ждут Обучение следованию инструкциям пользователя (Supervised Fine-tuning, SFT)
- Это примеры вопросов, на которые мы ищем ответы с помощью ML-экспериментов
- Мы собираем разметку относительного качества ответов модели и учим её генерировать ответы наилучшего качества. На этом этапе мы применяем алгоритмы online-RL (GRPO, GSPO) и используем комбинацию стадий RLHF и RLVR. Также мы занимаемся обучением с одновременным учётом нескольких аспектов качества
- Мы развиваем свою линейку reward-моделей, которые могут быстро оценивать качество ответа модели на уровне человека. Кроме базового обучения моделей наград, мы применяем подходы с использованием рубрицированных оценок, а также используем LLM-as-a-Judge (LLMaJ) напрямую. Объединение экспертных моделей. Мы занимаемся объединением экспертных моделей, обученных на разных доменах, в единую модель, которая сочетает в себе сильные качества каждой из них. Для этого мы активно исследуем и применяем такие методы, как On-Policy Distillation (OPD). Больше об ML в Яндексе — в канале Yandex for ML
Задачи
- ML-разработчик в команду базового алайнмента Alice AI LLM
- Чтобы превратить предобученную LLM в диалогового агента, нужно собрать множество демонстраций желаемого поведения модели на разнообразных задачах
- Обучение модели на основе пользовательских предпочтений и верифицируемых наград (RLHF, RLVR)
- После стадии SFT качество ответов модели даже на один и тот же запрос может очень сильно различаться
- Обучение модели наград (Reward Modeling)
- Разметка качества ответов людьми — очень дорогой и небыстрый процесс, а алгоритмы online-RL требуют оценки в реальном времени
Требования
- Отлично знаете классические методы ML и NLP
- Понимаете, как устроены современные LLM, решали с их помощью прикладные задачи или имеете релевантный исследовательский опыт
- От 3 лет
- Какие именно задачи важнее, насколько сложными могут быть демонстрации, каких навыков модели не хватает для решения конкретной задачи и как модель может выучить этот навык на стадии алайнмента?
Условия
- Гибридный
- Удалённая работа
Паспорт вакансии
История публикации
Появилась в Вакандии30 дней
Перепубликациинетпубликовалась один раз
Проверяли на источникеВидели 28 дней назад
Среди похожихНет данных105 из 30 · у похожих вакансий почти одинаковый возраст — сравнивать нечего
Откуда что взялось
Отмечено то, что вывели мы. Без пометки — значение назвал работодатель.
ГрейдMiddleвыведено из другого признака
Формат работыГибридвычитано из текста вакансии
Географияне указана
Зарплата≈ 310 000 RUB в месяцнаша оценка, в вакансии не названа
Почему на этом месте в выдаче
Порядок выдачи объявлен контрактом: свежесть решает между днями, полнота и зарплата — внутри дня.
Полнота карточки753 из 4 полей: грейд, формат, география, зарплата
Зарплата названа0вилки работодателя нет, показана наша оценка
Проверка Вакандии
Источники и свежесть
- Тип источника
- Карьерный сайт работодателя
- Найдено публикаций
- 1
Посмотреть публикации и даты
- careerОсновная публикация · 2026-07-17
Безопасность
Отклик уходит на сайт источника
Вакандия показывает вакансию, но не отправляет отклик и не проверяет работодателя. Сам отклик вы оставляете на внешнем сайте — yandex.ru.
Признаки мошенничества
- Просят предоплату, «залог» или деньги за обучение и оборудование.
- Требуют код из SMS, данные банковской карты или доступ к «Госуслугам».
- Быстро уводят в мессенджер и торопят с решением.
- Обещают большой доход без опыта и без деталей задач.
Настоящий работодатель не просит денег и платёжных данных до трудоустройства.
Продолжить поиск
Похожие вакансии
Причина сходства указана на каждой карточке
Подробнее - Подробнее
Почему похожа: похожая специализация · тот же грейд
Business Analyst- Digital Transformation
- Middle
- Гонконг
- Подробнее
Почему похожа: похожая специализация · тот же грейд
системного аналитика — работа System Analyst
- Middle