AI Agent Reliability Engineer
Навыки
- AI-агенты
- API (интеграции)
- Самостоятельность
- B2B-продажи
- CRM-системы
- Дисциплина
- Распределённые системы
Ещё 14
- Docker
- FastAPI
- GitHub
- GitHub Actions
- Jaeger / OpenTelemetry
- База знаний
- LLM
- Мониторинг и observability
- PostgreSQL
- Prompt engineering
- pytest
- Python
- Redis
- Регрессионное тестирование
О компании и продукте
- О продукте и стеке Мы создаём B2B-платформу автономных ИИ-агентов для рынка США. Агенты ведут многошаговые рабочие процессы с несколькими участниками — со сроками, документами и перепиской — и выполняют действия во внешних системах: электронная почта, CRM, календари, документы. Ключевые действия проходят через подтверждение человеком. Стек платформы: Python, FastAPI, PostgreSQL, Redis, MCP. Используем managed-модели Anthropic, OpenAI и Google через API
Задачи
- Что предстоит делать Строить систему оценки качества агентов
- Измеримые критерии успешного выполнения, эталонные наборы данных, сценарные тесты и автоматизированные evals для многошаговых процессов
- Разбирать поведение агентов
- Анализировать execution traces, tool calls, контекст и результаты
- находить причины ошибок и деградации
- Превращать отдельные сбои в воспроизводимые тесты и системные улучшения
- Защищать продукт от регрессий
- Regression suites и release gates для изменений моделей, промптов, инструментов и оркестрации
- Сравнение версий по качеству, стоимости, latency и устойчивости
- Проектировать границы безопасного поведения
- Разрешённые действия, схемы и контракты инструментов, проверки входов и выходов, approval gates, fallback- и escalation-механизмы
- Проверять устойчивость к атакам
- Red teaming: prompt injection, подмена контекста, ошибочные tool calls, зацикливание, превышение полномочий
- Повышать надёжность в production
- Трассировка, мониторинг качества, алерты, расследование инцидентов
- retry, timeout, idempotency, восстановление
- Метрики: task success rate, доля вмешательств человека, критические ошибки, latency, стоимость
- Развивать общий harness платформы
- Переиспользуемые компоненты и стандарты, ускоряющие безопасный запуск новых агентов и сценариев
- Первые 90 дней Разобрать существующие наработки и довести их до первой полной версии системы evals: критерии успеха для текущих сценариев, эталонные наборы, автоматический прогон
- Встроить regression suite и release gates в CI: изменения промптов, инструментов и моделей не выходят без сравнения версий по качеству, стоимости и latency
- Настроить трассировку и наблюдаемость production-агентов: execution traces, tool calls, алерты по деградации качества
Требования
- По каждому пункту на интервью спросим детали и артефакты
- Production-код на Python: тестируемые backend-системы, pytest, Docker, CI (GitHub Actions или аналог)
- Лично проектировали и строили систему оценки недетерминированной системы: автоматизированные evals, сценарные тесты, эталонные наборы
- Использование готового чужого harness'а без проектирования собственного не засчитывается
- Практический опыт LLM-приложений или агентов: tool calling, оркестрация многошаговых сценариев, анализ логов и трасс, воспроизведение сложных сбоев
- Статистическая грамотность: размеры выборок, дисперсия, значимость различий между версиями недетерминированной системы
- Без этого evals превращаются в театр — спросим об этом отдельно
- Понимание рисков production AI: prompt injection, некорректное использование инструментов, избыточные полномочия, зацикливание, неконтролируемый рост стоимости
- Английский B1 или выше
- Будет преимуществом Опыт с Langfuse, LangSmith, Arize Phoenix, OpenAI Evals, DeepEval, Ragas или аналогами
- LLM-as-a-judge пайплайны с проверкой качества самой оценки
- Red teaming LLM-систем, AI security, построение guardrails
- Симуляторы, генераторы тестовых данных, собственные evaluators
- OpenTelemetry и инженерные практики надёжности: observability, graceful degradation, incident analysis
- У направления оценки уже есть наработки и накопленная база знаний
- Ваша задача — подключиться и развить их в полноценную систему: архитектура оценочного harness, выбор инструментов и стандартов за вами
- Результат вашей работы — измеримое качество агентов и возможность выпускать изменения без неконтролируемых регрессий
- Граница со смежной ролью: вы владеете инфраструктурой оценки — оценочным harness, тестовыми средами, release gates
- Содержание доменных ролей агентов — знания, правила решений, обучающие наборы — зона Agent Knowledge Engineer , который работает внутри оценочного harness
Условия
- Полная занятость, удалённая работа
- Синхронное окно команды: с 10:00–11:00 до 20:00–21:00 МСК
- Возможность определять стандарты качества и надёжности агентной платформы
- Высокая самостоятельность в выборе подходов и инструментов
- оценка по результату
- Как откликнуться Вместо стандартного сопроводительного письма: Разберите одну AI- или backend-систему, надёжность которой вы повысили: как работала, за что отвечали лично вы, что реализовали, как изменились качество и стабильность
- Приложите верифицируемые артефакты: GitHub, пример спроектированного eval-набора или evaluator'а, технические статьи
- Ответьте на вопрос: как вы построите eval для многошагового агента, у которого успех задачи не сводится к сравнению вывода с эталоном?
- Как проверите, что LLM-as-judge оценивает верно?
- Опишите, что в этом проекте не получилось и почему
Паспорт вакансии
История публикации
Появилась в Вакандии28 дней
Перепубликациинетпубликовалась один раз
Проверяли на источникеВидели 28 дней назад
Среди похожихНет данныху карточки не хватает полей, чтобы найти похожие
Откуда что взялось
Отмечено то, что вывели мы. Без пометки — значение назвал работодатель.
Грейдне указан
Формат работыУдалённо
Географияне указана
Зарплата≈ 150 000 RUB в месяцнаша оценка, в вакансии не названа
Почему на этом месте в выдаче
Порядок выдачи объявлен контрактом: свежесть решает между днями, полнота и зарплата — внутри дня.
Полнота карточки502 из 4 полей: грейд, формат, география, зарплата
Зарплата названа0вилки работодателя нет, показана наша оценка
Проверка Вакандии
Источники и свежесть
- Тип источника
- Агрегатор вакансий
- Найдено публикаций
- 1
Посмотреть публикации и даты
- hcareersОсновная публикация · 2026-08-12
Работодатель
Копылов Евгений Анатольевич
5 активных вакансий · вилка работодателя указана в 0%
Открыть профиль компанииБезопасность
Отклик уходит на сайт источника
Вакандия показывает вакансию, но не отправляет отклик и не проверяет работодателя. Сам отклик вы оставляете на внешнем сайте — hh.ru.
Признаки мошенничества
- Просят предоплату, «залог» или деньги за обучение и оборудование.
- Требуют код из SMS, данные банковской карты или доступ к «Госуслугам».
- Быстро уводят в мессенджер и торопят с решением.
- Обещают большой доход без опыта и без деталей задач.
Настоящий работодатель не просит денег и платёжных данных до трудоустройства.
Продолжить поиск
Похожие вакансии
Причина сходства указана на каждой карточке
Подробнее Подробнее - Подробнее
Почему похожа: похожая специализация
Fabrique — Python-разработчик (Django, DRF)
- Junior
- Удалённо из России
- Москва, Россия