Senior · Гибрид · Москва, Россия · Английский не нужен
Навыки
API (интеграции)
Проектирование архитектуры
CI/CD
Code review
CUDA / ONNX / TensorRT
Docker
EdTech
Ещё 17
Elasticsearch
FastAPI
Финтех и платежи
Kubernetes
LLM
Инференс LLM
Нагрузочное тестирование
Machine Learning
Мониторинг и observability
152-ФЗ / персональные данные
PostgreSQL
Python
Оптимизация запросов
RAG
SLA
SQL
SRE-практики
О компании и продукте
Технологии/инструменты PostgreSQL SQL Python Docker Kubernetes CI/CD FastAPI API Machine Learning Создаем поисковый сервис для ответов на запросы пользователей на естественном языке. Предоставляем GigaChat и другим LLM доступ к актуальной информации из интернета, чтобы пользователи получали точные и свежие ответы на разные вопросы
Задачи
Проектировать и развивать поисковое ядро на базе OpenSearch: схемы индексов, шардирование, ranking и relevance tuning, гибридный (full-text + векторный) поиск
Разрабатывать и развивать высоконагруженные backend-сервисы поиска на Python (FastAPI): API поискового сервиса, оркестрация запросов, интеграция с GigaChat и другими LLM
Проектировать и развивать ML-инфраструктуру для vector search: генерация и хранение embeddings, ANN/HNSW индексы, деплой и обслуживание моделей через Triton Inference Server
Работать с PostgreSQL: проектирование схем, оптимизация запросов, обеспечение консистентности метаданных поискового сервиса
Обеспечивать производительность, надежность и масштабируемость поисковой платформы: мониторинг, контроль SLA, оптимизация latency и throughput
Проводить нагрузочное тестирование, оптимизировать задержку ответа поиска и стоимость инфраструктуры
Внедрять CI/CD, тестирование и observability для сервисов поиска
Работать в связке с data-инженерами, ML-инженерами и продуктовой командой над качеством и релевантностью поиска
Участвовать в код-ревью, влиять на архитектурные решения команды, менторить менее опытных инженеров
Предстоит развивать поисковое ядро на OpenSearch, высоконагруженные backend-сервисы поиска на Python/FastAPI и ML-инфраструктуру для векторного поиска (embeddings, ANN/HNSW, инференс моделей через Triton Inference Server)
Задача технически сложная и интересная: важны релевантность и качество ранжирования, низкая задержка ответа, надежность и масштабируемость под большой поток запросов
Ценим проактивность, инженерное мышление и желание развиваться
Требования
5+ лет опыта коммерческой backend-разработки, из них значимый опыт работы над поисковыми системами / информационным поиском
Продвинутый Python, опыт построения production-сервисов на FastAPI или аналогичных асинхронных фреймворках
Практический опыт с OpenSearch или Elasticsearch в production: проектирование индексов, шардирование, ranking/relevance tuning, оптимизация запросов
Опыт проектирования и эксплуатации высоконагруженных распределенных сервисов с высоким RPS и низкой latency
Уверенное владение SQL и опыт работы с PostgreSQL: проектирование схем, оптимизация запросов, работа с индексами
Понимание задач vector search: embeddings, ANN/HNSW, гибридный (hybrid) поиск
Опыт работы с инференс-серверами моделей (Triton Inference Server или аналогичными): деплой и обслуживание ML-моделей в production