Junior · Самара, Россия · Английский: чтение документации
Не указано: формат работы
Навыки
Алгоритмы и структуры данных
API (интеграции)
B2B-продажи
Docker
FastAPI
Дообучение моделей
Git
Ещё 16
GitHub
JSON
LLM
Инференс LLM
Machine Learning
OCR
Pandas
PostgreSQL
Prompt engineering
Python
RAG
Регрессионное тестирование
SOLID и паттерны
SQL
SQLAlchemy
Работа в команде
О компании и продукте
B2B SaaS-продукт, работающий с большими объёмами слабоструктурированных документов (PDF / DOCX / XLSX) и строящий на них аналитику. Сейчас вся обработка данных — rule-based (regex + словари). Запускается контур локального LLM-инференса для нормализации и извлечения структурированных данных. Ограничение: данные — коммерческая тайна, деплой только on-prem, облачные LLM-API исключены — используются открытые модели локально. ML/LLM-инженер Локальный LLM-инференс и извлечение данных из документов. On-prem, без облачны
Задачи
Эксперименты с открытыми LLM: подбор моделей и промптов под задачи извлечения, сравнение результатов
Разработка кода извлечения структурированных данных (constrained JSON) из документов и таблиц на Python в существующем бэкенде
Сбор и разметка наборов для оценки качества, расчёт метрик (точность по полям), отслеживание регрессий при смене модели или промпта
Нормализация данных: дедупликация и сопоставление сущностей, очистка полей правилами и LLM
Поддержка OCR-пайплайна для сканов (Tesseract / Surya / PaddleOCR)