Гибрид · Санкт-Петербург, Россия · Английский не нужен
Не указано: грейд
Навыки
Ansible
ArgoCD / Flux
AWS
Резервное копирование
Ceph / MinIO
CI/CD
Docker
Ещё 17
ELK / Elastic Stack
GitLab
Grafana
Helm
HTTP/web-сервисы
Linux
Loki / Graylog
Memcached
Nginx
Мониторинг и observability
Prometheus
Redis
S3 (объектное хранилище)
SRE-практики
Terraform
WAF / файрвол
Zabbix
О компании и продукте
Мы разрабатываем высоконагруженный веб-сервис, который требует надёжной, отказоустойчивой и масштабируемой инфраструктуры. В планах – активный рост пользовательской базы, поэтому мы строим систему с нуля с использованием современных подходов и готовых облачных решений там, где это экономически оправдано.
Задачи
Проектировать, разворачивать и сопровождать полный стек инфраструктуры
Web Application Firewall (WAF) – выбор и настройка SaaS‑решения (или интеграция с облачным провайдером) для защиты от SQLi, XSS, ботов, DDoS, Geo‑IP, рейт‑лимитов
Балансировщик нагрузки (Load Balancer) – организация единой точки входа, SSL‑оффлоадинг, распределение трафика между нодами приложений
Кластер приложений (Application Cluster) – минимум 2 ноды в разных дата‑центрах, внешнее хранилище сессий (Redis Sentinel / Memcached), использование сетевых хранилищ (NFS или S3)
Кластер баз данных – настройка репликации Master‑Slave, обеспечение отказоустойчивости, резервного копирования, чтения с реплик
Принятие решения: самостоятельное развёртывание (с учётом проблем асинхронной репликации, автоматического переключения и Split‑Brain) или использование DBaaS
Redis Sentinel – развёртывание кластера из 3 нод для автоматического восстановления сессий при отказе мастера
CI/CD – настройка пайплайнов в GitLab (или Gitea/GitFlic) для автоматической сборки, тестирования, безопасного деплоя (zero‑downtime) и быстрого отката
Объектное хранилище S3 – развёртывание (MinIO или Ceph) на физических серверах (минимум 3–4 ноды, сеть 10+ Gbps, синхронизация времени) или использование готового S3‑совместимого облачного хранилища
Мониторинг и логирование – внедрение стека Prometheus + Grafana, Loki/ELK/Vector, Zabbix для железа, настройка алертов (Alertmanager / Grafana‑алерты) с круглосуточным оповещением
Автоматизировать всю инфраструктуру как код (IaC) – писать Terraform‑манифесты, Ansible‑плейбуки, Docker Compose / Helm‑чарты
Обеспечивать отказоустойчивость, производительность и безопасность системы
Документировать архитектуру, схемы и процедуры аварийного восстановления
Участвовать в выборе между самостоятельным хостингом и облачными сервисами (SaaS/DBaaS) с точки зрения экономической целесообразности и надёжности
Требования
Опыт коммерческой разработки и сопровождения высоконагруженных распределённых систем от 3‑х лет
Глубокое знание Linux (ядро, сеть, файловые системы, планировщики)
Опыт настройки балансировщиков (Nginx, HAProxy, AWS ELB / Cloud LB)
Практика развёртывания и администрирования кластеров баз данных (PostgreSQL / MySQL / MariaDB) – репликация, автоматическое переключение (Patroni / Orchestrator / MHA), бэкапы
Опыт работы с Redis Sentinel и/или кластерным Redis