Срок подачи резюме
DevOps
Срок подачи резюме:
До 13.00 8.10.2026
Требуется подключение к проекту ASAP
Грейд: Senior
Занятость: Full time
Длительность проекта: 3 мес
ГПХ или ИП
Локация: РФ
Гражданство: РФ
О проекте: проект по эксплуатации и оптимизации Kubernetes-кластера и Apache Airflow с работой с базами данных PostgreSQL и ClickHouse
Задачи
— Эксплуатация Kubernetes-кластера: обновление без простоя, диагностика подов, управление persistent storage
— Настройка автоскейлинга: HPA, VPA, Cluster Autoscaler
— Мониторинг кластера через Prometheus и встроенные инструменты облака
— Управление Apache Airflow: выбор executor, деплой в Kubernetes через Helm
— Обработка ошибок и retry-политики в ETL-пайплайнах
— Мониторинг и оптимизация DAG: анализ производительности, оптимизация
— Управление версионированием и деплоем DAG
— Выбор и оптимизация СУБД: PostgreSQL для OLTP, ClickHouse для OLAP
— Настройка репликации и бэкапов, PITR
— Performance-оптимизация баз: query profiling, индексы, партиционирование
— Логическая и физическая миграция данных
— Управление инфраструктурой через Terraform
— Управление секретами и их rotation
— Диагностика инцидентов, восстановление систем
— Планирование disaster recovery и capacity planning
Требования
— Kubernetes: эксплуатация кластеров, rolling updates, PDB, drain, диагностика подов (OOM, throttle, eviction), persistent storage
— Автоскейлинг: HPA, VPA, Cluster Autoscaler, metrics pipeline, custom metrics
— Мониторинг кластера: ключевые метрики (CPU, memory, PVC, restarts, node pressure, API latency), Prometheus
— IaC для Kubernetes: Terraform, Helm для развертывания кластеров и приложений, модульность, параметризация, CI/CD для манифестов
— Apache Airflow: архитектура, executor (Local, Celery, Kubernetes), деплой в Kubernetes через Helm
— Обработка ошибок: retry policy, exponential backoff, idempotent tasks, DLQ, on_failure alerting
— Мониторинг DAG: анализ длительности задач, pool saturation, sensor лаги, deferrable operators
— Версионирование DAG: GitSync, образы, CI/CD pipeline, семантическое версионирование, rollback
— СУБД: OLTP (PostgreSQL) vs OLAP (ClickHouse), распределённые таблицы, движки хранения
— Репликация и бэкапы: настройка репликации, PITR, RPO/RTO, тестирование восстановления
— Query profiling: pg_stat, system.query_log, индексы, партиционирование, materialised views
— Миграция данных: логическая и физическая миграция, DMS-инструменты, minimal downtime, logical replication
— Terraform для облака: сети, ВМ, managed-сервисы
— Управление секретами: Vault, Lockbox, External Secrets, rotation, least privilege
— Метрики и логи инфраструктуры: дашборды, SLO/SLI, on-call, tracing для ETL
— Multi-AZ, резервные кластеры, runbook'и
— Диагностика деградации ETL, восстановление scheduler'а, blue-green deployment
Требования
— Аналитическое мышление для диагностики комплексных проблем инфраструктуры
— Ответственность за надёжность критичных систем
— Внимание к деталям при управлении конфигурациями и миграциями
— Коммуникативность для работы над инцидентами и runbook'ами
Объём работы — 164 часа. Специалист должен иметь глубокий уровень знаний сеньора по всем указанным направлениям: в частности, обоснованный выбор компонентов (executor, СУБД, стратегии миграции), понимание взаимодействия механизмов, опыт диагностики и оптимизации под load, проведение тренировок восстановления систем.
🌝
🌝
🌝
При отклике прошу сразу указывать в сопроводительном письме следующий опыт
:
— опыт именно с Kubernetes и контейнерной инфраструктурой (эксплуатация, автоскейлинг, мониторинг, IaC) - какой проект, сколько лет опыта
— опыт с Apache Airflow: архитектура, executor, обработка ошибок, мониторинг DAG, версионирование и деплой- указать проекты, число лет опыта
— опыт с обеими СУБД: PostgreSQL (OLTP) и ClickHouse (OLAP), включая репликацию, бэкапы, оптимизацию
Направить CV
@EkaterinaLiberman
Откликнуться в Telegram →
⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.