Публикатор: Vadim
Публикатор: Vadim
Обсуждение:
@devops_jobs
#резюме
#devops
#sre
#platformengineer
#kubernetes
#remote
#fulltime
#gitops
#iac
DevOps / SRE / Platform Engineer
Опыт работы: 4 года 7 месяцев
Локация: Москва, Россия
Формат: Удаленно
Занятость: Full-time
Контакт:
@DevOps_savage
Ключевой стек:
- Orchestration & Mesh: Kubernetes, Helm, Argo CD, Istio, Docker
- IaC & Automation: Terraform, Ansible, Python, Bash
- CI/CD & DevSecOps: GitLab CI/CD, Jenkins, HashiCorp Vault, Trivy, SonarQube
- Observability & Logging: Prometheus, Grafana, Jaeger, Alertmanager, ELK/EFK Stack
- DB, Caching & Brokers: PostgreSQL (Patroni, pgBackRest), Redis, Apache Kafka, RabbitMQ
- Cloud & Infrastructure: AWS, Yandex Cloud, Nginx, HAProxy, Linux (Ubuntu, CentOS)
Главные кейсы и достижения:
Миграция, K8s и IaC (Платформа):
- Спроектировал и реализовал zero-downtime миграцию 50+ микросервисов из изолированных ВМ в Managed Kubernetes через Terraform (3 кластера, 300+ нод).
- Разработал библиотеку переиспользуемых Terraform-модулей (VPC, IAM, EKS, DB), сократив время развертывания новых окружений с 2 дней до 30 минут.
- Провел FinOps-оптимизацию ресурсов (right-sizing, spot-инстансы, HPA/VPA): снизил утилизацию CPU в простое на 40% при росте общего трафика системы на 50%.
CI/CD, GitOps и DevSecOps:
- Внедрил платформу автоматизированного деплоя на базе K8s, Helm и Argo CD, сократив Time-to-Market с 4 дней до 3 часов, а время релиза в GitLab CI — с 35 до 8 минут (failed deployments снизились на 45%).
- Развернул HashiCorp Vault для 150+ сервисов, полностью ликвидировав хардкод-секретов в Git и автоматизировав их ротацию.
- Встроил Trivy и SonarQube в CI/CD пайплайны и перевел 30+ сервисов на multi-stage builds, уменьшив размер Docker-образов на 55%.
Observability, Service Mesh и Надежность (SRE):
- Настроил Istio Service Mesh для 40+ микросервисов (канареечные релизы с автоматическим откатом при error rate > 1%).
- Построил единый контур мониторинга по принципам SLO/SLA (Prometheus, Grafana, Jaeger): снизил MTTR с 35 до 10 минут, сократил ложные алерты на 60% и поднял SLA до 99.98%.
- Внедрил централизованный сбор логов (>10 млн записей в сутки), сократив время локализации сложных аномалий с 25 до 5 минут.
Базы данных и Высокая нагрузка:
- Настроил катастрофоустойчивый кластер PostgreSQL (Patroni, pgBackRest) с авто-бэкапами в S3 (RTO < 5 минут, RPO < 30 секунд).
- Оптимизировал Redis-кластер под нагрузкой >20K RPS, снизив p99 latency ответов БД на 30%.
- Автоматизировал управление Kafka-кластером (8 брокеров) и массовую конфигурацию 150+ Linux-серверов через Ansible playbooks (время обновления сократилось с 2 дней до 3 часов).
Откликнуться в Telegram →
⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.