Публикатор
Публикатор: ️
Обсуждение:
@devops_jobs
#резюме
#devops
#sre
Позиция: DevOps/SRE-инженер
Формат: удалённо
Занятость: full-time
Ожидания: от 270т.р. net
Контакты:
@bartovk0
О себе:
DevOps/SRE-инженер, 3,5 года в эксплуатации Kubernetes, из них 2 года в платформенной команде VK. Поддерживаю платформу на VK Cloud для 6 продуктовых команд и 50+ микросервисов (пик 10–15 тыс. RPS): Terraform, Argo CD, GitLab CI, VictoriaMetrics, PostgreSQL (Patroni), Kafka, Vault. Сократил MTTR на 40%, стоимость compute на 29%, время релиза вдвое.
Опыт:
VK (08.2024-н.в.)
- Перевёл 50+ микросервисов 6 продуктовых команд с изолированных ВМ в VK Cloud Managed Kubernetes (2 кластера, 200+ нод, пик 10–15 тыс. RPS) без простоя и потери данных. Технически вёл миграцию в команде из 6 человек: план и волны переезда, Helm-чарты, Terraform, Argo CD, переключение трафика, откаты, контроль метрик. Отдельно перенёс legacy-кластер на новую платформу.
- Сократил MTTR с 45 до ~26 минут (−40%): ввёл SLO и error budget для 10–12 критичных сервисов и API, провёл 15–20 blameless postmortem (Kafka, Kubernetes, сеть, БД), дежурил в on-call-ротации. Построил алертинг на VictoriaMetrics, vmalert и Alertmanager, логи на Loki, дашборды в Grafana; писал на Python exporter'ы и CLI-утилиты для проверки доступности и валидации конфигов.
- Сократил восстановление PostgreSQL из бэкапа с нескольких часов до 20–40 минут и довёл RPO критичных БД почти до нуля при RTO 5–15 минут: 3–4 кластера на Patroni (1–2 ТБ), синхронная репликация, PITR; ускорил тяжёлые запросы в 2–5 раз (индексы, секционирование, тюнинг). Эксплуатировал Kafka (5 брокеров, 15–25 тыс. сообщений/с, пик до 60 тыс.) и Redis.
- Сократил время релиза с 50 до 23 минут, а долю неуспешных деплоев — с 10–12% до 3–4%: перевёл доставку на GitOps (Argo CD, pull-модель) и закрыл CI доступ к прод-кластерам, ускорил сборки в GitLab CI на 70% (multi-stage Docker, кеш слоёв). Встроил Trivy в 15–20 пайплайнов с блокировкой критических уязвимостей, перевёл секреты 30–40 сервисов в HashiCorp Vault (Kubernetes auth, политики по командам, динамические секреты с TTL).
- Сократил подъём нового окружения с 2 дней до 3 часов и стоимость compute на 29%: собрал библиотеку Terraform-модулей (VPC, IAM, Kubernetes), по которой команды сами поднимают dev/staging через CI/CD и GitOps; настроил автоскейлинг нод на Karpenter с прерываемыми ВМ и HPA. Изоляцию команд закрыл Kyverno (policy-as-code), RBAC и сетевыми политиками Cilium (eBPF, chaining поверх штатного CNI, Hubble).
ООО "Лимон" (04.2023-07.2024)
- Сократил путь от коммита до продакшена с 4 часов до 40 минут, а ручные операции при релизе — на 80%: построил CI/CD в GitLab CI и Jenkins для 5 проектов — тесты, сборка Docker-образов, деплой в Kubernetes через Helm.
- Сократил подготовку физического хоста с 3–4 часов до 10–15 минут: автоматизировал на Ansible настройку ОС, SSH, firewall, LVM, Docker/containerd, агентов мониторинга и бэкапов для парка из 35–40 хостов и 100–150 ВМ на KVM и Proxmox.
- Сократил простои 20+ микросервисов в 5 раз (с ~36 до ~7 часов в месяц, доступность 95% → 99%): администрировал bare metal Kubernetes-кластер на 8 нодах, настроил Ingress-контроллер Nginx, написал типовые Helm-чарты, поднял мониторинг на Prometheus и Grafana и сбор логов в ELK.
- Сократил запуск нового сервиса с 1 дня до 30 минут и убрал расхождения зависимостей между окружениями: контейнеризировал 10+ legacy-приложений (multi-stage Dockerfile, docker-compose для dev и stage).
Технический стек:
Linux | Bash | Python | Docker | Ansible | Prometheus | Grafana | GitLab CI | Terraform | Kubernetes | ArgoCD | GitOps | VictoriaMetrics | Alertmanager | Loki | Cilium | Karpenter | Kyverno | HashiCorp Vault | Trivy | Patroni | SRE | Observability | IaC | VK Cloud | Helm | PostgreSQL | Kafka | Redis | CI/CD
Откликнуться в Telegram →
⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.