Публикатор: Petruha
Публикатор: Petruha
Обсуждение:
@devops_jobs
#CV
#резюме
#devops
#sre
#kubernetes
#baremetal
#llm
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Оформление: обсуждаемо
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 кластеров Kubernetes, 45 нод, ~10K RPS, uptime 99.85%. Пришёл стажёром DevOps без инфраструктурного бэкграунда в октябре 2024, за 22 месяца четыре повышения. Архитектуру разбираем вдвоём с тимлидом, реализация и эксплуатация на мне: от сборки сервера и монтажа в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Что решал:
- Срезал CPU в проде на 90% (7.75 -> 0.78 ядра) и память на dev/stage на 64%, докопавшись до reload=True, вшитого в общий базовый образ, а не в манифесты. Доказал через py-spy: поток релоадера съедал 769 из 1100 тиков воркера. Раскатал на 143 манифеста в 6 окружениях, сверил сутки до и после, контролем взяв нетронутые сервисы.
- Нашёл и закрыл обход аутентификации на четырёх дев-кластерах: ingress-allowlist по IP обходился клиентским заголовком X-Forwarded-For, наружу торчали ArgoCD, Kafka UI, EMQX и админка Django. Починил на периметре, не трогая конфиги кластеров.
- Разобрал восьмидневный тихий отказ контента на клиентском сайте: Helm lookup возвращал nil под ArgoCD, на каждом синке регенерировалась соль токена Strapi, API-токены протухали, фронт глотал 401 и отдавал пустой каталог. Ни одного алерта. Воспроизвёл, починил одной строкой, пофиксил тот же чарт ещё в пяти окружениях.
- Принял бэкапы и DR всех продовых кластеров и обнаружил, что полные бэкапы падали до 107 дней: бакеты не создавались, retention-политики не было. Починил пайплайн, добавил алертинг. При отказе ноды у провайдера Patroni поднял PostgreSQL сам, Kafka потребовала рук, по итогу написал runbook.
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: события K8s и метрики Prometheus в Qdrant, RAG на Nomic Embed Text v2 с реранкером, бенчмарк llama.cpp, vLLM и Transformers перед выбором Qwen 3.5, fallback-роутинг между провайдерами моделей, sanity-проверки на каждой стадии. Спам из warning-ов перестал быть спамом: платформа сопоставляет алерт с событиями кластера и метриками за тот же интервал и отдаёт объяснение вместо пересылки. Команда пользуется ежедневно.
- Развил CI/CD от одной сборочной джобы до полного цикла (линт, тесты, сборка образов, интеграционные тесты, деплой через ArgoCD, откат) и перевёз 25 микросервисов с ручных VMware-виртуалок на self-hosted k3s. Релизы с недельных на ежедневные, ручных деплоев в прод ноль.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Собрал on-prem кластер у security-sensitive клиента: сам собрал Supermicro, смонтировал в его ЦОДе, вывел в закрытую сеть через WireGuard. После ухода MinIO из open source перевёл хранилище на Rook/Ceph, прототипировав на k3s в AWS через Terraform.
- Менторю джуна-девопса, пишу онбординг-лабу для стажёров, держу доступы 13 инженеров. Нашёл и онбордил полевого инженера под кампус из 55 корпусов.
Своё, вне работы: SSHub, опенсурсный TUI для SSH на Rust: ~59k строк, 100+ звёзд на GitHub,
crates.io
и npm, есть внешние контрибьюторы. Плюс пара системных утилит для Linux.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Rook/Ceph · Cilium · MetalLB · BGP на OPNsense · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL (PITR) · ClickHouse · Kafka · Python · Bash · llama.cpp · vLLM · Qdrant · MCP · Claude Code
Английский: C1
Контакт:
@ptruha
Откликнуться в Telegram →
⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.