Публикатор: Petruha
Публикатор: Petruha
Обсуждение:
@devops_jobs
#резюме
#devops
#sre
#baremetal
#llm
Позиция: Platform / Infrastructure Engineer (Middle)
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Оформление: обсуждаемо, спокойно принимаю оплату криптой (USDT и др.)
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: пайплайн нормализации событий K8s и метрик Prometheus в Qdrant, RAG-слой (Nomic Embed Text v2 + reranker, тюнинг chunk sizing), LLM-based sanity checks на каждом этапе (DeepSeek primary, Gemini fallback). Бенчил llama.cpp, vLLM, Transformers, остановился на Qwen 3.5 на llama.cpp. Автоматические аномалии, графики, новые варнинги за неделю. Перевёл мониторинг с реактивного (только critical) на проактивный: поймали деградирующий диск в проде до отказа. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Нашёл и онбордил полевого инженера для деплоя на кампусе из 55 корпусов, менторил по сетевой инфраструктуре.
- Отвечаю за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · vLLM · Ray · Qdrant
Английский: C1
Контакт:
@ptruha
Откликнуться в Telegram →
⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.