fokcus

Devops

· New York, USA · удалённо

Свежая вакансия Появилась 2 ч назад

Обязанности

  • Аудит production-инфраструктуры и сетевой архитектуры.
  • Анализ причин сбоев, устранение единичных точек отказа.
  • Разработка и реализация плана повышения доступности.
  • Администрирование и развитие инфраструктуры на базе Proxmox VE (кластеры, quorum, Corosync, Proxmox HA).
  • Настройка floating IP/VIP и автоматического переключения между узлами.
  • Тестирование сценариев failover и восстановления.
  • Настройка и сопровождение сетевой инфраструктуры, маршрутизации, NAT, firewall.
  • Развитие мониторинга, централизованного логирования и системы оповещений.
  • Участие в устранении production-инцидентов, проведение RCA.
  • Автоматизация инфраструктурных и эксплуатационных задач.
  • Создание и поддержка технической документации, схем инфраструктуры и runbooks.

Требования

  • Сильные знания Linux, Ubuntu.
  • Опыт эксплуатации production-инфраструктуры.
  • Уверенный опыт работы с Proxmox VE.
  • Понимание принципов отказоустойчивых систем.
  • Опыт настройки HAProxy, OpenResty или Nginx.
  • Опыт работы с Keepalived и VRRP.
  • Глубокие знания TCP/IP, DNS, routing, NAT, VLAN.
  • Опыт настройки firewall и ACL (iptables или nftables).
  • Навыки диагностики сетевых проблем (tcpdump, ss, traceroute).
  • Опыт настройки мониторинга и alerting.
  • Навыки расследования production-инцидентов и проведения Root Cause Analysis.
  • Опыт автоматизации с Bash или Python.
  • Способность самостоятельно принимать технические решения и отвечать за результат.

Преимущества

  • Опыт с Prometheus, Grafana, VictoriaMetrics, Zabbix.
  • Опыт централизованного логирования (ELK, Loki).
  • Опыт работы с Docker, Docker Compose, Docker Swarm.
  • Знание Ansible или Puppet.
  • Опыт создания CI/CD в GitLab CI или Jenkins.
  • Администрирование, оптимизация и масштабирование MySQL.
  • Знание Lua и расширенная конфигурация OpenResty.
  • Опыт построения backup и disaster recovery процессов.
  • Опыт работы с высоконагруженными или бизнес-критичными системами.

Условия

  • Работа по часовому поясу Нью-Йорк, США.
  • Удалённая работа.
  • Высокая официальная зарплата.
  • Высококлассная техника.
  • Бонусы по результатам работы.
  • Профессиональный и карьерный рост.
  • Срок выхода ASAP.

Контакт для отклика: @tina_hr29

Навыки

Показать как в источнике
Грейд: Senior/Senior+/Lead
Часовой пояс: работа по часовому поясу Нью-Йорк, США
Срок выхода: ASAP

Основная задача - разобраться в причинах текущих сбоев, устранить единичные точки отказа и построить предсказуемую, наблюдаемую и отказоустойчивую инфраструктуру.
Нам нужен специалист, который сможет не только предложить техническое решение, но и реализовать его самостоятельно.

Задачи:
— Провести аудит текущей production-инфраструктуры и сетевой архитектуры.
— Проанализировать причины существующих сбоев и найти узкие места.
— Выявить и устранить единичные точки отказа.
— Разработать и реализовать план повышения доступности инфраструктуры.
— Администрировать и развивать инфраструктуру на базе Proxmox VE:
кластеры, quorum и Corosync;
Proxmox HA;
— Настраивать floating IP/VIP и автоматическое переключение между узлами.
— Регулярно тестировать сценарии failover и восстановления после сбоев.
Настраивать и сопровождать сетевую инфраструктуру, маршрутизацию, NAT и firewall.
— Развивать мониторинг, централизованное логирование и систему оповещений.
— Участвовать в устранении production-инцидентов, проводить RCA и предотвращать повторные сбои.
— Автоматизировать инфраструктурные и эксплуатационные задачи.
— Создавать и поддерживать техническую документацию, схемы инфраструктуры и runbooks.

Что для нас важно:
— Сильные знания Linux, Ubuntu.
— Практический опыт эксплуатации production-инфраструктуры.
— Уверенный опыт работы с Proxmox VE.
— Понимание принципов построения отказоустойчивых систем.
— Практический опыт настройки HAProxy.
— Опыт настройки OpenResty или Nginx.
— Опыт работы с Keepalived и протоколом VRRP.
— Глубокое понимание TCP/IP, DNS, routing, NAT и VLAN.
— Опыт настройки firewall и ACL, включая iptables или nftables.
— Умение диагностировать сетевые проблемы с помощью tcpdump, ss, traceroute и других инструментов.
— Практический опыт настройки мониторинга и alerting.
— Навыки расследования сложных production-инцидентов и проведения Root Cause Analysis.
— Опыт автоматизации с помощью Bash или Python.
— Способность самостоятельно принимать технические решения и отвечать за результат.
Будет преимуществом:
— Опыт работы с Prometheus, Grafana, VictoriaMetrics или Zabbix.
— Опыт централизованного логирования с ELK или Loki.
— Опыт работы с Docker, Docker Compose или Docker Swarm.
— Знание Ansible или Puppet.
— Опыт создания CI/CD-пайплайнов в GitLab CI или Jenkins.
— Опыт администрирования, оптимизации и масштабирования MySQL.
— Знание Lua и опыт расширенной конфигурации OpenResty.
— Опыт построения backup- и disaster recovery-процессов.
— Опыт работы с высоконагруженными или business-critical системами.

Что мы предлагаем:
— Интересные уникальные задачи
— Работа по времени США - Нью Йорк
— Комфортные условия труда
— Высокая и официальная заработная плата
— Высококлассная техника для работы
— Бонусы по результатам работы
— Профессиональный рост
— Карьерный рост
— Удаленная работа
— Заработная плата по итогам собеседования

Контакт для отклика: @tina_hr29

Похожие вакансии