· New York, USA · удалённо
Контакт для отклика: @tina_hr29
Грейд: Senior/Senior+/Lead Часовой пояс: работа по часовому поясу Нью-Йорк, США Срок выхода: ASAP Основная задача - разобраться в причинах текущих сбоев, устранить единичные точки отказа и построить предсказуемую, наблюдаемую и отказоустойчивую инфраструктуру. Нам нужен специалист, который сможет не только предложить техническое решение, но и реализовать его самостоятельно. Задачи: — Провести аудит текущей production-инфраструктуры и сетевой архитектуры. — Проанализировать причины существующих сбоев и найти узкие места. — Выявить и устранить единичные точки отказа. — Разработать и реализовать план повышения доступности инфраструктуры. — Администрировать и развивать инфраструктуру на базе Proxmox VE: кластеры, quorum и Corosync; Proxmox HA; — Настраивать floating IP/VIP и автоматическое переключение между узлами. — Регулярно тестировать сценарии failover и восстановления после сбоев. Настраивать и сопровождать сетевую инфраструктуру, маршрутизацию, NAT и firewall. — Развивать мониторинг, централизованное логирование и систему оповещений. — Участвовать в устранении production-инцидентов, проводить RCA и предотвращать повторные сбои. — Автоматизировать инфраструктурные и эксплуатационные задачи. — Создавать и поддерживать техническую документацию, схемы инфраструктуры и runbooks. Что для нас важно: — Сильные знания Linux, Ubuntu. — Практический опыт эксплуатации production-инфраструктуры. — Уверенный опыт работы с Proxmox VE. — Понимание принципов построения отказоустойчивых систем. — Практический опыт настройки HAProxy. — Опыт настройки OpenResty или Nginx. — Опыт работы с Keepalived и протоколом VRRP. — Глубокое понимание TCP/IP, DNS, routing, NAT и VLAN. — Опыт настройки firewall и ACL, включая iptables или nftables. — Умение диагностировать сетевые проблемы с помощью tcpdump, ss, traceroute и других инструментов. — Практический опыт настройки мониторинга и alerting. — Навыки расследования сложных production-инцидентов и проведения Root Cause Analysis. — Опыт автоматизации с помощью Bash или Python. — Способность самостоятельно принимать технические решения и отвечать за результат. Будет преимуществом: — Опыт работы с Prometheus, Grafana, VictoriaMetrics или Zabbix. — Опыт централизованного логирования с ELK или Loki. — Опыт работы с Docker, Docker Compose или Docker Swarm. — Знание Ansible или Puppet. — Опыт создания CI/CD-пайплайнов в GitLab CI или Jenkins. — Опыт администрирования, оптимизации и масштабирования MySQL. — Знание Lua и опыт расширенной конфигурации OpenResty. — Опыт построения backup- и disaster recovery-процессов. — Опыт работы с высоконагруженными или business-critical системами. Что мы предлагаем: — Интересные уникальные задачи — Работа по времени США - Нью Йорк — Комфортные условия труда — Высокая и официальная заработная плата — Высококлассная техника для работы — Бонусы по результатам работы — Профессиональный рост — Карьерный рост — Удаленная работа — Заработная плата по итогам собеседования Контакт для отклика: @tina_hr29