Usługi / Administracja IT

Operacje

Day-2 z właścicielem, oknem i śladem

Przejmujemy albo wspieramy utrzymanie: hosty, wirtualizację, tożsamość, kopie i dyżur. Proxmox albo inna platforma ma mapę. Grafana pokazuje zdrowie. Backup ma test restore. Zmiana ma okno, nie przypadek.

24/7 Dyżur na priorytet, z runbookiem
Okno Patch i zmiana w kalendarzu, ze śladem
IAM Konta imienne, 2FA, cykl życia dostępu
Restore Test odtworzenia, nie samo zadanie backupu
Jak to składa się w całość

Jedna mapa systemów, jeden kanał eskalacji

Administracja bez obserwowalności reaguje po fakcie. Backup bez restore to założenie. Składamy konsolę platformy, klaster, alerty i kopie w jeden dyżur.

  • Patch management obejmuje hosty, hypervisory i gości, z kolejnością zależną od HA.
  • Tożsamość i MFA są częścią retaineru, nie osobnym projektem raz na rok.
Proxmox VE, datacenter, węzły, CPU i storage
01, Proxmox

Datacenter, który widać w jednej konsoli

Proxmox VE na klastrze: węzły, VM, kontenery, storage i HA. Patch i migracja żywej maszyny są w kalendarzu. Dostęp root nie jest codziennym narzędziem.

Inwentarz

Maszyny, CT, sieć i storage z właścicielem. Złote obrazy zamiast ręcznego installera na każdej VM.

Okna

Aktualizacje węzłów i gości z PDB albo kolejnością HA. Cofnięcie jest w planie, nie w nadziei.

Dostęp

Konta imienne, 2FA, osobny jump. Log każdego logowania i zadania w klastrze.

Pojemność

CPU, RAM i storage z progiem. Rozbudowa zanim gość zacznie swapować.

Kubernetes Dashboard, pody, CPU i pamięć
02, Kubernetes

Kontenery pod tą samą opieką co VM

Gdy część usług jest na klastrze, administracja obejmuje węzły, certyfikaty, storage class i upgrade. Nie zostawiamy Kubernetesu jako wyspy poza dyżurem.

Węzły

Patch OS, kubelet i runtime w oknie. Drain i cordon, nie reboot w południe.

Addony

Ingress, DNS, storage, cert-manager. Wersje i backup konfiguracji są spisane.

Obserwacja

Zdrowie poda i węzła w Grafanie, nie tylko w dashboardzie ad hoc.

Granica

RBAC i NetworkPolicy. Administracja nie oznacza cluster-admin na stałe.

Grafana, katalog dashboardów i źródeł danych
03, Grafana

Alert zanim użytkownik zadzwoni

Host, VM, klaster i usługa mają dashboard. Disk, certyfikat, backup i kolejka mają próg. Dyżur dostaje priorytet i runbook, nie zrzut z Nagiosa bez kontekstu.

Zakres

Linux, Windows tam gdzie jest, baza, kolejka, HTTP. Jedna lista ciszy na utrzymanie.

Priorytet

P1 to utrata usługi. P3 to zbliżający się certyfikat. Nie wszystko budzi o trzeciej.

Korelacje

Host i aplikacja obok siebie. Awaria storage nie wygląda jak tajemniczy timeout API.

Raport

Tydzień: ile alertów, ile okien, co zostało otwarte. Materiał na przegląd z Wami.

Proxmox Backup Server, datastore, retencja i transfer
04, Backup

Kopia, którą da się odtworzyć

Proxmox Backup Server albo drugi tor poza lokalizacją. Retencja, immutability i test restore są w umowie. Nieudane zadanie to alert, nie cichy mail.

Zakres

VM, CT, bazy i konfiguracja. Sekret vault poza tym samym bucktem co dane aplikacji.

RPO i RTO

Spisane per system. Restore pojedynczego pliku i całej maszyny są ćwiczone.

Osobny tor

Druga kopia na innych kontach. Ransomware na produkcji nie kasuje jedynej kopii.

Ludzie

Kto odtwarza, w jakiej kolejności, z jakim DNS. Playbook dostępny offline.

Operacja

Od przejęcia do rytmu tygodnia

Najpierw inwentaryzacja i dostęp. Potem baseline monitoringu i kopii. Na końcu okna, IAM i raport.

  1. Przejęcie Mapa hostów, kont, kopii, kto ma klucz, jaki SLA.
  2. Baseline Monitoring, backup, pierwsze okna, wyłączenie zbędnego dostępu.
  3. Rytm Patch, przegląd alertów, test restore, wniosek o zmianę.
  4. Dyżur Eskalacja, raport, materiał pod audyt zmian.
Rozmowa

Omówimy mapę systemów, dyżur i okna

Na tej podstawie przygotujemy zakres opieki administracyjnej.

Skontaktuj się