Curs monitorizare infrastructură IT

Instalarea și configurarea Zabbix, Prometheus, Grafana și Loki pentru vizibilitate reală asupra serverelor și aplicațiilor.

16 capitole96 lecții4 h 3 minNivel: intermediarCertificat la final
Curs monitorizare infrastructură IT

Ce veți învăța

  • Instalați și configurați Zabbix Server cu agenți pe mai multe hosturi
  • Configurați Prometheus cu node_exporter și scrieți interogări PromQL de bază
  • Construiți dashboard-uri Grafana cu variabile, praguri și adnotări
  • Configurați alertare pe Telegram și Slack prin Alertmanager sau acțiuni Zabbix
  • Centralizați jurnalele cu Loki și Promtail și le interogați cu LogQL
  • Monitorizați containere și clustere Kubernetes cu cAdvisor și kube-state-metrics
  • Configurați monitorizare de rețea prin SNMP pentru switch-uri și routere
  • Optimizați retenția și performanța stivei de monitorizare pentru producție

Despre curs

Cursul „Monitorizare infrastructură IT” explică instalarea și configurarea celor mai folosite unelte de monitorizare din industrie, Zabbix și Prometheus, împreună cu Grafana pentru vizualizare și Loki pentru jurnale centralizate. Zabbix folosește un model de colectare activă sau pasivă printr-un agent dedicat, în timp ce Prometheus interoghează periodic un endpoint /metrics expus de fiecare serviciu, două arhitecturi diferite pe care le veți configura pe rând.

Veți instala Zabbix Server pe Ubuntu 24.04 sau AlmaLinux 9, veți adăuga hosturi cu Zabbix Agent 2 și veți aplica template-uri oficiale precum „Linux by Zabbix agent”. În paralel, veți configura Prometheus cu node_exporter pentru metrici de sistem și mysqld_exporter pentru baze de date, scriind interogări PromQL precum rate() și avg_over_time() pentru analiza tendințelor.

Un bloc dedicat Grafana arată conectarea surselor de date Zabbix și Prometheus, importul unor dashboard-uri gata construite din Grafana.com, precum ID-ul 1860 pentru Node Exporter Full, și construirea de panouri proprii cu variabile de filtrare pe host. Alertarea este tratată separat pentru fiecare unealtă, cu acțiuni și escaladări în Zabbix și cu Alertmanager pentru Prometheus, ambele cu notificări pe Telegram sau Slack.

Capitolul despre Loki și Promtail acoperă jurnalizarea centralizată cu interogări LogQL, iar un capitol separat arată corelarea metricilor cu jurnalele pe același dashboard, utilă pentru a trece rapid de la un vârf de utilizare CPU la jurnalele din intervalul respectiv. Un capitol acoperă monitorizarea containerelor cu cAdvisor și kube-state-metrics pentru clustere Kubernetes, iar altul monitorizarea echipamentelor de rețea prin SNMP.

Cursul se încheie cu un laborator în care construiți o stivă completă de monitorizare pentru trei servere, cu dashboard-uri Grafana, jurnale centralizate în Loki și alertare pe Telegram, apoi simulați un incident pentru a exersa depanarea cu instrumentele configurate. Se adresează administratorilor de sistem și inginerilor DevOps care întrețin infrastructură în producție și au nevoie de vizibilitate reală asupra stării serverelor.

Pentru cine este cursul

Administratori de sistem și ingineri DevOps care întrețin servere și aplicații în producție și vor vizibilitate reală asupra stării infrastructurii.

Pentru cine nu este

Persoane fără experiență de administrare Linux sau care caută doar o prezentare generală a conceptului de monitorizare, fără configurare practică.

Ce trebuie să știți înainte

Experiență de bază în administrarea Linux, noțiuni despre servicii systemd și familiaritate minimă cu Docker.

Ce veți putea face după curs

  • Veți putea propune o arhitectură de monitorizare pentru o infrastructură nouă
  • Veți ști să alegeți între Zabbix și Prometheus în funcție de context
  • Veți putea construi dashboard-uri Grafana pregătite pentru o echipă de operare
  • Veți putea reduce alertele false prin praguri bazate pe istoric
  • Veți putea integra jurnalele centralizate în procesul de depanare a incidentelor
  • Veți putea documenta un incident cu dovezi din metrici, jurnale și alerte

Cuprins

  1. 1. Fundamentele monitorizării

    • Diferența dintre monitorizare, jurnalizare și tracing gratuit
    • Indicatori SLI, obiective SLO și acorduri SLA2 min
    • Monitorizare de tip black box versus white box3 min
    • Alegerea metricilor relevante pentru un server web (CPU, RAM, disc, latență)2 min
    • Stabilirea pragurilor de alertă pe baza istoricului, nu arbitrar2 min
    • Planificarea arhitecturii de monitorizare pentru mai multe servere2 min
  2. 2. Arhitectura Zabbix

    • Componentele Zabbix Server, Zabbix Agent și Zabbix Proxy2 min
    • Baza de date suportată (MySQL, PostgreSQL) și cerințele de resurse2 min
    • Zabbix Web și rolul interfeței de administrare2 min
    • Modelul de colectare activă versus pasivă a agentului2 min
    • Scalarea cu Zabbix Proxy pentru locații la distanță2 min
    • Alegerea versiunii Zabbix 6.4 LTS pentru producție2 min
  3. 3. Instalarea și configurarea Zabbix Server

    • Instalarea Zabbix Server pe Ubuntu 24.04 din depozitul oficial2 min
    • Instalarea Zabbix Server pe AlmaLinux 9 cu PHP-FPM și Nginx2 min
    • Configurarea bazei de date MySQL pentru Zabbix2 min
    • Configurarea fișierului zabbix_server.conf2 min
    • Securizarea interfeței Zabbix Web cu HTTPS2 min
    • Verificarea stării serviciilor cu systemctl status zabbix-server2 min
  4. 4. Configurarea Zabbix Agent și template-uri

    • Instalarea Zabbix Agent 2 pe hosturile monitorizate2 min
    • Adăugarea unui host nou în interfața Zabbix2 min
    • Aplicarea template-urilor oficiale (Linux by Zabbix agent)2 min
    • Crearea de items personalizate cu UserParameter2 min
    • Configurarea triggerelor cu expresii logice2 min
    • Gruparea hosturilor pentru rapoarte și permisiuni2 min
  5. 5. Prometheus și arhitectura pull based

    • Diferența dintre modelul pull Prometheus și modelul push Zabbix2 min
    • Instalarea Prometheus ca binar sau container Docker2 min
    • Rularea node_exporter pentru metrici de sistem2 min
    • Rularea mysqld_exporter pentru baze de date MySQL2 min
    • Descoperirea automată a țintelor (service discovery)2 min
    • Formatul metricilor expuse pe /metrics2 min
  6. 6. Configurarea Prometheus și PromQL

    • Structura fișierului prometheus.yml și a secțiunii scrape_configs2 min
    • Intervalul de scrape și retenția implicită de 15 zile2 min
    • Interogări PromQL de bază (rate, sum, avg_over_time)2 min
    • Reguli de înregistrare pentru interogări frecvente (recording rules)2 min
    • Reguli de alertare definite direct în Prometheus2 min
    • Verificarea configurației cu promtool check config2 min
  7. 7. Grafana și primele dashboard-uri

    • Instalarea Grafana pe Ubuntu sau AlmaLinux3 min
    • Conectarea sursei de date Prometheus2 min
    • Conectarea sursei de date Zabbix prin plugin-ul oficial2 min
    • Crearea primului dashboard cu panouri de tip Time series2 min
    • Import de dashboard-uri din Grafana.com (ID 1860 pentru Node Exporter Full)2 min
    • Organizarea dashboard-urilor pe foldere și permisiuni3 min
  8. 8. Dashboard-uri Grafana avansate

    • Variabile de template pentru filtrare dinamică pe host2 min
    • Panouri de tip Gauge, Stat și Heatmap2 min
    • Adnotări pentru marcarea evenimentelor de deploy3 min
    • Praguri de culoare (thresholds) pentru semnalare vizuală rapidă3 min
    • Partajarea dashboard-urilor cu linkuri publice sau instantanee3 min
    • Export și versionare a dashboard-urilor ca JSON3 min
  9. 9. Alertare

    • Configurarea acțiunilor și escaladărilor în Zabbix3 min
    • Instalarea și configurarea Alertmanager pentru Prometheus3 min
    • Gruparea și dedublarea alertelor3 min
    • Trimiterea notificărilor pe Telegram cu un bot dedicat2 min
    • Trimiterea notificărilor pe Slack prin webhook2 min
    • Evitarea oboselii de alertă prin praguri și silențiere3 min
  10. 10. Monitorizarea containerelor și Kubernetes

    • Metrici de container cu cAdvisor2 min
    • Instalarea kube-state-metrics pentru starea obiectelor Kubernetes2 min
    • Scrape automat al podurilor cu adnotări Prometheus3 min
    • Dashboard Grafana pentru un cluster Kubernetes2 min
    • Monitorizarea limitelor de resurse (requests și limits)3 min
    • Alertare pe poduri aflate în CrashLoopBackOff3 min
  11. 11. Jurnale centralizate cu Loki

    • Arhitectura Loki și diferența față de Elasticsearch3 min
    • Instalarea Loki și configurarea retenției3 min
    • Colectarea jurnalelor cu Promtail pe fiecare server3 min
    • Etichetarea jurnalelor (labels) pentru interogări rapide3 min
    • Interogări LogQL de bază3 min
    • Conectarea Loki ca sursă de date în Grafana3 min
  12. 12. Corelarea metricilor cu jurnalele

    • Vizualizarea metricilor și jurnalelor pe același dashboard3 min
    • Trecerea de la un vârf de CPU în Grafana la jurnalele din același interval3 min
    • Exemplare (exemplars) pentru legătura dintre metrici și trasee3 min
    • Corelarea alertelor Alertmanager cu jurnalele Loki3 min
    • Construirea unui dashboard de incident pentru depanare rapidă3 min
    • Documentarea unui incident pe baza dovezilor din stivă3 min
  13. 13. Monitorizare de rețea și SNMP

    • Configurarea SNMP pe echipamente de rețea (community string, SNMPv3)3 min
    • Monitorizarea switch-urilor și routerelor cu Zabbix SNMP3 min
    • Alternativa LibreNMS pentru hărți de rețea automate3 min
    • Monitorizarea traficului per interfață (bandwidth)3 min
    • Alertare la interfețe căzute (link down)3 min
    • Descoperirea automată a echipamentelor din rețea3 min
  14. 14. Optimizarea performanței stivei de monitorizare

    • Gestionarea cardinalității ridicate în Prometheus3 min
    • Retenție pe termen lung cu Thanos sau VictoriaMetrics3 min
    • Optimizarea bazei de date Zabbix (partiționare, housekeeping)3 min
    • Dimensionarea resurselor serverului de monitorizare3 min
    • Backup-ul configurațiilor Grafana și Zabbix3 min
    • Separarea mediilor de monitorizare pentru producție și testare3 min
  15. 15. Depanare și greșeli frecvente

    • Praguri statice care generează alerte false la ore de vârf3 min
    • Disc plin pe serverul Prometheus din cauza retenției prea lungi3 min
    • Agent Zabbix care nu raportează din cauza firewall-ului3 min
    • Dashboard-uri Grafana lente din interogări PromQL neoptimizate3 min
    • Alertare duplicată din Zabbix și Alertmanager configurate în paralel3 min
    • Lipsa unui plan de escaladare când nimeni nu răspunde la prima alertă3 min
  16. 16. Laborator final cu o stivă completă de monitorizare

    • Configurarea a trei servere țintă (web, bază de date, aplicație)3 min
    • Instalarea Zabbix sau Prometheus, la alegere, pentru colectarea metricilor3 min
    • Construirea dashboard-urilor Grafana pentru fiecare server3 min
    • Configurarea Loki pentru jurnalele centralizate3 min
    • Definirea alertelor cu escaladare pe Telegram3 min
    • Simularea unui incident și depanarea cu stiva completă3 min
Cine predă
, fondatorul agenției GOAI din Alba Iulia. În mediul online din 1997, în optimizare SEO din 2007. Cursul pornește de la situații întâlnite în lucrul cu clienți din România și este actualizat pe măsură ce uneltele se schimbă. Experiența autorului.
Conținut actualizat la
24 august 2026

Întrebări frecvente despre curs

Trebuie să învăț și Zabbix și Prometheus?

Cursul prezintă ambele, pentru că sunt cele mai folosite soluții din industrie, dar laboratorul final vă lasă să alegeți una dintre ele pentru implementarea completă.

Am nevoie de un cluster Kubernetes pentru curs?

Nu. Capitolul despre Kubernetes folosește un cluster local minimal (minikube sau k3s), suficient pentru exercițiile practice.

Cursul acoperă și alte unelte precum Datadog sau New Relic?

Nu direct. Cursul se concentrează pe unelte open source pe care le puteți instala și controla integral (Zabbix, Prometheus, Grafana, Loki), dar principiile se transferă la orice platformă comercială.

Certificatul de absolvire este recunoscut de un angajator?

Certificatul confirmă parcurgerea cursului și testul final cu prag de 70%, dar nu este o diplomă a Ministerului Educației și nu înlocuiește o certificare precum Zabbix Certified Specialist.

Cursuri din aceeași categorie