← Tüm Projeler
İzleme & Bakım

Sunucu ve Ağ Altyapısı İçin 7/24 Merkezi İzleme ve Otomatik Bakım

Merkezi izleme ve otomatik bakım sistemi projesi vaka analizi teknik görseli

1. Proje Özeti ve Müşteri Profili

B2B SaaS alanında bulut yazılım hizmeti veren ve 40'tan fazla sanal sunucu ile veritabanı kümesi işleten bir teknoloji şirketi, müşterileri kesintiyi fark etmeden önce sorunları yakalayan proaktif bir izleme ve bakım yapısına ihtiyaç duydu.

Sistemde merkezi bir gözlemleme paneli olmadığı için disk dolulukları, kilitlenen veritabanı bağlantıları veya SSL sertifikası bitiş tarihleri manuel olarak kontrol ediliyor; zaman zaman gözden kaçan durumlar servis kesintilerine yol açıyordu.

[ ESKİ DÜZEN ] : Manuel Kontrol ──> Servis Çökünce Müşteri Şikayeti ──> Reaktif Müdahale
[ YENİ MİMARİ ]: Zabbix 7.0 + Grafana ──> Telegram Anlık Alarm ──> Otomatik Self-Healing Scriptleri

2. Karşılaşılan Kritik Altyapı Problemleri

  • Sürpriz Disk Dolulukları: Log dosyalarının beklenmedik şekilde büyümesi sebebiyle sunucuların aniden kilitlenmesi.
  • Sessiz Servis Durmaları: Nginx veya PHP-FPM servislerinin yanıt vermeyi kesmesi ancak sunucu açık göründüğü için durumun geç fark edilmesi.
  • SSL ve Domain Süre Takipsizliği: Kritik API endpoint'lerinin SSL sertifikası bittiğinde müşterilerin servise erişememesi.

3. Uygulanan Mimari Çözüm ve Adımlar

Aşama 1: Zabbix 7.0 LTS Dağıtımı

  • Tüm Linux ve Windows sunuculara şifreli (TLS-PSK) Zabbix Agent 2 kuruldu.
  • Ağ switch'leri, firewall ve UPS cihazları SNMPv3 üzerinden metrik havuzuna dahil edildi.
  • HTTP/HTTPS Web Endpoint senaryoları yazılarak SSL sertifika süreleri, DNS çözümleme gecikmeleri ve API durum kodları izlendi.

Aşama 2: Grafana Dashboard Görselleştirme

  • Yönetim ekibi ve nöbetçi sistem yöneticileri için büyük ekran Network Operations Center (NOC) paneli tasarlandı.
  • CPU, RAM, Disk I/O, Ağ Trafiği ve Veritabanı QPS (Queries Per Second) metrikleri tek bir ekranda canlı akışa alındı.

Aşama 3: Akıllı Alarm ve Otomatik İyileştirme (Self-Healing)

  • Olaylar önem derecesine (Warning, High, Disaster) göre sınıflandırıldı.
  • Kritik bir servis durduğunda Zabbix Remote Command ile servisi otomatik yeniden başlatan (INLINECODE0) self-healing kuralları tanımlandı.
  • Çözülemeyen durumlar için doğrudan nöbetçi mühendisin Telegram ve Slack hesabına anlık bildirim tetiklendi.

4. Elde Edilen Ölçülebilir Sonuçlar

Metrik Proje Öncesi Proje Sonrası İyileşme
Arıza Tespit Süresi ~45 Dakika (Müşteri Bildirimi) < 2 Dakika (Proaktif) %95 Hızlı Tespit
Müşteri Kaynaklı Biletler Ayda ortalama 18 bilet Ayda 2 bilet %88 Azalma
Otomatik Çözülen Arızalar %0 %40 (Self-Healing) İnsan Müdahalesi Azaldı
SSL / Alan Adı Kesintisi Yaşanıyordu 0 Kesinti (30 Gün Önceden Uyarı) %100 Süreklilik


5. Kullanılan Teknolojiler

  • İzleme Sunucusu: Zabbix Server 7.0 LTS, PostgreSQL 16 + TimescaleDB
  • Görselleştirme: Grafana 11 Enterprise
  • Entegrasyon & Bildirim: Telegram Bot API, Slack Incoming Webhooks
  • Otomasyon & Scripting: Bash, Python 3, PowerShell Core

Altyapınızı 7/24 Gözlem Altına Almak İster Misiniz?

Sunucularınız, ağ cihazlarınız ve servisleriniz için Zabbix ve Grafana tabanlı profesyonel bir izleme sistemi kurmak isterseniz izleme ve bakım hizmetlerimi ve sistem yönetimi çözümlerimi inceleyebilir veya benimle iletişime geçebilirsiniz.

Benzer bir altyapı iyileştirmesine mi ihtiyacınız var?

Sunucu, ağ, yedekleme veya güvenlik mimarinizi daha stabil, güvenli ve sürdürülebilir hale getirelim.