גיבוי ושיקום מאסונות (BCP/DRP)

יסודות הגיבוי והשיקום

גיבוי ושיקום מאסונות הם רכיבים קריטיים בכל אסטרטגיית אבטחת סייבר. עם העלייה במתקפות כופר (ransomware) ובאסונות (טבעיים או טכנולוגיים), קיומם של תוכניות איתנות ל-BCP (Business Continuity Planning) ול-DRP (Disaster Recovery Planning) הוא חיוני.

RTO ו-RPO: מושגי יסוד

RTO (Recovery Time Objective)

הגדרה: זמן ההשבתה המרבי המתקבל לאחר אסון

דוגמה: RTO של 4 שעות משמעו שהמערכות חייבים להיות משוחזרים תוך 4 שעות

השפעה: מגדיר את דחיפות הנושא ואת ההשקעה הנדרשת בפתרונות

RPO (Recovery Point Objective)

הגדרה: כמות הנתונים המרבית שעלולה להיאבד, נמדדת בזמן

דוגמה: RPO של שעה אחת משמעו שהגיבויים חייבים להתרחש בכל שעה

השפעה: מגדיר את תדירות הגיבויים ואת טכנולוגיות השכפול

רמת קריטיות:

  • Tier 1 (קריטי): RTO < 1h, RPO < 15min - שכפול סינכרוני
  • Tier 2 (חשוב): RTO 4-8h, RPO 1h - גיבוי אינקרמנטלי תכוף
  • Tier 3 (רגיל): RTO 24h, RPO 24h - גיבוי יומי

כלל הגיבוי 3-2-1

אסטרטגיית הזהב להגנת נתונים:

  • 3 שלוש עותקים של הנתונים: סביבת הפקה + 2 גיבויים
  • 2 שני סוגי מדיה שונים: דיסק, סרט, ענן
  • 1 עותק אחד מחוץ לאתר: מופרד גאוגרפית

התפתחות מודרנית: 3-2-1-1-0
+ עותק אחד בלתי ניתן לשינוי (חסין בפני כופר)
+ 0 שגיאות בשחזור (בדיקות סדירות)

סוגי גיבוי

1. גיבוי מלא (Full)

  • יתרון: שחזור פשוט ומהיר
  • חסרון: איטי, צורך הרבה שטח אחסון
  • שימוש: שבועי או חודשי כ-baseline

2. גיבוי אינקרמנטלי

  • יתרון: מהיר, חוסך שטח אחסון
  • חסרון: השחזור דורש את ה-full ואת כל הגיבויים האינקרמנטליים
  • שימוש: יומי או שעתי בין ה-fulls

3. גיבוי דיפרנציאלי

  • יתרון: שחזור פשוט יותר מאשר אינקרמנטלי
  • חסרון: גדל עד ה-full הבא
  • שימוש: יומי כאשר פשטות ה-restore קריטית

4. Snapshot ושכפול

  • Snapshots: עותקי point-in-time, שחזור מיידי
  • שכפול סינכרוני: אפס אובדן נתונים (RPO=0)
  • שכפול אסינכרוני: מבוזר גאוגרפית

טכנולוגיות ופתרונות

On-Premises

  • Veeam Backup & Replication: מובילה לסביבות מוורחות
  • Commvault, Veritas NetBackup: Enterprise backup platforms
  • Acronis Cyber Protect: גיבוי + antimalware משולב
  • Dell EMC Data Domain: Deduplicated backup appliances

Cloud-Based

  • AWS Backup: גיבוי מרוכז לשירותי AWS
  • Azure Backup: משולב עם שירותי Azure
  • Google Cloud Backup: גיבויים אוטומטיים של GCP
  • Druva, Backblaze B2: Cloud-native backup solutions

מסדי נתונים

  • MySQL/PostgreSQL: pg_dump, mysqldump + point-in-time recovery
  • MongoDB: mongodump, Ops Manager backup
  • SQL Server: Native backup + Always On Availability Groups
  • Oracle RMAN: Recovery Manager לסביבות Oracle

הגנה מפני כופר

גיבויים חסינים בפני כופר:

  • אי-שינויות (אימוטביליות): Object lock (S3), WORM storage, immutable backups
  • Air-gapping: גיבויים ללא חיבור מנותקים מהרשת
  • הפרדת הרשאות: Backup admins ≠ domain admins
  • MFA: אימות רב-שלבי לגישה לגיבויים
  • ניהול גרסאות: מספר גרסאות לשחזור לפני הדבקה
  • Scanning: antimalware על הגיבויים לפני השחזור
  • התראות: זיהוי שינויים המוניים (הצפנה אפשרית)

Disaster Recovery Planning

  • DR Site: מרכז נתונים משני או אזור ענן
  • Failover Automation: סקריפטים או תזמור אוטומטי
  • Runbooks: תיעוד שלב-אחר-שלב של השיקום
  • תעדוף: סדר השיקום בהתבסס על קריטיות
  • תלויות: מפת תלויות הדדיות בין מערכות
  • Network Configuration: DNS, VPN, firewall rules עבור DR
  • Communication Plan: בעלי עניין, לקוחות, צוות

בדיקות שחזור

סוגי בדיקות (יש לבצע לפחות שנתית):

  • Tabletop Exercise: דיון תיאורטי בתוכנית ללא ביצוע
  • Restore Testing: שחזור של דגימות בסביבה מבודדת
  • Partial Failover: Failover של מערכות לא קריטיות
  • Full DR Test: Failover מלא (בדרך כלל ב-maintenance window)
  • Chaos Engineering: תקלות המוזרקות במכוון

חשוב: גיבוי שלא נבדק אינו גיבוי. תקלות מתגלות ברגע הצורך אם אין בדיקות סדירות.

שיטות עבודה מומלצות

  • [OK] ליישם את כלל 3-2-1-1-0
  • [OK] להגדיר RTO/RPO ברורים לכל מערכת
  • [OK] גיבויים בלתי ניתנים לשינוי להגנה מפני כופר
  • [OK] בדיקות שחזור רבעוניות
  • [OK] ניטור והתראות על כשלי גיבוי
  • [OK] הצפנת גיבויים (at rest ו-in transit)
  • [OK] תיעוד מעודכן של runbooks
  • [OK] הפרדת הרשאות (backup admin ≠ domain admin)
  • [OK] שמירה בהתאם ל-compliance (LGPD, SOX וכדומה)
  • [OK] DR site מבוזר גאוגרפית