גיבוי ושיקום מאסונות (BCP/DRP)
יסודות הגיבוי והשיקום
גיבוי ושיקום מאסונות הם רכיבים קריטיים בכל אסטרטגיית אבטחת סייבר. עם העלייה במתקפות כופר (ransomware) ובאסונות (טבעיים או טכנולוגיים), קיומם של תוכניות איתנות ל-BCP (Business Continuity Planning) ול-DRP (Disaster Recovery Planning) הוא חיוני.
RTO ו-RPO: מושגי יסוד
RTO (Recovery Time Objective)
הגדרה: זמן ההשבתה המרבי המתקבל לאחר אסון
דוגמה: RTO של 4 שעות משמעו שהמערכות חייבים להיות משוחזרים תוך 4 שעות
השפעה: מגדיר את דחיפות הנושא ואת ההשקעה הנדרשת בפתרונות
RPO (Recovery Point Objective)
הגדרה: כמות הנתונים המרבית שעלולה להיאבד, נמדדת בזמן
דוגמה: RPO של שעה אחת משמעו שהגיבויים חייבים להתרחש בכל שעה
השפעה: מגדיר את תדירות הגיבויים ואת טכנולוגיות השכפול
רמת קריטיות:
- Tier 1 (קריטי): RTO < 1h, RPO < 15min - שכפול סינכרוני
- Tier 2 (חשוב): RTO 4-8h, RPO 1h - גיבוי אינקרמנטלי תכוף
- Tier 3 (רגיל): RTO 24h, RPO 24h - גיבוי יומי
כלל הגיבוי 3-2-1
אסטרטגיית הזהב להגנת נתונים:
- 3 שלוש עותקים של הנתונים: סביבת הפקה + 2 גיבויים
- 2 שני סוגי מדיה שונים: דיסק, סרט, ענן
- 1 עותק אחד מחוץ לאתר: מופרד גאוגרפית
התפתחות מודרנית: 3-2-1-1-0
+ עותק אחד בלתי ניתן לשינוי (חסין בפני כופר)
+ 0 שגיאות בשחזור (בדיקות סדירות)
סוגי גיבוי
1. גיבוי מלא (Full)
- יתרון: שחזור פשוט ומהיר
- חסרון: איטי, צורך הרבה שטח אחסון
- שימוש: שבועי או חודשי כ-baseline
2. גיבוי אינקרמנטלי
- יתרון: מהיר, חוסך שטח אחסון
- חסרון: השחזור דורש את ה-full ואת כל הגיבויים האינקרמנטליים
- שימוש: יומי או שעתי בין ה-fulls
3. גיבוי דיפרנציאלי
- יתרון: שחזור פשוט יותר מאשר אינקרמנטלי
- חסרון: גדל עד ה-full הבא
- שימוש: יומי כאשר פשטות ה-restore קריטית
4. Snapshot ושכפול
- Snapshots: עותקי point-in-time, שחזור מיידי
- שכפול סינכרוני: אפס אובדן נתונים (RPO=0)
- שכפול אסינכרוני: מבוזר גאוגרפית
טכנולוגיות ופתרונות
On-Premises
- Veeam Backup & Replication: מובילה לסביבות מוורחות
- Commvault, Veritas NetBackup: Enterprise backup platforms
- Acronis Cyber Protect: גיבוי + antimalware משולב
- Dell EMC Data Domain: Deduplicated backup appliances
Cloud-Based
- AWS Backup: גיבוי מרוכז לשירותי AWS
- Azure Backup: משולב עם שירותי Azure
- Google Cloud Backup: גיבויים אוטומטיים של GCP
- Druva, Backblaze B2: Cloud-native backup solutions
מסדי נתונים
- MySQL/PostgreSQL: pg_dump, mysqldump + point-in-time recovery
- MongoDB: mongodump, Ops Manager backup
- SQL Server: Native backup + Always On Availability Groups
- Oracle RMAN: Recovery Manager לסביבות Oracle
הגנה מפני כופר
גיבויים חסינים בפני כופר:
- אי-שינויות (אימוטביליות): Object lock (S3), WORM storage, immutable backups
- Air-gapping: גיבויים ללא חיבור מנותקים מהרשת
- הפרדת הרשאות: Backup admins ≠ domain admins
- MFA: אימות רב-שלבי לגישה לגיבויים
- ניהול גרסאות: מספר גרסאות לשחזור לפני הדבקה
- Scanning: antimalware על הגיבויים לפני השחזור
- התראות: זיהוי שינויים המוניים (הצפנה אפשרית)
Disaster Recovery Planning
- DR Site: מרכז נתונים משני או אזור ענן
- Failover Automation: סקריפטים או תזמור אוטומטי
- Runbooks: תיעוד שלב-אחר-שלב של השיקום
- תעדוף: סדר השיקום בהתבסס על קריטיות
- תלויות: מפת תלויות הדדיות בין מערכות
- Network Configuration: DNS, VPN, firewall rules עבור DR
- Communication Plan: בעלי עניין, לקוחות, צוות
בדיקות שחזור
סוגי בדיקות (יש לבצע לפחות שנתית):
- Tabletop Exercise: דיון תיאורטי בתוכנית ללא ביצוע
- Restore Testing: שחזור של דגימות בסביבה מבודדת
- Partial Failover: Failover של מערכות לא קריטיות
- Full DR Test: Failover מלא (בדרך כלל ב-maintenance window)
- Chaos Engineering: תקלות המוזרקות במכוון
חשוב: גיבוי שלא נבדק אינו גיבוי. תקלות מתגלות ברגע הצורך אם אין בדיקות סדירות.
שיטות עבודה מומלצות
- [OK] ליישם את כלל 3-2-1-1-0
- [OK] להגדיר RTO/RPO ברורים לכל מערכת
- [OK] גיבויים בלתי ניתנים לשינוי להגנה מפני כופר
- [OK] בדיקות שחזור רבעוניות
- [OK] ניטור והתראות על כשלי גיבוי
- [OK] הצפנת גיבויים (at rest ו-in transit)
- [OK] תיעוד מעודכן של runbooks
- [OK] הפרדת הרשאות (backup admin ≠ domain admin)
- [OK] שמירה בהתאם ל-compliance (LGPD, SOX וכדומה)
- [OK] DR site מבוזר גאוגרפית
