
مانیتورینگ زیرساخت؛ سرمایهگذاری برای بقا، نه ردیفی اضافه در بودجه
حمید قنبری
کارشناس امنیت اطلاعات
در بسیاری از سازمانها، مانیتورینگ زیرساخت هنوز بهعنوان یک هزینه جانبی یا ابزاری برای مشاهده نمودارهای مصرف منابع دیده میشود. در حالی که مانیتورینگ مؤثر، یکی از اجزای مهم تابآوری عملیاتی است و به سازمان امکان میدهد پیش از آنکه یک اختلال به قطعی گسترده، نارضایتی مشتری یا خسارت مالی تبدیل شود، آن را شناسایی و برای رفع آن اقدام کند.
یک درس مهم از قطعی فیسبوک در سال ۲۰۲۱
در اکتبر ۲۰۲۱، سرویسهای فیسبوک، اینستاگرام و واتساپ برای چند ساعت از دسترس خارج شدند. بر اساس گزارشهای منتشرشده این اختلال پس از یک عملیات نگهداری شبکه و بروز مشکل در زیرساخت مسیریابی ایجاد شد و در ادامه دسترسی به بخشی از سامانههای داخلی شرکت نیز با مشکل مواجه شد. حتی برخی ابزارهای مدیریتی و سامانههای کنترل دسترسی که به همان زیرساخت وابسته بودند در حادثه با اختلال روبرو شدند.
این حادثه یک نکته کلیدی را برجسته میکند: حتی سازمانهایی با زیرساخت گسترده و تیمهای فنی قدرتمند نیز در برابر خطاهای عملیاتی مصون نیستند. بنابراین قابلیت مشاهده هشداردهی و دسترسی مستقل به سامانههای پایش در زمان بحران اهمیت ویژهای دارد.
چرا مانیتورینگ هزینه نیست؟
وقتی یک سرور یا سرویس بدون هشدار قبلی از کار میافتد، ممکن است مشتری یا کاربر اولین فردی باشد که مشکل را گزارش میکند. از زمان ثبت تیکت تا شناسایی علت و اجرای راهکار ممکن است زمان قابلتوجهی از دست برود و در این فاصله کیفیت خدمت و اعتماد مشتری آسیب ببیند.
در مقابل مانیتورینگ فعال میتواند خرابی را در لحظه وقوع و در برخی موارد با تحلیل روند مصرف منابع، پیش از رسیدن به نقطه بحرانی شناسایی کند. این قابلیت باعث کاهش زمان تشخیص و در نتیجه کاهش زمان رفع اختلال میشود.
مانیتورینگ مؤثر چه ویژگیهایی دارد؟
• پایش مستمر سرورها، تجهیزات شبکه، سرویسها و شاخصهای حیاتی زیرساخت
• تعریف آستانههای هشدار متناسب با اهمیت هر سرویس و جلوگیری از تولید هشدارهای غیرضروری
• تحلیل روندها برای شناسایی ظرفیت رو به اتمام یا رفتار غیرعادی پیش از وقوع خرابی
• ثبت و نگهداری دادههای تاریخی برای ظرفیتسنجی و تصمیمگیری مدیریتی
• ارسال هشدار از مسیر ارتباطی مستقل یا مقاوم در برابر خرابی زیرساخت اصلی
• تست دورهای سناریوهای خرابی و اطمینان از دریافت و پاسخگویی به هشدارها
استقلال سامانه مانیتورینگ از زیرساخت اصلی
یکی از نکات مهم در طراحی مانیتورینگ، جلوگیری از وابستگی کامل سامانه پایش و هشداردهی به همان زیرساختی است که قرار است پایش شود. اگر شبکه یا سرویس اصلی دچار اختلال شود، سامانه مانیتورینگ نیز نباید همزمان از دسترس خارج شود و امکان اطلاع رسانی را از بین ببرد.
برای کاهش این ریسک میتوان از مسیر ارتباطی مستقل برای ارسال هشدار، معماری افزونه یا سامانه پایش خارج از دامنه خرابی استفاده کرد.
مانیتورینگ بهتنهایی کافی نیست
نصب یک نرمافزار مانیتورینگ بهتنهایی یک استراتژی پایش محسوب نمیشود.ارزش واقعی زمانی ایجاد میشود که شاخصهای مناسب انتخاب شوند، آستانهها بهدرستی تنظیم شوند، هشدارها به فرد یا تیم مسئول برسند و برای واکنش به هر هشدار فرآیند مشخصی وجود داشته باشد.
همچنین لازم است سناریوهای بازیابی از حادثه بهصورت دورهای آزمون شوند تا مشخص شود در شرایط واقعی، تیم فنی تا چه اندازه قادر به تشخیص، تصمیمگیری و بازگردانی سرویس است.
جمعبندی مدیریتی
پرسش اصلی برای مدیر فناوری اطلاعات نباید صرفاً این باشد که برای مانیتورینگ چقدر هزینه کنیم؟ بلکه باید پرسید: سازمان چه میزان قطعی غیرمنتظره را میتواند تحمل کند و هزینه هر دقیقه اختلال برای کسبوکار چقدر است؟
مانیتورینگ مناسب، هزینهای صرفاً عملیاتی نیست؛ بلکه ابزاری برای کاهش زمان تشخیص، کاهش زمان رفع اختلال، بهبود ظرفیتسنجی و افزایش تابآوری خدمات است. هدف نهایی نیز صرفاً دیدن وضعیت سیستمها نیست، بلکه ایجاد توانایی برای تشخیص سریع، واکنش مؤثر و تصمیمگیری مبتنی بر داده است.


