در اتوماسیون شبکه، خطر اصلی این نیست که Ansible نتواند کانفیگ را روی تجهیز بفرستد؛ خطر جدی‌تر این است که کانفیگ اشتباه، کامل و سریع روی چندین روتر، سوئیچ یا فایروال اعمال شود. Validation باید قبل از push جلوی همین وضعیت را بگیرد: داده ورودی، template، خروجی نهایی، پیش‌نیازهای مسیر و شرط‌های برگشت باید قبل از تغییر واقعی بررسی شوند.

یک workflow قابل اعتماد معمولاً از diff، lint، تست محدود، بررسی وابستگی و تایید خروجی نهایی تشکیل می‌شود. این نگاه وقتی ارزش بیشتری دارد که کنار مدیریت تغییرات شبکه با Git و طراحی امنیت شبکه و هاردنینگ قرار بگیرد؛ چون هدف فقط خودکار کردن نیست، کاهش خطای عملیاتی در تغییرات حساس شبکه است.

سناریوی واقعی مسئله

سناریوی معمول این است که تیم شبکه یک تغییر ظاهراً ساده می‌دهد: یک policy اضافه می‌شود، یک interface جابه‌جا می‌شود، یک سرویس پشت load balancer قرار می‌گیرد، یا یک مسیر مانیتورینگ/احراز هویت فعال می‌شود. در همان لحظه شاید همه چیز سالم به نظر برسد، اما چند ساعت بعد کاربر می‌گوید بخشی از سرویس کند شده یا بعضی connectionها fail می‌شوند. اینجا اگر فقط به آخرین تغییر نگاه کنیم، احتمالاً علت اصلی را از دست می‌دهیم.

در اعتبارسنجی config قبل از اعمال تغییر با Ansible باید مسیر داده را مرحله به مرحله دید. اول باید معلوم شود packet یا request از کجا وارد می‌شود، با چه identity یا contextی شناخته می‌شود، کدام rule روی آن match می‌شود، بعد از تصمیم امنیتی به کجا می‌رود، و در نهایت سمت مقصد چه پاسخی می‌دهد. این نگاه ساده است، اما جلوی بیشتر عیب‌یابی‌های پراکنده و حدسی را می‌گیرد.

نشانه مهم در این سناریو معمولاً اشتباه تایپی، object ناقص، تغییر روی device اشتباه یا rollback سخت بعد از اجرای playbook است. این نشانه به‌تنهایی حکم قطعی نمی‌دهد، ولی جهت بررسی را مشخص می‌کند. اگر نشانه را درست بخوانیم، لازم نیست ده‌ها گزینه را همزمان تغییر بدهیم. تغییر همزمان چند چیز، بدترین دشمن عیب‌یابی در شبکه production است.

قبل از تغییر چه چیزهایی باید ثبت شود؟

قبل از هر اصلاح، snapshot عملیاتی لازم است. منظور فقط backup گرفتن از config نیست. باید بدانیم وضعیت sessionها، hit countها، logها، route table، objectها، certificateها و وضعیت health check در همان لحظه چه بوده است. اگر بعداً تغییر جواب نداد، بدون این snapshot نمی‌شود دقیق برگشت یا فهمید مشکل از کجا شروع شده.

  • inventory و group درست deviceها
  • template syntax و variableهای اجباری
  • diff قبل از commit
  • backup config قبل از تغییر

این موارد شاید بدیهی به نظر برسند، اما در عمل خیلی از downtimeها از همین جا شروع می‌شود: تغییر انجام شده، اما وضعیت قبل از تغییر ثبت نشده است. وقتی وضعیت قبلی نداریم، rollback هم فقط یک حدس خوش‌بینانه است.

روش عیب‌یابی مرحله‌ای

برای Network Automation بهتر است عیب‌یابی را از ساده‌ترین لایه شروع کنیم. اول دسترسی پایه و مسیر را ببینیم، بعد سراغ policy و inspection برویم، بعد وابستگی‌های پیشرفته‌تر مثل profile، identity، certificate یا automation را بررسی کنیم. اگر از همان ابتدا سراغ گزینه‌های پیچیده برویم، احتمالاً یک مشکل ساده routing یا object اشتباه را نمی‌بینیم.

من در این نوع کار معمولاً سه سؤال ثابت می‌پرسم: آیا ترافیک به نقطه تصمیم می‌رسد؟ آیا rule درست match می‌شود؟ آیا بعد از تصمیم، مسیر برگشت و state درست است؟ همین سه سؤال برای بیشتر تجهیزات امنیتی و شبکه‌ای جواب می‌دهد، حتی اگر اسم featureها فرق کند.

ansible-playbook change.yml --check --diff --limit lab-router
ansible-inventory --graph
ansible-playbook backup.yml --limit target-group

دستورها و خروجی‌ها باید در همان change record نگهداری شوند. اگر بعداً یک نفر دیگر بخواهد ادامه کار را بگیرد، نباید مجبور شود از صفر بفهمد چه چیزهایی بررسی شده است.

خطاهای رایج

  • اجرای playbook روی group بزرگ بدون limit
  • نداشتن dry-run یا diff
  • ذخیره نکردن backup
  • یکی کردن automation با حذف review انسانی

نقطه مشترک این خطاها عجله است. وقتی یک سرویس قطع است، فشار برای حل سریع طبیعی است، اما حل سریع با تغییر بی‌حساب فرق دارد. تغییر کوچک، قابل اندازه‌گیری و قابل برگشت معمولاً از تغییر بزرگ و مبهم بهتر جواب می‌دهد.

طراحی درست برای محیط production

در محیط production، اینکه چه چیزهایی قبل از اجرا باید validate شوند و چه چیزی اجازه push ندارد باید از قبل مشخص باشد. یعنی تیم بداند اگر تست اول fail شد چه کاری می‌کند، اگر فقط بخشی از کاربران مشکل داشتند چه چیزی را جدا می‌کند، و اگر rollback لازم شد دقیقاً کدام object یا policy برمی‌گردد. طراحی خوب فقط دیاگرام نیست؛ طراحی خوب یعنی تصمیم‌های روز حادثه از قبل آماده باشند.

برای اعتبارسنجی config قبل از اعمال تغییر با Ansible بهتر است naming هم جدی گرفته شود. اسم object، rule، profile و monitor باید طوری باشد که شش ماه بعد هم قابل فهم باشد. اسم‌های کوتاه و مبهم شاید زمان ایجاد سریع‌تر باشند، اما هزینه عیب‌یابی را بالا می‌برند. وقتی policy زیاد می‌شود، naming ضعیف خودش به یک ریسک امنیتی تبدیل می‌شود.

موضوع دیگر logging است. لاگ زیاد بدون معنا کمک نمی‌کند؛ لاگ کم هم تیم را کور می‌کند. باید مشخص باشد برای چه decisionهایی log لازم داریم، کدام logها فقط noise تولید می‌کنند، و کدام رویدادها باید به مانیتورینگ یا SIEM بروند. در Network Automation این تنظیم اگر درست انجام شود، هم troubleshooting را سریع‌تر می‌کند و هم ردپای تغییرات را نگه می‌دارد.

چک‌لیست اجرا

  1. برای هر playbook pre-check بنویس
  2. روی یک device کم‌ریسک تست کن
  3. diff را بخوان و attach کن
  4. backup را قبل از تغییر ذخیره کن
  5. post-check را بخشی از playbook کن

این چک‌لیست جای تجربه را نمی‌گیرد، ولی جلوی بی‌نظمی را می‌گیرد. تجربه زمانی ارزش دارد که به روش تبدیل شود؛ وگرنه هر بار باید همان اشتباه‌ها را دوباره کشف کنیم.

تحویل کار به تیم بعدی

اتوماسیون شبکه وقتی قابل اعتماد است که fail کردنش هم طراحی شده باشد. اگر playbook فقط در مسیر موفقیت فکر شده باشد، در اولین خطای واقعی دردسر می‌سازد.

در نهایت، معیار موفقیت فقط این نیست که سرویس الان بالا آمده باشد. معیار بهتر این است که اگر همین مشکل دوباره رخ داد، تیم بتواند با داده، لاگ و مسیر تصمیم روشن جلو برود. این همان تفاوت بین خاموش کردن آتش و ساختن یک عملیات قابل اتکا است.

اگر این موضوع در شبکه شما درگیر چند محصول یا چند تیم است، بهتر است قبل از تغییر نهایی یک جدول مسئولیت هم داشته باشید: مالک policy، مالک route، مالک application، مالک certificate، و کسی که decision نهایی rollback را می‌گیرد. نبودن همین مالکیت‌ها معمولاً زمان حل مشکل را چند برابر می‌کند.

Validation وقتی ارزش عملی دارد که فقط syntax را نبیند. در پروژه‌های واقعی باید مشخص باشد تغییر Ansible با کدام baseline امنیتی، کدام محدودیت دسترسی و کدام سناریوی rollback سنجیده می‌شود. اگر هدف کاهش ریسک تغییرات شبکه است، این مطلب را می‌شود کنار طراحی امنیت شبکه و هاردنینگ و پیکربندی امن تجهیزات شبکه خواند تا اتوماسیون از کنترل‌های امنیتی جدا نشود.

علیرضا عربیان

مشاور و مدرس امنیت شبکه، متخصص FortiGate، FortiWeb و F5 BIG-IP در زیرساخت‌های سازمانی.

مشاهده همه مقالات ←

دیدگاه بگذارید