Gremlin اکنون از هوش مصنوعی برای شکستن سریعتر سیستم های توزیع شده استفاده می کند
اگر یک چیزی وجود داشته باشد که هوش مصنوعی می تواند به خوبی انجام دهد، سریعتر از میانگین SRE شکست می خورد
چه راهی بهتر از شکستن آن برای فهمیدن اینکه سیستم شما چه چیزی می تواند داشته باشد؟ تست آشوب که بیش از یک دهه پیش توسط نتفلیکس رایج شد، عملی است که عمدا خرابی های کنترل شده را به سیستم های کاری وارد می کند تا انعطاف پذیری آنها را آزمایش کند. اکنون، استارتآپی که کسبوکار خود را بر اساس این روش ساخته است، از هوش مصنوعی برای خودکارسازی بیشتر فرآیند تست و عیبیابی استفاده میکند. هوش مصنوعی آیندهنگری Gremlin، افزونهای جدید برای سرویسهای «مهندسی آشوب» فعلیاش، بهطور مستقل زیرساختهای نرمافزاری را میشکند تا باگهای پنهان را قبل از اینکه در مرحله تولید ظاهر شوند، کشف کند.
مهندسی آشوب می تواند برای یک مهندس بسیار خطرناک باشد: یک سرور تصادفی، متعادل کننده بار یا حتی یک منطقه کامل از استقرار ابر را خاموش کنید، سپس مشاهده کنید که بقیه سیستم چقدر تلاش می کند به مشتریان خدمات ارائه دهد. اگر این کار را کرد، کار به خوبی انجام شده است. اگر خسته شود، کار قابل اطمینان بیشتری در راه است. کولتون اندروس، یکی از مهندسان نتفلیکس که مهندسی آشوب را در سرویس استریم انجام میداد، Gremlin را تأسیس کرد تا تزریق خطا را به شرکتها، همراه با تجهیزات مناسب تجاری مانند امتیازدهی، گزارشهای اجرایی و ابزارهای پاسخگویی سازمانی ارائه دهد.
اندروس به The Register گفت که افزودن هوش مصنوعی به ترکیب، با خودکارسازی بسیاری از کارهای آماده سازی و پس از آزمایش که قبلا با دست انجام می شد، روند را به میزان قابل توجهی سرعت می بخشد. خدمات AIOps Failure-as-a-Service برای مهندس قابلیت اطمینان سایت (SRE) چیز جدیدی نیست، اما بیشتر این ابزارها تنها پس از از کار افتادن سیستم، مشکلات را تشخیص می دهند. آندروس گفت: "بسیاری از راه حل های هوش مصنوعی عبارتند از: "هی، ما یک حدس زدیم. شما بروید. موفق باشید." در عوض، Gremlin به طور هدفمند در مورد سیستم راهنمایی می کند و سپس توصیه های متخصص را در مورد چگونگی جلوگیری از تکرار آن ارائه می دهد.
برای استفاده از Gremlin، کاربر عواملی را روی سیستم خود نصب میکند که میتوانند تأخیر را تزریق کنند، پادها را بکشند یا حافظه را به حداکثر برسانند. سپس یک سرویس ابری Gremlin هشدارهای تله متری بعدی را برای نشانه های آشکار ضعف سیستمی مشاهده می کند. اندروس گفت، سس مخفی گرملین، اطلس شکست آن است، مخزن میلیون ها آزمایش مهندسی آشوب که این شرکت در دهه گذشته بر روی «ده ها هزار سیستم» انجام داده است.
این شرکت ادعا می کند که Gremlin مهاری ایجاد کرد که LLM را به اطلس شکست متصل می کند و به آن اجازه می دهد تا به جای استفاده از مجموعه اطلاعات تصادفی خود که در اینترنت یافت می شود، پاسخ های فنی بیشتری در مورد آنچه اشتباه رخ داده است تولید کند. Gremlin از انواع LLM های بسته و باز برای این کار استفاده می کند، بسته به اینکه کدام یک در آن زمان بهترین عملکرد را دارد. اندروس گفت که اطلس LLM را روی نقطه نگه می دارد و توهمات را به حداقل می رساند.
بدون ایجاد مشکل، فقط به آنها اشاره کنید که نردههای محافظ موجود Gremlin بر اساس مجوزهای دسترسی خود شرکت و سایر اقدامات احتیاطی امنیتی ساخته شدهاند تا «شعاع انفجار» (کلمات شرکت) را به حداقل برسانند (اگر انفجار اصلا مهار نشده است، خوب، این یک مشکل کنترل دسترسی است). هنگامی که یک نقص سیستم ایجاد می شود، هوش مصنوعی Foresight علت اصلی را تعیین می کند، کد یا تغییر پیکربندی را که فکر می کند مشکل را برطرف می کند ایجاد می کند، و سپس می تواند راه حل را اعمال کند یا گزارشی را برای SRE آماده کند تا بخواند.
این اساسا یک حلقه عاملی از آزمایش و جایگزینی است - نگه داشتن انسان در حلقه در مقاطع حساس - که تا زمانی ادامه می یابد که دیگر شکست ایجاد نشود. اندروس گفت که پایگاه کاربر فعلی Gremlin تمایل دارد شرکتهای بزرگتر محاسباتی باشد که بسیاری از آنها در خدمات مالی، خردهفروشی و SaaS سازمانی تخصص دارند. آنها از Gremlin برای آزمایش طرحهای بازیابی فاجعه، اطمینان از عملکرد صحیح در شرایط کمتر از ایدهآل و اطمینان از مقیاسبندی صحیح Kubernetes استفاده میکنند. تشخیص چنین سیستمهای توزیعشده پیچیدهای بهویژه در هنگام بالا رفتن مشکل است.
یافتن برخی از این اشکالات با یکپارچه سازی معمول و آزمایش واحد دشوار است، برخی از این اشکالات را می توان با تزریق خطاهایی مانند تأخیر شبکه، خستگی حافظه یا سایر شرایطی که نقاط ضعف را در سیستم های توزیع شده آشکار می کند، از حالت مخفی خارج کرد. اندروس در مصاحبه ای با The Register توضیح داد که عجله شرکت برای استفاده از هوش مصنوعی هم برای نوشتن برنامه ها و هم برای استقرار زیرساخت، مجموعه ای از پیچیدگی های خاص خود را به همراه دارد. هوش مصنوعی با چنان سرعتی کار میکند که برای بازبینیکنندگان انسانی غیرممکن است که با آن همراه شوند و هوش مصنوعی میتواند اشتباهات احمقانهای را در هر جایی مرتکب شود.
جیسون انگلیسی، تحلیلگر اینتلیکس، در یادداشتی در مورد این فناوری گفت، هر سرویسی که قول شکستن سیستمها را برای منافع بیشتر بدهد، مستلزم ثبت نام در بالاترین سطوح شرکتی است. او نوشت: برای اینکه آن به طور موثر کار کند، "ما باید طرز فکر خود را در مورد ریسک تغییر دهیم."
متن اصلی (انگلیسی)
Gremlin now uses AI to break distributed systems faster
If there's one thing AI can do well, it's failing more quickly than the average SRE