پرش به محتوای اصلی

Gremlin اکنون از هوش مصنوعی برای شکستن سریعتر سیستم های توزیع شده استفاده می کند

دِ رجیستر۱۴۰۵ مهر ۱۶, پنجشنبه، ساعت ۲۰:۳۹حدود 4 دقیقه مطالعه

اگر یک چیزی وجود داشته باشد که هوش مصنوعی می تواند به خوبی انجام دهد، سریعتر از میانگین SRE شکست می خورد

چه راهی بهتر از شکستن آن برای فهمیدن اینکه سیستم شما چه چیزی می تواند داشته باشد؟ تست آشوب که بیش از یک دهه پیش توسط نتفلیکس رایج شد، عملی است که عمدا خرابی های کنترل شده را به سیستم های کاری وارد می کند تا انعطاف پذیری آنها را آزمایش کند. اکنون، استارت‌آپی که کسب‌وکار خود را بر اساس این روش ساخته است، از هوش مصنوعی برای خودکارسازی بیشتر فرآیند تست و عیب‌یابی استفاده می‌کند. هوش مصنوعی آینده‌نگری Gremlin، افزونه‌ای جدید برای سرویس‌های «مهندسی آشوب» فعلی‌اش، به‌طور مستقل زیرساخت‌های نرم‌افزاری را می‌شکند تا باگ‌های پنهان را قبل از اینکه در مرحله تولید ظاهر شوند، کشف کند.

مهندسی آشوب می تواند برای یک مهندس بسیار خطرناک باشد: یک سرور تصادفی، متعادل کننده بار یا حتی یک منطقه کامل از استقرار ابر را خاموش کنید، سپس مشاهده کنید که بقیه سیستم چقدر تلاش می کند به مشتریان خدمات ارائه دهد. اگر این کار را کرد، کار به خوبی انجام شده است. اگر خسته شود، کار قابل اطمینان بیشتری در راه است. کولتون اندروس، یکی از مهندسان نتفلیکس که مهندسی آشوب را در سرویس استریم انجام می‌داد، Gremlin را تأسیس کرد تا تزریق خطا را به شرکت‌ها، همراه با تجهیزات مناسب تجاری مانند امتیازدهی، گزارش‌های اجرایی و ابزارهای پاسخگویی سازمانی ارائه دهد.

اندروس به The Register گفت که افزودن هوش مصنوعی به ترکیب، با خودکارسازی بسیاری از کارهای آماده سازی و پس از آزمایش که قبلا با دست انجام می شد، روند را به میزان قابل توجهی سرعت می بخشد. خدمات AIOps Failure-as-a-Service برای مهندس قابلیت اطمینان سایت (SRE) چیز جدیدی نیست، اما بیشتر این ابزارها تنها پس از از کار افتادن سیستم، مشکلات را تشخیص می دهند. آندروس گفت: "بسیاری از راه حل های هوش مصنوعی عبارتند از: "هی، ما یک حدس زدیم. شما بروید. موفق باشید." در عوض، Gremlin به طور هدفمند در مورد سیستم راهنمایی می کند و سپس توصیه های متخصص را در مورد چگونگی جلوگیری از تکرار آن ارائه می دهد.

برای استفاده از Gremlin، کاربر عواملی را روی سیستم خود نصب می‌کند که می‌توانند تأخیر را تزریق کنند، پادها را بکشند یا حافظه را به حداکثر برسانند. سپس یک سرویس ابری Gremlin هشدارهای تله متری بعدی را برای نشانه های آشکار ضعف سیستمی مشاهده می کند. اندروس گفت، سس مخفی گرملین، اطلس شکست آن است، مخزن میلیون ها آزمایش مهندسی آشوب که این شرکت در دهه گذشته بر روی «ده ها هزار سیستم» انجام داده است.

این شرکت ادعا می کند که Gremlin مهاری ایجاد کرد که LLM را به اطلس شکست متصل می کند و به آن اجازه می دهد تا به جای استفاده از مجموعه اطلاعات تصادفی خود که در اینترنت یافت می شود، پاسخ های فنی بیشتری در مورد آنچه اشتباه رخ داده است تولید کند. Gremlin از انواع LLM های بسته و باز برای این کار استفاده می کند، بسته به اینکه کدام یک در آن زمان بهترین عملکرد را دارد. اندروس گفت که اطلس LLM را روی نقطه نگه می دارد و توهمات را به حداقل می رساند.

بدون ایجاد مشکل، فقط به آنها اشاره کنید که نرده‌های محافظ موجود Gremlin بر اساس مجوزهای دسترسی خود شرکت و سایر اقدامات احتیاطی امنیتی ساخته شده‌اند تا «شعاع انفجار» (کلمات شرکت) را به حداقل برسانند (اگر انفجار اصلا مهار نشده است، خوب، این یک مشکل کنترل دسترسی است). هنگامی که یک نقص سیستم ایجاد می شود، هوش مصنوعی Foresight علت اصلی را تعیین می کند، کد یا تغییر پیکربندی را که فکر می کند مشکل را برطرف می کند ایجاد می کند، و سپس می تواند راه حل را اعمال کند یا گزارشی را برای SRE آماده کند تا بخواند.

این اساسا یک حلقه عاملی از آزمایش و جایگزینی است - نگه داشتن انسان در حلقه در مقاطع حساس - که تا زمانی ادامه می یابد که دیگر شکست ایجاد نشود. اندروس گفت که پایگاه کاربر فعلی Gremlin تمایل دارد شرکت‌های بزرگ‌تر محاسباتی باشد که بسیاری از آنها در خدمات مالی، خرده‌فروشی و SaaS سازمانی تخصص دارند. آن‌ها از Gremlin برای آزمایش طرح‌های بازیابی فاجعه، اطمینان از عملکرد صحیح در شرایط کمتر از ایده‌آل و اطمینان از مقیاس‌بندی صحیح Kubernetes استفاده می‌کنند. تشخیص چنین سیستم‌های توزیع‌شده پیچیده‌ای به‌ویژه در هنگام بالا رفتن مشکل است.

یافتن برخی از این اشکالات با یکپارچه سازی معمول و آزمایش واحد دشوار است، برخی از این اشکالات را می توان با تزریق خطاهایی مانند تأخیر شبکه، خستگی حافظه یا سایر شرایطی که نقاط ضعف را در سیستم های توزیع شده آشکار می کند، از حالت مخفی خارج کرد. اندروس در مصاحبه ای با The Register توضیح داد که عجله شرکت برای استفاده از هوش مصنوعی هم برای نوشتن برنامه ها و هم برای استقرار زیرساخت، مجموعه ای از پیچیدگی های خاص خود را به همراه دارد. هوش مصنوعی با چنان سرعتی کار می‌کند که برای بازبینی‌کنندگان انسانی غیرممکن است که با آن همراه شوند و هوش مصنوعی می‌تواند اشتباهات احمقانه‌ای را در هر جایی مرتکب شود.

جیسون انگلیسی، تحلیلگر اینتلیکس، در یادداشتی در مورد این فناوری گفت، هر سرویسی که قول شکستن سیستم‌ها را برای منافع بیشتر بدهد، مستلزم ثبت نام در بالاترین سطوح شرکتی است. او نوشت: برای اینکه آن به طور موثر کار کند، "ما باید طرز فکر خود را در مورد ریسک تغییر دهیم."

خواندن متن کامل در دِ رجیستربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Gremlin now uses AI to break distributed systems faster

If there's one thing AI can do well, it's failing more quickly than the average SRE

همه‌ی اخبار فناوری