پرش به محتوای اصلی

بررسی M5 Ultra Mac Studio

هکرنیوز۱۴۰۵ شهریور ۳۰, دوشنبه، ساعت ۱۷:۲۳حدود 18 دقیقه مطالعه

آدرس مقاله: https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/ آدرس نظرات: https://news.ycombinator.com/item?id=49787313 امتیاز: 264 # نظر: 26

در چند روز گذشته، من در حال تست (در حال حاضر) برترین M5 Ultra Mac Studio با 256 گیگابایت رم بودم.

من به تعقیب آن پایان می دهم: M5 Ultra Mac Studio یک ماشین رویایی برای عوامل محلی هوش مصنوعی است. این رایانه امکان اجرای دستیارهای شخصی مجهز به مدل های محلی را با عملکرد عالی و بدون هزینه اضافی ابری فراهم می کند. اگر در آزمایش OpenClaw یا Hermes Agent با مدل‌های محلی تردید داشتید، زیرا آنها هرگز از راه دور به هوش و سرعت مدل‌های ابری نزدیک نمی‌شدند، این مک نظر شما را در مورد آن تغییر خواهد داد.

از پنجشنبه گذشته، من این مک استودیو را با نسخه قبلی خود، M3 Ultra با 512 گیگابایت رم، و همچنین رایانه شخصی بازی دسکتاپ خودم با RTX 5090 مقایسه کردم. با توجه به اندازه، قیمت، عملکرد حرارتی آن – بدون در نظر گرفتن رویکرد اپل به حافظه یکپارچه – استودیو M5 Ultra Mac اساسا طرز فکر من را در مورد مدل هایی که به صورت محلی اجرا می شوند و آنچه که اکنون می توانند فعال کنند، تغییر داده است. البته یک 5090 به دلیل پهنای باند حافظه بالاتری که دارد همچنان برتری بیشتری نسبت به M5 Ultra دارد.

اما با توجه به بزرگی ساخت رایانه شخصی من و همچنین گرما و نویز آن، هر روز یک استودیوی M5 Ultra Mac را ترجیح می دهم. همچنین به طور اتفاقی یک مک است، با سیستم عاملی که زیبا به نظر می رسد و بد نیست، به علاوه یک اکوسیستم برنامه پر جنب و جوش. (با عرض پوزش از طرفداران ویندوز، اما نرم افزار مایکروسافت هرگز همدردی من را جلب نخواهد کرد.)

همانطور که در این مقاله بررسی خواهم کرد، اجرای آخرین مدل Qwen3.8-Flash-Next در M5 Ultra Mac Studio بسیار خوب و سریع بوده است، من آن را به طور پیش فرض در Open Minis برای iOS و Hermes Agent قرار داده ام. درست است: دستیارهای شخصی که من بیشتر از همه استفاده می‌کنم – در واقع بیشتر از Siri AI – اکنون کاملا توسط مدلی که به صورت محلی بر روی Mac Studio اجرا می‌شود، پشتیبانی می‌شوند. علاوه بر این، به لطف GPU سریعتر M5 Ultra و پهنای باند حافظه بالاتر، این عوامل شروع به پاسخ سریع‌تر می‌کنند، در پنجره‌های زمینه بزرگ‌تر سریع می‌مانند و می‌توانند حلقه‌های طولانی و چند چرخشی را بدون کاهش سرعت در هنگام رشد جلسه اجرا کنند.

به همین دلیل، من همچنین از مدل‌های محلی در برنامه Codex در مک خود استفاده می‌کردم – چه به‌عنوان رشته‌های اصلی یا عوامل فرعی که توسط GPT-6 Astra تنظیم شده‌اند – و تجربه بسیار خوبی در انجام این کار داشته‌ام.

عوامل فرعی محلی که در Codex در M5 Ultra Mac Studio اجرا می شوند.

پیشاپیش باید توجه داشته باشم که من یک توسعه‌دهنده هوش مصنوعی نیستم: من مدل‌ها را آموزش نمی‌دهم یا تنظیم دقیق نمی‌کنم. من در قلب یک قلع و قمع هستم و در این مرحله بیش از یک سال است که با مدل های هوش مصنوعی محلی بازی می کنم. تابستان امسال، برای پروژه بزرگی که روی آن کار می‌کردم، استفاده از هوش مصنوعی محلی را به صورت همه‌گیر انجام دادم که در بخش بعدی توضیح خواهم داد.

هدف من از این مقاله این است که ترکیبی از دو چیز را به شما ارائه دهم: اعداد و تجسم‌ها بر اساس آزمایش‌هایی که در طول چهار روز انجام داده‌ام، و توضیحی در مورد موارد استفاده عملی من از هوش مصنوعی محلی که در گردش کار من اعمال می‌شود و اینکه چگونه کارها را برای MacStories انجام می‌دهم.

بیایید ابتدا به فیل در اتاق بپردازیم: وقتی مدل‌های مرز ابری بهتر و اغلب سریع‌تر هستند، چرا اصلا با هوش مصنوعی محلی خود را خسته کنید؟

سوال منصفانه ای است برای اجرای این مدل‌ها به سخت‌افزار گران‌قیمتی نیاز دارید، و تا زمانی که سرمایه‌گذاری خود را بازپرداخت کنید، می‌توانید از گران‌ترین اشتراک Anthropic برای چندین سال استفاده کنید، همچنان در پول خود صرفه‌جویی کنید و در ازای آن عملکرد بهتری داشته باشید.

افراد مختلف پاسخ های متفاوتی برای این سوال خواهند داشت. برخی ممکن است بگویند به دلیل حفظ حریم خصوصی از مدل های محلی استفاده می کنند: آنها ترجیح می دهند برای داده ها و اسناد حساس به اطلاعات محلی اعتماد کنند تا اینکه هر چیزی را در یک ابر خارجی آپلود کنند. دیگران ممکن است استدلال کنند که این به سادگی جالب است - و من مخالف نیستم. برای برخی، این یک کار مرتبط با کار است: اگر یک توسعه‌دهنده هوش مصنوعی هستید، منطقی است که یک راه‌اندازی محلی عالی برای آموزش آداپتورهای خود یا مدل‌های تنظیم دقیق داشته باشید.

برای من، سفر به هوش مصنوعی محلی با ترکیبی از عامل "جالب، چرا که نه؟" و همچنین ملاحظات در مورد حریم خصوصی و هزینه ها مشخص شده است.

همانطور که در اواخر این هفته با اعضای کلاب MacStories به اشتراک خواهم گذاشت، تنظیم تحقیق و نگارش من برای بررسی iOS و iPadOS 27 در تابستان امسال توسط هوش مصنوعی محلی تقویت شده و امکان پذیر شده است. در ماه ژوئن، یک برنامه داخلی به نام Desk ایجاد کردم تا صدها یادداشت، جلسه، اسناد PDF و صفحات وب بریده شده مربوط به iOS و iPadOS 27 و همچنین فصل های بررسی را سازماندهی کند. در پایان فرآیند، پروژه شامل 310 سند بود. در Desk، تیمی از نمایندگان - همه مبتنی بر DeepSeek V4 Flash، به‌علاوه olmOCR برای فایل‌های PDF - 24/7، به مدت 99 روز، برای انجام وظایف زیر کار کردند:

یکی از نماهای Desk، برنامه ای که توسط Notion API و هوش مصنوعی محلی طراحی شده است که برای بررسی iOS 27 خود استفاده کردم.

عامل محلی هوش مصنوعی در برنامه میز سفارشی من اجرا می شود.

با این حال، اگر در آن سوی طیف قرار می گیرید، و اگر فکر می کنید این نوع چیزها شسته و رفته است... بگذارید به شما بگویم: M5 Ultra Mac Studio یک جهش بزرگ در عملکرد برای مدل های محلی مجهز به MLX است، و من چند مثال برای اثبات آن دارم.

همانطور که ممکن است از اطلاعیه و پوشش اولیه من متوجه شده باشید، M5 Ultra Mac Studio شبیه مدل M3 Ultra است که جایگزین آن شده است، اما با یک معماری سیلیکونی کاملا جدید اپل عرضه می شود که از UltraFusion برای اتصال دو تراشه M5 Max برای ایجاد یک معماری چهار دای استفاده می کند، که اولین مورد برای اکوسیستم اپل است. تا آنجا که به بارهای کاری هوش مصنوعی محلی مربوط می شود، دو حوزه وجود دارد که باید به آنها توجه کنیم (و من از زمان پوشش M5 iPad Pro برای هوش مصنوعی محلی در سال گذشته آنها را دنبال کرده ام): GPU و پهنای باند حافظه.

M5 Ultra دارای یک پردازنده گرافیکی نسل بعدی با 80 هسته است که هر هسته دارای یک شتاب دهنده عصبی است که در مقایسه با M3 Ultra حداکثر 4.5× بالاترین پردازش گرافیکی را برای هوش مصنوعی به آن می دهد. در مورد حافظه، معماری حافظه یکپارچه اپل همچنان مانند قبل از 512 گیگابایت بالاتر است (اگرچه این مدل در اواخر اکتبر عرضه خواهد شد)، اما پهنای باند آن از 819 گیگابایت بر ثانیه به 1.2 ترابایت بر ثانیه یا 50 درصد بیشتر از M3 Ultra رسیده است.

با در نظر گرفتن این اعداد، من شروع به آزمایش M5 Ultra در برابر M3 Ultra با 512 گیگابایت رم و RTX 5090 خود کردم. جزئیات بیشتری را در مورد آزمایش در زیر به اشتراک می‌گذارم، اما نسخه کوتاه آن این است: با M5 Ultra، زمان کمتری را صرف می‌کنید تا یک مدل درخواست شما را بخواند و شروع به تولید پاسخ کند. و هنگامی که شروع به پاسخ دادن می کند، متن بسیار سریعتر از قبل در M3 Ultra ظاهر می شود. این دو پیشرفت به تنهایی ماشین را برای حلقه‌های عامل مدرنی که نیاز به تکرار سریع با یک مدل و در نتیجه پنجره‌های زمینه بزرگ‌تر دارند، قابل اجرا می‌سازد.

در تجربه روزانه من با عواملی که روی M5 Ultra اجرا می‌شوند، این پیشرفت‌ها در پیش‌پر کردن توکن (یا سرعت پردازش یک درخواست) و تولید توکن تغییراتی هستند که بلافاصله متوجه شدم. هنگام مقایسه مدلی که روی M3 Ultra و M5 Ultra در کنار هم با Open Minis در iOS اجرا می شود، M5 Ultra به طور متوسط ​​70٪ سریعتر از M3 Ultra در ایجاد پاسخ سریعتر بود.

همانطور که بعدا خواهیم دید، داشتن مدلی مانند Qwen3.8-Flash-Next با 100 توکن در ثانیه در اعلان های کوتاه و همچنان نوشتن در 60 تا 85 با 64K تا 256K زمینه در پشت آن شوخی نیست، و این امکان را فراهم می کند که یک نوع معکوس به عقب و جلو بین شما و مدل استفاده کنید، و زمانی که ابزاری درگیر است، احساس خوبی دارید.

استفاده از یک مدل محلی به عنوان پیش فرض در Open Minis برای iOS. تصویر بالا: یک پروژه طولانی مدت، عوامل فرعی و تولید تصویر محلی با استفاده از Qwen-Image-2.1، همچنین در M5 Ultra اجرا می شود.

با این حال، من بیشتر تحت تاثیر افزایش عملکرد در پر کردن توکن قرار گرفتم. وقتی از دستیارهای عاملی مانند هرمس یا Codex استفاده می‌کنید، یک مدل مجموعه کاملی از دستورالعمل‌ها را دریافت می‌کند که شامل مواردی مانند اعلان سیستم، شخصی‌سازی کاربر و حافظه‌های جلسه، مهارت‌ها و توضیحات MCP و موارد دیگر می‌شود. برخی از عامل ها در کوتاه کردن دستورالعمل هایی که ارسال می کنند بهتر از دیگران هستند، اما به طور کلی، هر زمان که از یک عامل مدرن استفاده می کنید، با یک پنجره زمینه خالی شروع نمی کنید.

به همین دلیل، من هرگز نتوانستم به طور مداوم از مدل های محلی با این موج جدید از عوامل استفاده کنم: آنها کار می کنند، اما قبل از اینکه مدل شروع به ایجاد پاسخ کند، مدتی به یک صفحه خالی و یک نشانگر بارگذاری خیره می شدم. و در هر نوبت حلقه، عملکرد بدتر می‌شود (به دلیل زمینه بزرگ‌تر جلسه)، و من مدتی دیگر منتظر می‌مانم.

در آزمایش‌های من، پردازش سریع به طور متوسط ​​150٪ نسبت به M3 Ultra افزایش یافته است - یک بهبود 2.5× نسبت به تنظیمات قبلی من. این تغییر به تنهایی باعث می‌شود مدل‌های محلی در برنامه‌هایی مانند Open Minis و Hermes Agent انتخاب‌های خوبی داشته باشند. وقتی از Flash-Next در M5 Ultra می‌خواهم کارهای هفته من را با RemCTL انجام دهد، لازم نیست منتظر بمانم تا نماینده دستورات من را پردازش کند و Open Minis را انجام دهد: فقط در چند ثانیه، با استدلال، انجام فراخوانی ابزار و غیره کار می‌کند.

و هنگامی که من روی یک پروژه بزرگ کار می کنم، مانند نسخه ی نمایشی Voxel Colosseum در زیر، این مدل می تواند حلقه های چند چرخشی را به سرعت پردازش کند، عوامل فرعی را ارسال و هماهنگ کند، و همه این کارها را با سرعت 60 تا 85 توکن در ثانیه با افزایش طول رشته انجام دهد.

این نسخه ی نمایشی تعاملی Colosseum به طور کامل توسط Flash-Next در حال اجرا در M5 Ultra Mac Studio ساخته شده است که از طریق Open Minis و مهار آن در iOS مدیریت می شود.

Cadu، یک سرویس گیرنده iOS آینده برای Hermes Agent، که حالت صدای زنده را با Qwen3-TTS و Qwen3.8-Flash-Next به عنوان مدل چت اصلی، با M5 Ultra به عنوان سرور اجرا می کند.

مهمتر از همه: مدلی مانند Flash-Next می تواند به اندازه کافی "کوچک" باشد تا در یک M5 Ultra 256 گیگابایتی با کوانتیزه های بالاتر اجرا شود (من می توانم 5 بیت را به طور کامل در RAM اجرا کنم؛ 6 و 8 بیت می توانم جداول n-gram خود را با این معماری جدید بر روی SSD بارگذاری کنم) اما همچنین به اندازه کافی هوشمند برای حفظ تماس های رشته ای طولانی و چندین ابزار مختلف.

برای سلیقه من، کوانتیزاسیون 5 بیتی در این نسخه از Ultra با تعادل هوش، عملکرد و مصرف حافظه به نقطه مطلوبی رسیده است. اما من قبلا می‌دانم که اگر بخواهم M5 Ultra 512 گیگابایتی را آزمایش کنم، واقعا علاقه مند هستم که عملکرد 8 بیتی را بدون بارگذاری SSD اندازه‌گیری کنم.

من زمان زیادی را صرف بارگذاری وظایف کدنویسی برای پروژه های مختلف خود به یک مدل محلی نکرده ام، اما چند آزمایش جالب انجام داده ام. با این نوع عملکرد، و به‌ویژه با توجه به توانایی انباشتن تا سه جلسه Flash-Next همزمان با عامل‌های فرعی در oMLX با 256 گیگابایت رم (در ادامه بیشتر)، اکنون می‌توانم به طور واقع بینانه در نظر بگیرم که وظایف کدنویسی ساده‌تر را به یک مدل محلی واگذار کنم و از ابرهای مرزی بخواهم کار خود را بررسی کنند. به عنوان مثال، من توانستم Qwen3.8-Flash-Next را در Codex راه اندازی کنم، که به من امکان می دهد از یک مدل محلی با مهار Codex استفاده کنم.

این به این معنی است که من می‌توانم به یک مدل اصلی GPT اجازه دهم عوامل فرعی محلی را هماهنگ کند، Flash-Next زیر عامل‌های خود را هماهنگ کند، یا حتی فقط از مدل گوشی خود با Codex Remote در iOS استفاده کنم.

استفاده از یک مدل محلی در M5 Ultra از Codex Remote.

من معمولا به تولید تصویر متکی نیستم، اما برای این بررسی: تراشه M5 Ultra یک دارایی رسمی اپل است. تصویر زمینه پشت آن توسط Qwen-Image-2.1 به صورت محلی در M5 Ultra در 180 ثانیه با حداکثر استفاده از RAM 78 گیگابایت تولید شد.

من کنجکاو هستم که بیشتر در مورد این موضوع از توسعه دهندگان واقعی که به زودی M5 Ultra دریافت می کنند، مطالعه کنم. با توجه به عملکرد مدل‌های با وزن باز در سخت‌افزار مصرف‌کننده، چیزی که 10 ماه پیش «مرز» در نظر گرفته می‌شد، و با عملکرد M5 Ultra که اکنون کدنویسی عاملی را امکان‌پذیر می‌کند، فکر می‌کنم به زودی شاهد آزمایش‌های جذابی از جامعه MLX خواهیم بود.

همانطور که در ادامه این مقاله خواهید دید، RTX 5090 NVIDIA با وجود 32 گیگابایت VRAM «کم»، هنوز سریعتر از M5 Ultra اپل است، به دو دلیل متفاوت.

سرعت پردازش سریع توسط محاسبه دیکته می شود: مدل کل دستور را در یک ضرب ماتریس غول پیکر می خواند، که دقیقا همان کاری است که هسته های تانسور NVIDIA برای آن ساخته شده اند. شتاب‌دهنده‌های عصبی جدید اپل (یکی در هر یک از 80 هسته‌های گرافیکی M5 Ultra) فاصله را کم می‌کنند، اما نمی‌توانند آن را ببندند. در یک درخواست 6000 توکن، M5 Ultra با سرعت ~1700 توک در ثانیه خوانده شد. 5090 با مدل Qwen که من در LM Studio تست کردم، 3000 عدد خیره کننده تحویل داد.

از سوی دیگر، تولید توکن، پهنای باند است: مدل در یک زمان یک توکن می نویسد و کل مدل را برای هر کدام از حافظه خارج می کند، بنابراین 1.79 ترابایت بر ثانیه 5090 در مقابل 1.2 ترابایت بر ثانیه M5 Ultra، در هر اندازه سریع، 25 درصد برتری ثابت به آن می دهد. چیزی که 5090 ندارد حافظه است: با 256K، 5090 فقط با حافظه نهان توجه 8 بیتی کار می کند. 32 گیگابایت VRAM فقط تا این حد است.

با این حال، دو مشکل در این مقایسه وجود دارد. اولا، در حالی که 5090 هنوز از M5 Ultra با مدل‌های کوچک‌تر برتری دارد، عدم وجود حافظه یکپارچه به این معنی است که اگر بخواهم مدلی را با سرعت‌های فوق‌العاده اجرا کنم، محدود به 32 گیگابایت VRAM در GPU هستم. لحظه‌ای که می‌خواهم هر چیزی بیش از 32 گیگابایت را اجرا کنم (مانند مقادیر بالاتر Flash-Next فوق‌الذکر)، 5090 باید لایه‌های مدل را از طریق PCIe به رم سیستم (بسیار کندتر) بارگذاری کند، و این راهی برای زنده ماندن نیست.

من یک مدل Qwen متفاوت را برای مقایسه بین Mac و PC آزمایش کردم.

دوم، کامپیوتر بازی من در مقایسه با Mac Studio که روی میز من قرار می‌گیرد، حجیم است – و من یک بدنه جمع‌وجور با یک قاب Lian-Li A3 دارم. ناگفته نماند که وقتی مدل‌های محلی را در پنجره‌های با زمینه بالا اجرا می‌کنم چقدر صدا و داغ می‌شود: وقتی بعد از اجرای برخی معیارها وارد دفترم شدم، در مقایسه با بقیه آپارتمان‌ام به طرز ناخوشایندی گرم‌تر بود.

در مقابل، مک استودیو "کوچک" روی میز من در لمس گرم بود، اما همچنین به طور قابل ملاحظه ای ساکت تر از 5090 من بود، فن ها به این سرعت یا با صدای بلند نمی چرخیدند، و مهمتر از همه، به من این امکان را می داد که مدل های بزرگتری مانند GLM-5.3-Flash را به لطف حافظه سیلیکونی غیرفعال اپل به صورت محلی با عملکرد مناسب اجرا کنم. در استفاده روزمره، زمانی که همیشه Flash-Next oQ4e را اجرا می‌کردم، هرگز صدای فن استودیو را روی میز نمی‌شنیدم مگر اینکه گوشم را مستقیما روی رایانه قرار دهم.

با قضاوت بر اساس پیشرفت اپل در سال‌های اخیر، من تعجب نمی‌کنم که M7 Ultra را در آینده نزدیک ببینم که از پهنای باند حافظه 5090 بهتر است. اما این یک داستان برای زمان دیگری است.

در نهایت، قبل از اینکه به اعداد و نمودارهای خام بپردازیم: چگونه همه چیز را آزمایش کردم؟

تست‌های خودکار با مهار تستی که من با GPT-6 Astra ساختم، انجام شد، که چندین نمونه از Codex را در استودیوی M3 Ultra و M5 Ultra Mac من و همچنین رایانه شخصی من با برنامه Codex برای استفاده از ویندوز و رایانه هماهنگ می‌کرد. در macOS، من oMLX (نسخه 0.7.0.dev2) را به عنوان پشتیبان محلی برای مدل‌های MLX انتخاب کردم و Qwen3.8-Flash-Next-oQ4e-mtp، GLM-5.3-Flash-MLX-mixed-4_8bit، و Qwen3.8-PoStateen Gwen3.8-4-27 را اجرا کردم. 27.0 برای اکثر تست های من.

در ویندوز، من از LM Studio و Qwen3.8-27B-GGUF با زمان اجرا CUDA 12 و با تمام 66 لایه بارگذاری شده به GPU برای آزمایش‌های کامل GPU، به‌علاوه آزمایش‌های جداگانه که مدل را بین GPU و RAM سیستم تقسیم می‌کنند، استفاده کردم.

در کنار آزمایش‌های جداگانه با عوامل فرعی Open Minis، من از یک مهار آزمایشی سفارشی برای اندازه‌گیری درخواست‌ها و گردش‌های کاری همزمان که شامل یک مدل سرنخ و چندین کمک است، استفاده کردم، با oMLX که مدل‌های Mac را ارائه می‌دهد و LM Studio مدل ویندوز را ارائه می‌دهد.

اعداد توسط Astra در طول چهار روز جمع‌آوری شدند و بعدا توسط Claude Fable 5.1 و Opus 5 با استفاده از ویژگی پروژه‌های آینده آنتروپیک تجسم شدند، که من در اوایل کار روی این داستان توانستم آن را آزمایش کنم. تجسم تعاملی با HTML و CSS خالص بر اساس سبک MacStories ساخته شده است و شامل نظرات و حاشیه نویسی های واقعی شما می شود.

هدف من از ویجت‌های تعاملی زیر، نه تنها کمک به شما در درک واضح‌تر اعداد، بلکه تجسم معنای آمار در عمل بود. من از ویجت‌هایی که به طور تقریبی احساس می‌کنند توکن‌های مختلف در ثانیه راضی هستم، زیرا این معیاری است که اغلب تجسم آن دشوار است. امیدوارم این نمودارهای متحرک مفیدتر از نمودارهای "ایستا" معمولی باشند که احتمالا در جاهای دیگر دیده اید (که در زیر نیز آورده شده است).

بیایید با مقایسه ای که من بیشتر به آن اهمیت می دهم شروع کنیم: M5 Ultra در مقابل M3 Ultra. در این تست ها، من از همان مدل ها، دستورات و ساخت oMLX استفاده کردم. تنها تفاوت: M5 Ultra Apple که برای من فرستاده بود "فقط" 256 گیگابایت رم دارد.

مدل و اندازه سریع را برای مقایسه نتایج انتخاب کنید.

فکر از 7.66 ثانیه · اولین نشانه قابل مشاهده 8.03 ثانیه

فکر از 2.98 ثانیه · اولین نشانه قابل مشاهده 3.25 ثانیه

از 32.1 ثانیه فکر می کند · اولین نشانه قابل مشاهده 32.6 ثانیه

از 12.5 ثانیه فکر می کند · اولین نشانه قابل مشاهده 12.8 ثانیه

از 137.6 ثانیه فکر می کند · اولین نشانه قابل مشاهده 138.8 ثانیه

از 60.7 ثانیه فکر می کند · اولین نشانه قابل مشاهده 61.6 ثانیه

Qwen3.8 Flash-Next oQ4e، نسخه آزمایشی دقیق: پیش‌فرض 4 بیتی با وزن‌های انتخابی 5، 6 و 8 بیتی، فرمت MLX، عمق پیش‌بینی چند نشانه‌ای 3، فکر کردن. GLM-5.3-فلش ترکیبی 4/8 بیتی، نسخه آزمایش شده دقیق: متخصصان مسیریابی 4 بیتی، توجه 8 بیتی و وزن متراکم، تلاش منطقی کم بومی، کمک هزینه خروجی 4096 توکن. نرخ تولید آن شامل نشانه های استدلالی است.

هر دو استودیو: macOS 27.0 (26A428)، oMLX 0.7.0.dev2، بایت های مدل مشابه، تنظیمات ذخیره شده، زمان اجرا و بدنه های درخواست. بارگذاری و گرم کردن مدل خارج از زمان بندی است. خواندن زمان رسیدن به اولین نشانه قابل مشاهده است که توسط مشتری اندازه گیری می شود. نوشتن تا انتهای جریان ادامه دارد. درخواست‌های تازه بدون توکن‌های ذخیره‌شده مجددا استفاده نشدند. اجرای 64K GLM یکی از تنظیمات را در هر دو مک تغییر داد، به جای 4 گیگابایت، یک بودجه 64 گیگابایتی حافظه نهان سریع را تغییر داد و بدون مدل دیگری اجرا شد.

زمانی که مدل شروع به تولید پاسخ کند، توکن ها در ثانیه. بالاتر بهتر است

Flash-Next، نسخه دقیق · GLM-5.3-Flash، نسخه دقیق. زمان اجرا، تنظیمات و درخواست های یکسان در هر دو مک.

TTFT با اعلان‌های 64K، 128K و 256K، حافظه پنهان سرد اندازه‌گیری شد. دوباره همان فرمان را تست کردم، اما کش گرم است.

4 دقیقه و 5 ثانیه · خواندن 1070 نکته در ثانیه · 9/9 پاسخ صحیح

2 دقیقه 19 ثانیه · 448 نکته در ثانیه خوانده شده · 3/3 پاسخ صحیح

5 دقیقه 16 ثانیه · 403 نکته در ثانیه را می خواند · 9/9 پاسخ صحیح است

2 دقیقه و 8 ثانیه · خواندن 997 نکته در ثانیه · 9/9 پاسخ صحیح · همان درخواست دوباره حافظه اش تمام شد

11 دقیقه 2 ثانیه · خواندن 391 نکته در ثانیه · 9/9 پاسخ صحیح · همان درخواست دوباره حافظه اش تمام شد

Flash-Next همان پاسخ 512 توکن را بعد از 4K تا 256 هزار توکن متن پس‌زمینه می‌نویسد. توکن در ثانیه؛ بالاتر بهتر است

هر درخواست دقیقا 512 توکن ایجاد می‌کند: درپوش عمدی است، بنابراین سرعت نوشتن را اندازه‌گیری می‌کند، نه اینکه آیا مقاله تمام شده است یا خیر. سرعت خواندن در M3 Ultra 861-1112 توک در ثانیه و در M5 Ultra بین 2057-2771 بود. پیشوندهای اعلان منحصر به فرد از استفاده مجدد حافظه پنهان بین اندازه ها جلوگیری می کند. اینها درخواست های متفاوتی از 70 و 108 توک/ثانیه بالا هستند و با آنها مخلوط نمی شوند.

Flash-Next، بازبینی دقیق، فکر کردن، عمق MTP 3، دمای 0، دانه 42.

شبیه سازی اعداد رمز در ثانیه از بالا چه احساسی دارند.

ژتون M3 Ultra 296 · 65 توک در ثانیه · انجام شده در 4.8 ثانیه

درایوهای حالت جامد (SSD) و حافظه دسترسی تصادفی (RAM) نقش‌های متمایز اما مکملی را در سیستم‌های محاسباتی ایفا می‌کنند که عمدتا در نوسانات، سرعت و ظرفیت متفاوت هستند. RAM یک حافظه فرار است، به این معنی که با قطع برق، تمام اطلاعات ذخیره شده را از دست می دهد. سرعت خواندن و نوشتن بسیار بالایی را ارائه می دهد و به CPU اجازه می دهد تقریبا به صورت آنی به داده ها و دستورالعمل های فعال دسترسی پیدا کند.

پاسخ ادامه دارد؛ اعداد بالا برای همه آن است.

ژتون M5 Ultra 288 · 103 توک در ثانیه · انجام در 3.0 ثانیه

درایوهای حالت جامد (SSD) و حافظه دسترسی تصادفی (RAM) نقش‌های متمایزی در محاسبات دارند که عمدتا در نوسانات، سرعت و ظرفیت متفاوت هستند. RAM یک حافظه فرار است، به این معنی که با قطع برق، تمام داده های ذخیره شده را از دست می دهد. پهنای باند بسیار بالا و تأخیر کم را ارائه می دهد و به CPU اجازه می دهد تقریبا به صورت آنی به داده ها دسترسی داشته باشد. این باعث می‌شود RAM برای نگهداری فرآیندهای فعال و داده‌هایی که اغلب به آنها دسترسی پیدا می‌کنید ایده‌آل باشد.

ژتون M3 Ultra 291 · 26 توک در ثانیه · انجام شده در 11.4 ثانیه

فکر کردن، سپس خواندن · اولین نشانه قابل مشاهده در 1.03 ثانیه

حافظه SSD و RAM نقش های اساسی متفاوتی را در رایانه ایفا می کنند، علیرغم اینکه هر دو اطلاعات را در خود نگه می دارند. SSD (درایو حالت جامد) ذخیره سازی غیر فرار است: داده ها را به طور دائم حفظ می کند، حتی زمانی که برق خاموش است. این سیستم عامل، برنامه ها و فایل های شما را به مدت طولانی نگه می دارد. در مقابل، RAM (حافظه دسترسی تصادفی) یک حافظه فرار است - وقتی دستگاه خاموش می شود کاملا پاک می شود.

ژتون M5 Ultra 271 · 42 توک در ثانیه · انجام شده در 6.8 ثانیه

فکر کردن، سپس خواندن · اولین نشانه قابل مشاهده در 0.57 ثانیه

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

M5 Ultra Mac Studio Review

Article URL: https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/ Comments URL: https://news.ycombinator.com/item?id=49787313 Points: 264 # Comments: 260

پوشش همین خبر در رسانه‌های دیگر

مقایسه‌ی پوشش ۲ رسانه ←
همه‌ی اخبار فناوری