توکن ها برای اندازه گیری بسیار ارزان هستند
آدرس مقاله: https://jyn.dev/tokens-too-cheap-to-meter/ آدرس نظرات: https://news.ycombinator.com/item?id=49813482 امتیاز: 273 # نظرات: 189
قیمت استفاده از هوش یادگیری ماشینی چندین مرتبه در سال کاهش مییابد و هیچ نشانهای از کاهش نشان نمیدهد. احتمالا در یکی دو سال آینده شاهد ادغام LLM ها در هر بخش از محاسبات به عنوان زیرساخت و نه فقط به عنوان یک محصول خواهیم بود. احتمالا در 3 تا 6 سال آینده شاهد اجرای LLM های محلی با کیفیت مرزی فعلی بر روی سخت افزار کالا خواهیم بود. با شروع خیلی زود، احتمالا شاهد خواهیم بود که کیفیت و دسترسی به عامل محدودکننده استفاده از هوش مصنوعی 1 تبدیل میشود، نه تعداد زیادی توکن.
ادعاهای فوقالعاده به شواهد خارقالعادهای نیاز دارند، بنابراین من یک سری شواهد جمعآوری کردم.
هوش مصنوعی می تواند انحصاری (مانند GPT-6 Astra) یا وزن باز (مانند GLM-5.3-flash) باشد. مدلهای وزن باز میتوانند میزبانی شوند (مثلا توسط Z.ai) یا محلی. به طور کلی، مدل هایی که به صورت محلی اجرا می شوند بسیار کوچکتر هستند، مانند Muse Glimmer یا Qwen3 Coder.
همیشه پیشرفت در یکی بر بهبود دیگران تأثیر نمی گذارد.
پردازندههای گرافیکی با هر نسلی به طور تصاعدی کارآمدتر میشوند.
در نمودار زیر (منبع)، محور X زمان و محور Y راندمان توان خود GPU است. اعداد بزرگتر محور Y به معنای کارآمدتر است.
این یک نمودار لگاریتمی است، به این معنی که یک خط مستقیم روی نمودار نشان دهنده افزایش نمایی در کارایی است. در این مورد خاص، لگاریتم 1.3 است، به این معنی که بازده تقریبا هر دو سال یک بار دو برابر می شود.
این افزایش کارایی است که از زمان قانون مور در دهه 1960 شاهد آن نبوده ایم.
هزینه تکمیل یک کار معین با یک مدل در طول زمان به شدت کاهش می یابد.
قیمت مدل ها معمولا به ازای هر توکن است. «نشانه» قطعه ای از یک کلمه است. برای نمایش یک کلمه حدود 1.5 توکن نیاز است. به ازای هر توکنی که یک مدل میخواند، و برای هر توکنی که خروجی میکند، «ارائهدهنده مدل» (بهعنوان مثال Anthropic یا OpenAI) مقداری پول از شما دریافت میکند.
هزینه هر نشانه مدل به طور مداوم کاهش نمی یابد، حداقل برای باهوش ترین مدل ها ("مرز"). اما هزینه هر کار است. مدلهای کوچکتر ممکن است برای هر توکن هزینه کمتری داشته باشند، اما در مجموع از توکنهای بیشتری نسبت به مدلهای بزرگتر برای همان کار استفاده میکنند، زیرا باید بیشتر فکر کنند یا پیشنویسهای اولیه خود را اصلاح کنند. این بخش در مورد هزینه انجام کار از ابتدا تا انتها است.
نمودار زیر (منبع) "مرز پارتو" هزینه/وظیفه را در حال حاضر نشان می دهد. مرز پارتو بهترین مبادلهای را که میتوانید به دست آورید، نشان میدهد، نه فقط بهترین در یک دسته. در اینجا، مبادلات ما عبارتند از:
هزینه در مقیاس لگاریتمی است. اعداد محور Y بزرگتر و اعداد محور X کوچکتر بهتر هستند.
این طیف وسیعی از مدلها را در مرز پارتو از سال 2026 به ما نشان میدهد. در سمت راست بالا Claude Fable-5.1 (گرانقیمت و هوشمند) را داریم در سمت چپ وسط ما GPT-5.6 Luna (ارزان و باهوش کمتر) داریم. مدل های زیر نقطه چین اساسا ارزش بررسی ندارند. 2
اکنون به این نمودار نگاه کنید که مرز را در آغاز، میانه و پایان سال 2025 نشان می دهد:
نمودار نشان میدهد که مدلها بر اساس هر کار در سال ۲۰۲۵ هوشمندتر و ارزانتر میشوند. اگر اساسا در هر کار در محور Y یک خط افقی مستقیم بکشید، هزینه انجام آن در پایان سال ۲۰۲۵ ارزانتر از شروع آن بود. و اگر اساسا در هر نقطه ای از محور X یک خط عمودی مستقیم بکشید، مدل ها می توانند با همان هزینه کارهای بیشتری انجام دهند.
اکنون، نمودار 2025 را با نمودار 2026 مقایسه کنید. محور Y (هوش) تقریبا یکسان است، با کاهش کمتری نسبت به انتهای ارزان. محور X (هزینه) دو مرتبه ارزانتر شده است.
"موتور استنتاج" یک بسته نرم افزاری است که یک مدل آموزش دیده و یک متن ورودی را می گیرد و در واقع آن را روی یک GPU اجرا می کند.
موتورهای استنتاج در حال حاضر نابالغ هستند و به سرعت در حال بهبود هستند. در حال حاضر ما شاهد بهبود 10 تا 50 درصدی نسبت به سال گذشته هستیم، بسته به اینکه به کدام موتور نگاه می کنید.
دو معیار وجود دارد که اغلب برای موتورهای استنتاج مقایسه میشوند: «آفلاین» (اجرای دستهای از توکنها در یک دسته بزرگ) و «سرویسدهی» (شما افرادی دارید که ورودیهای سرور شما را در زمانهای غیرقابل پیشبینی ارسال میکنند و میخواهید در سریعترین زمان ممکن پاسخی را ارسال کنید). ارائه خدمات بسیار سریعتر از استنتاج آفلاین کارآمد می شود.
همه شمارههای زیر برای بارهای کاری ارائه میشوند، نه آفلاین.
vLLM یک موتور استنتاج منبع باز است و با گذشت زمان کارآمدتر می شود.
در نمودار زیر (منبع)، محور Y ژول/توکن است، محور X اندازه دسته ای است (تقریبا: "چند ورودی به صورت موازی پردازش می شوند؟")، و خطوط آبی/قرمز نسخه های مختلف نرم افزار هستند. اعداد محور Y کوچکتر به معنای کارآمدتر است.
vLLM 0.11.1 در دسامبر 2025، کمی بیش از یک سال پس از vLLM 0.5.4 در سپتامبر 2024 منتشر شد. به عبارت دیگر، این حدود 40 درصد افزایش کارایی در 15 ماه است.
مقایسه دقیقی از کارایی در طول زمان برای چندین نسخه پشت سر هم وجود ندارد، اما عملکرد نیز با توجه به vLLM به تنهایی در طول زمان به سرعت در حال افزایش است و دستاوردهای عملکرد برای v2 ➝ v3 تقریبا متناسب با بهبود بهره وری انرژی است که اعداد بهتری برای آن داریم.
این به یک بسته نرم افزاری مجزا نیست. NVIDIA تا 50 درصد بهبودهایی را در کارایی پشته MLPerf خود از 2.0 تا 2.1 نشان می دهد:
این به معیارهای قدیمی جدا نیست. اینتل اخیرا تنها با بهبود MLPerf بین 6.0 و 6.1، افزایش توان عملیاتی 2.4 برابری را نشان داد.
این یکی توان عملیاتی را نشان می دهد، نه کارایی، بنابراین مقایسه تمیزی نیست، اما سخت افزار ثابت می ماند در حالی که نرم افزار تغییر می کند، بنابراین به احتمال زیاد مقدار مناسبی از این در کارایی بهتر منعکس می شود.
مدلها از معماریهایی استفاده میکنند که اساسا کارآمدتر از روشهای اولیهای هستند که ما میدانستیم چگونه یک LLM بسازیم.
LLM های اولیه بر اساس مدل های "متراکم" بودند. این بدان معناست که هر بخش از مدل در هر ورودی "فعال" می شود (یک ضرب ماتریس را اجرا می کند). معماری های اخیر از معماری های "Mixture-of-Experts" (MoE) برای غیرفعال کردن لایه های تخصصی "expert" در مواقعی که لازم نیست استفاده می کنند. این به طور مستقیم منجر به استفاده از محاسبات کمتر برای همان کیفیت خروجی می شود. در نمودار زیر، یک مدل می تواند 7 برابر کوچکتر باشد (پارامترهای 6B ➝ 0.8B) در حالی که عملکرد مشابهی در معیارها داشته باشد ( منبع ):
این بدان معناست که ما شاهد کاهش هزینه و استفاده از حافظه مدل ها در طول زمان، نسبت به کیفیت مدل خواهیم بود.
اکنون، البته، مردم با استفاده از محاسبات کمتر برای خروجی با کیفیت یکسان، به این موضوع پاسخ نمیدهند. آنها با استفاده از همان مقدار محاسبه برای خروجی بهتر پاسخ می دهند، که به این معنی است که کارایی توکن ها در هر ژول اساسا یک شستشو است. با این حال، کارایی کیفیت در هر ژول به سرعت در حال افزایش است.
توجه داشته باشید که MoE تمایل زیادی به کمک به ماشینهای محلی ندارد، زیرا برای استفاده از آنها همچنان باید از متخصصان حافظه استفاده کنید. پروژههایی مانند mlx-flash وجود دارند که لایهها را به صورت درخواستی به حافظه تغییر میدهند، اما آنها فقط اجرای آنها را امکانپذیر میکنند، نه سریع.
یکی از محدودیتهای فعلی برای اجرای LLM به صورت محلی این است که شما به مقدار کاملا غیر خدایی رم نیاز دارید و نمیتوانید آن را بخرید زیرا همه شرکتهای هوش مصنوعی ابتدا آن را خریداری کردند. مدل های اخیر میزان رم لازم را 5 برابر یا بیشتر کاهش می دهند.
مدلهای «سنتی» از معماریهای «ترانسفورماتور» استفاده میکنند. در این رویکرد، مدل هر ورودی که به آن داده میشود را به خاطر میآورد، که در برخی موارد میتواند صدها کیلوبایت باشد که در هر لایه ضرب میشود. مدلهای جدیدتر از معماری Mamba استفاده میکنند که در آن مدل خلاصهای از ورودیها را به خاطر میآورد. اگر با "تراکم" در عامل های کدنویسی آشنا هستید، می توانید Mamba را به عنوان فشرده سازی جریانی که مستقیما در خود مدل ساخته شده است در نظر بگیرید (و در نتیجه بسیار کارآمدتر).
Mamba به تنهایی راه حلی نیست (اگر یک LLM نتواند URL را به اندازه کافی به خاطر بسپارد تا آن را به خاطر بسپارد!) اما هیبریدهای Mamba-Transformer شاهد کاهش شدید مقدار RAM مورد نیاز برای همان توکن ها هستند. Nemotron-H-47B می تواند بیش از یک میلیون توکن را در 32 گیگابایت VRAM (تقریبا "رم GPU") در وزن های 3 تا 4 بیتی کوانتیزه نگه دارد. یک مدل Llama-3.1 60B با کیفیت مشابه تقریبا به 120 گیگابایت برای همان مقدار توکن نیاز دارد، و این اعداد تنها زمانی بدتر می شوند که از کوانتیزاسیون استفاده نکنید.
با استفاده از هوش مصنوعی فقط برای پاسخ های تخصصی بله/خیر، می توانید هزینه آنها را دو مرتبه کاهش دهید.
TypeSafe AI محصول پرچمدار خود را این هفته با نام "Jev" معرفی کرد. Jev بر خلاف LLM های مولد است زیرا نمی تواند متنی را منتشر کند، فقط می تواند بین مجموعه ای از گزینه های از پیش انتخاب شده انتخاب کند. به عنوان مثال، می توانید از آن بپرسید "آیا این دستور پوسته فرمان سیستم را نقض می کند یا تغییرات مخربی ایجاد می کند؟" و احتمالی بین 0 تا 100 درصد به شما می دهد.
چیزهای جالب زیادی در مورد Jev وجود دارد، اما چیزی که واقعا برای من قابل توجه بود، این قسمت از صفحه قیمت آنها است:
این بسیار ارزان است که تقریبا ارزش نگرانی ندارد. این هزینه کمتر از قبض برق شما است.
در واقع، آنقدر ارزان است که مردم در حال ساخت ابزارهای توسعهدهنده هستند که مستقیما به Jev تماس میگیرند. یک مثال jgrep است که به شما امکان می دهد پرس و جوهایی را مانند زیر اجرا کنید:
چیزهای عجیب تر دیگری هم وجود دارد. Jev triage یک TUI برای بررسی درخواستهای کشش باز است که بر اساس اولویت مرتب شدهاند. اولویت را نه با برچسب ها، بلکه با مشاهده هر نظر تعیین می کند. این جایگزینی برای یک تیم اختصاصی تریاژ نیست، اما یک دستیار لعنتی خوب است.
Jev یک مدل انحصاری است، اما لایا وزن باز دارد و به اندازه کافی کوچک است که به صورت محلی اجرا شود. همچنین هنگام تنظیم دقیق می تواند سریعتر و دقیق تر از Jev باشد. نقطه ضعف آن این است که یک پایگاه کد است، نه یک محصول:
نگاه کردن به Jev و Laya مرا متقاعد میکند که هنوز پیشرفتهای معماری زیادی روی میز وجود دارد، که در آینده نزدیک به محدودیتهای مقیاسبندی برای ML نخواهیم رسید.
اگر همه این ها را با هم ترکیب کنیم، شاهد کاهش 2.5 مرتبه ای در هزینه توکن در سال گذشته خواهیم بود.
اگر از بررسی هزینه توکن خام دست برداریم و معیارهای دیگر را در نظر بگیریم، شاهد انواع دیگری از بهبودها خواهیم بود:
همه اینها هنوز نابالغ هستند و احتمالا با گذشت زمان بهتر می شوند. ما هنوز تا رسیدن به بازدهی رو به کاهش فاصله داریم.
چیزی که واقعا جالب می شود این است که این را با سایر هزینه های محاسبات مقایسه کنید. به عنوان مثال، بیایید ببینیم که تماس های ابزار چقدر گران هستند. من فقط تخمین های تقریبی را در اینجا انجام می دهم. ما در مورد مرتبه های بزرگی صحبت می کنیم، بنابراین تخمین فرمی به اندازه کافی نزدیک است.
GPT-5.6 Luna حدود 30 سنت در هر میلیون توکن هزینه دارد (منبع). فرض کنید لونا هر بار که تصمیم به فراخوانی ابزاری میگیرد از ۱۰ هزار توکن استفاده میکند، یعنی یک سوم سنت در هر نوبت. برق در شهر نیویورک و در هلند که من زندگی می کنم حدود 25 سنت در هر کیلووات ساعت است. مک بوک ایر من حدود 10 وات در حالت بیکار و 30 وات در صورت استفاده زیاد مصرف می کند. 5 جدولی به شکل زیر به ما می دهد:
این ... در چند سال آینده غیر قابل تصور نیست!
هنگامی که مدل ها ارزان تر از یک ابزار هستند، قرار دادن مدل ها در ابزار جذاب می شود. قبلا این را در بالا با jgrep دیدیم. در آینده ممکن است آن را برای طیف وسیع تری از زیرساخت های محاسباتی ببینیم. برای مثال، ممکن است زمانبندیهای ساخت تطبیقی را ببینیم که از یادگیری ماشینی استفاده میکنند. اینها امروزه امکان پذیر هستند، اما برای راه اندازی به تخصص بسیار زیادی نیاز دارند. هنگامی که آنها با یک مدل همه منظوره امکان پذیر شدند، جاسازی آنها بسیار آسان تر خواهد بود.
با ارزانتر شدن مدلها، شرکتها با ساخت محاسبات بیشتر پاسخ میدهند. چرا؟ زیرا آنها به ازای هر دلار سرمایه گذاری درآمد بیشتری کسب می کنند. این پارادوکس ژیونز نامیده می شود: هر چه چیزی کارآمدتر باشد، به طور کلی تعداد بیشتری از آن وجود دارد. به ویژه، با ارزانتر شدن همه چیز، مردم تمایل بیشتری به استفاده از آن دارند. این تقاضای القایی نامیده می شود و اغلب هنگام صحبت در مورد شبکه های حمل و نقل مطرح می شود.
اگر توکن ها برای اندازه گیری خیلی ارزان هستند، ارائه دهندگان LLM چگونه درآمد کسب می کنند؟ آیا این به معنای ترکیدن حباب است؟
نه، من اینطور فکر نمی کنم. اولا، همانطور که در بخش بالا در مورد آن صحبت کردم، فقط به این دلیل که هر توکن ارزان است، به این معنی نیست که استنتاج برای ارائه دهندگان سودآور نیست. اما ثانیا، OpenAI و Anthropic هنوز به طور قابل توجهی از بسیاری از آزمایشگاه های هوش مصنوعی دیگر جلوتر هستند. فقط به این دلیل که حجم در حال ارزان شدن است به این معنی نیست که کیفیت آن ارزان است. من فکر میکنم دنیایی را شاهد خواهیم بود که سختترین کارها محاسبات را از آزمایشگاههای مرزی خریداری میکنند، در حالی که وظایف «عادی» از وزنهای باز یا طرحهایی با تخفیف سنگین استفاده میکنند که باید با وزنهای باز رقابت کنند.
اینکه آیا مدلهای وزن باز به OpenAI و Anthropic میرسند یا خیر، هنوز یک سوال باز است! اگر این کار را انجام دهند، به سرمایه گذاران آسیب می رساند و احتمالا تأثیرات موجی در اقتصاد ایالات متحده خواهد داشت. با این حال، من فکر نمیکنم که تصویر اساسی فناوری را تغییر دهد: NVIDIA همچنان رونق خواهد داشت و شرکتها همچنان از هوش مصنوعی استفاده خواهند کرد (و حتی ارزانتر از آنچه در غیر این صورت بود خواهد بود).
اما یک سوال جالب دیگر وجود دارد: هنگامی که محاسبات به اندازه کافی ارزان شد، مردم برای چه کاری از آن استفاده خواهند کرد؟ با یک میلیون توکن چه می کنید؟ یک میلیارد؟
در اینجا مواردی وجود دارد که به نظر من امکان پذیر است، اگرچه همه آنها محتمل نیستند.
آنچه من فکر می کنم واقعا جالب است این است که قبلا افراد هنگام بررسی یک نرم افزار سه گزینه اساسی داشتند:
حالا آنها یک گزینه چهارم دارند، یعنی به یک LLM بگویند آن را بسازد. کیفیت خروجی LLM ممکن است بهتر یا بدتر باشد، اما این گزینه زمانی وجود دارد که قبلا نبود. شرکت ها باید در کیفیت رقابت کنند، نه فقط در توانایی خام برای انجام کاری که قبلا نمی توانستید. متصدیان در صنایع تحت نظارت در مقایسه با بازار آزاد از مزیت بزرگی برخوردار خواهند بود.
نکته جالب در این مورد این است که ایجاد نرمافزار انعطافپذیر را که دقیقا برای شخصی که از آن استفاده میکند ساخته شده است را بسیار آسانتر میکند، چیزی که حتی 5 سال پیش برای هر کسی که برنامهنویس نیست غیرقابل تصور بود.
نمی دانم بعدش چیست. من فکر می کنم ما باید برای جهانی برنامه ریزی کنیم که در آن نه تنها محاسبات ارزان، بلکه هوش ارزان را نیز ببینیم.
من در اینجا عمدا از «AI» به جای «LLM» استفاده میکنم: طبقهبندیکنندههای یادگیری ماشین جدیدی مانند Jev وجود دارند که LLM نیستند اما هنوز از نظر قابلیت قابل مقایسه هستند. ↩
مگر اینکه معیار دیگری در ذهن داشته باشید، مانند "به من بگو پایتخت تایوان" یا "سخنرانی های انتخاباتی می نویسم"، که به ترتیب توسط مدل های چینی و آمریکایی مجاز نیستند ↩
«کوانتیزاسیون» تقریبا به معنای «مقدار جزئیات درون خود مدل» است. پیش فرض اعداد ممیز شناور 16 بیتی است. مدلها اغلب به 8 بیت یا 4 بیت «کوانتیزه میشوند» و تنها با افت کیفیت متوسطی مواجه میشوند که آنها را بسیار کوچکتر و سریعتر میکند. ↩
TypeSafe میگوید: «ما نمیتوانیم ثابت کنیم که به آن یارانه داده نمیشود؛ ما برای اثبات پایداری قیمتگذاری خود (که انتظار داریم کاهش یابد، نه افزایش) به درازمدت نیاز داریم.» ↩
این به طور غیرعادی برای سخت افزار کارآمد است. نرم افزار سرور برای توان تنظیم شده است، نه کارایی، بنابراین احتمالا برای اجرای همان ابزار یک مرتبه قدرت بیشتری نیاز دارد. ↩
یکی از مواردی که استفاده از نرم افزارهایی مانند خدمات الکترونیکی پرونده پزشکی را برای پزشکان بسیار بد می کند این است که پزشکان اجازه ندارند به سادگی از آنها استفاده نکنند. آنها طبق قانون موظفند مقداری از سوابق را نگه دارند که برای ردیابی دستی بسیار زیاد است. این، به علاوه هزینههای تعویض، منجر به «انحصارطلبیهایی» میشود که در آن گروه کوچکی از شرکتهای فعال میتوانند بدون در نظر گرفتن میزان بدی محصولاتشان، بازار را به سمت خود برگردانند. ↩
خارج از جایگاه های بسیار محدودی مانند صفحات گسترده Apple Shortcuts، Salesforce، و Excel ↩
متن اصلی (انگلیسی)
Tokens too cheap to meter
Article URL: https://jyn.dev/tokens-too-cheap-to-meter/ Comments URL: https://news.ycombinator.com/item?id=49813482 Points: 273 # Comments: 189