پرش به محتوای اصلی

کد نویسی یک ماهه با GLM 5.3 Flash

هکرنیوز۱۴۰۵ مهر ۱۰, جمعه، ساعت ۱۸:۵۹حدود 3 دقیقه مطالعه

آدرس مقاله: https://wagtail.org/blog/one-month-on-glm-53-flash/ آدرس نظرات: https://news.ycombinator.com/item?id=49934620 امتیاز: 217 # نظرات: 175

در آن زمان ایجاد چالش برای صرف کل ماه سپتامبر بر روی تنها یک مدل باز کارآمد ایده خوبی بود. معلوم می شود در عمل چندان زیاد نیست. 2B توکن بعد، در اینجا نحوه پیش رفت.

در اینجا توزیع توکن ها بر اساس AgentsView، یکی از توصیه های مهندسی Agentic ما برای نظارت بر استفاده از هوش مصنوعی است:

هدف این بود که کل ماه را در GLM 5.3 Flash که در تصویر به رنگ سبز نشان داده شده بود صرف کنیم. این چیزی است که خوب پیش رفت:

نیمه دوم ماه چندان خوب پیش نرفت و 1 میلیارد توکن به مدل های دیگر رفت.

هشدار منصفانه - احتمالا می توانستیم کسانی را که می آمدند ببینیم! من امیدوارم

با این وجود، یادآوری خوبی است که در انتخاب مدل و الگوهای عامل دقت کنید. ما می توانستیم به نتایج مشابهی با به احتمال زیاد 5 برابر هزینه کمتر با تلاش نه چندان بیشتر دست پیدا کنیم. درس های آموخته شده! ما باید برای این کار بودجه اختصاص دهیم و بیشتر مراقب باشیم. می توانستیم شاهد آمدن آن باشیم، اما اکنون می دانیم.

یکی دیگر از موانع غیرمنتظره، مشکلات در دسترس بودن زیرساخت ها بود. ما به طور گسترده در مورد مقایسه ارائه دهندگان استنتاج نوشته ایم. انتخاب‌های ما واقعا اکثر اوقات کار می‌کنند، اما به نظر می‌رسد که بسیار محبوب هستند و ظرفیتی برابر با آزمایشگاه‌های بزرگی که همه پردازنده‌های گرافیکی را ذخیره می‌کنند، ندارند. ما به طور خاص به کاهش عملکرد GLM 5.3 Flash اشاره کردیم، به احتمال زیاد به این دلیل که در مرز پارتو از مدل های مربوطه برای کار ما قرار دارد.

توجه: این فیلتر فقط برای نشان دادن مدل‌های باز است که می‌توانیم تأیید کنیم در مرکز داده اروپایی موجود هستند. اگر استنتاج را در جای دیگری خوب اجرا کنید، ممکن است مرز پارتو شما متفاوت به نظر برسد.

برای ما، با آن مدل‌های موجود، این بدان معناست که باید به مدل‌های مشابه دیگر (DeepSeek V4.1 Flash، Qwen 3.8 Flash) سوئیچ کنیم. کاری که انجام آن بسیار ساده است، اما با این وجود غیرمنتظره!

آخرین اما نه کم‌اهمیت، فراتر از استفاده از یک مدل برای مهندسی روزانه، آزمایش با طیف گسترده‌ای از مدل‌ها و همگام شدن با آنچه ارائه‌دهندگان منتشر می‌کنند ضروری به نظر می‌رسد. این امر به ویژه ضروری است زیرا ما شروع به محک زدن عملکرد مدل ها در وظایف Wagtail می کنیم، جایی که ما به داده ها در طیف گسترده ای از مدل ها نیاز داریم. نگاهی کوتاه به معیار ما:

با این نوع داده‌های مشخص، راهنمایی افراد به سمت گزینه‌های ناب‌تر بسیار آسان‌تر است. و برای اینکه بتوانیم آن گزینه‌ها را حتی با مهارت‌های عامل، یا نمونه اولیه CLI جدید خود، که قرار است به خوبی با نمایندگان کار کند، قابل اجراتر کنیم.

همه چیز بد نبود، و مطمئنا من می‌خواهم این چالش را برای مدت طولانی‌تری ادامه دهم، اما فقط برای 50+ درصد از «تولید» عادی روزانه، نه تحقیق و توسعه. GLM 5.3 Flash خودش عالی بود! شایان ذکر است که از مقایسه مدل‌های ما چه چیزی آن را برای چالشی مانند این بسیار مناسب می‌کند:

من آن را روی خود Wagtail کار کردم، سایت هایی که با آن ساخته شده بودند. وظایف رابط کاربری، تحقیق و توسعه هوش مصنوعی، همچنین کمی نوشتن مستندات. ارزش های زیادی واقعا چند ظرفیتی

بنابراین از نظر فنی این چالش یک شکست بود. فقط 50٪ استفاده در مدل هدف، 1B از 2B توکن. حدود 35 کیلووات ساعت مصرف انرژی به جای 10. اما ما چیزهای زیادی یاد گرفتیم که برای لحظه فعلی بسیار مهم است. با تأمل در این مورد برای ماه اکتبر، در اینجا چیزی است که آن را به کار می‌اندازد:

برای کارهای روزمره توسعه دهندگان، تمرکز بر روی یک یا دو مدل ارزان قیمت فلش کاملا مفید است. احتمالا یک هدف قابل اجرا این است که اکثر کارهای استنتاج هوش مصنوعی باید با چنین مدل‌های کارآمدی انجام شود که به جای توکن‌های بی‌معنی، در هزینه یا مصرف انرژی اندازه‌گیری می‌شوند. این هدف اکتبر است! شما نیز باید آن را امتحان کنید، در این فرآیند چیزهای زیادی یاد خواهید گرفت.

و بیایید در Wagtail Space 2026 در نوامبر سلام کنید تا بشنوید که چگونه همه چیز به پایان می رسد!

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

One month coding with GLM 5.3 Flash

Article URL: https://wagtail.org/blog/one-month-on-glm-53-flash/ Comments URL: https://news.ycombinator.com/item?id=49934620 Points: 217 # Comments: 175

همه‌ی اخبار فناوری