کد نویسی یک ماهه با GLM 5.3 Flash
آدرس مقاله: https://wagtail.org/blog/one-month-on-glm-53-flash/ آدرس نظرات: https://news.ycombinator.com/item?id=49934620 امتیاز: 217 # نظرات: 175
در آن زمان ایجاد چالش برای صرف کل ماه سپتامبر بر روی تنها یک مدل باز کارآمد ایده خوبی بود. معلوم می شود در عمل چندان زیاد نیست. 2B توکن بعد، در اینجا نحوه پیش رفت.
در اینجا توزیع توکن ها بر اساس AgentsView، یکی از توصیه های مهندسی Agentic ما برای نظارت بر استفاده از هوش مصنوعی است:
هدف این بود که کل ماه را در GLM 5.3 Flash که در تصویر به رنگ سبز نشان داده شده بود صرف کنیم. این چیزی است که خوب پیش رفت:
نیمه دوم ماه چندان خوب پیش نرفت و 1 میلیارد توکن به مدل های دیگر رفت.
هشدار منصفانه - احتمالا می توانستیم کسانی را که می آمدند ببینیم! من امیدوارم
با این وجود، یادآوری خوبی است که در انتخاب مدل و الگوهای عامل دقت کنید. ما می توانستیم به نتایج مشابهی با به احتمال زیاد 5 برابر هزینه کمتر با تلاش نه چندان بیشتر دست پیدا کنیم. درس های آموخته شده! ما باید برای این کار بودجه اختصاص دهیم و بیشتر مراقب باشیم. می توانستیم شاهد آمدن آن باشیم، اما اکنون می دانیم.
یکی دیگر از موانع غیرمنتظره، مشکلات در دسترس بودن زیرساخت ها بود. ما به طور گسترده در مورد مقایسه ارائه دهندگان استنتاج نوشته ایم. انتخابهای ما واقعا اکثر اوقات کار میکنند، اما به نظر میرسد که بسیار محبوب هستند و ظرفیتی برابر با آزمایشگاههای بزرگی که همه پردازندههای گرافیکی را ذخیره میکنند، ندارند. ما به طور خاص به کاهش عملکرد GLM 5.3 Flash اشاره کردیم، به احتمال زیاد به این دلیل که در مرز پارتو از مدل های مربوطه برای کار ما قرار دارد.
توجه: این فیلتر فقط برای نشان دادن مدلهای باز است که میتوانیم تأیید کنیم در مرکز داده اروپایی موجود هستند. اگر استنتاج را در جای دیگری خوب اجرا کنید، ممکن است مرز پارتو شما متفاوت به نظر برسد.
برای ما، با آن مدلهای موجود، این بدان معناست که باید به مدلهای مشابه دیگر (DeepSeek V4.1 Flash، Qwen 3.8 Flash) سوئیچ کنیم. کاری که انجام آن بسیار ساده است، اما با این وجود غیرمنتظره!
آخرین اما نه کماهمیت، فراتر از استفاده از یک مدل برای مهندسی روزانه، آزمایش با طیف گستردهای از مدلها و همگام شدن با آنچه ارائهدهندگان منتشر میکنند ضروری به نظر میرسد. این امر به ویژه ضروری است زیرا ما شروع به محک زدن عملکرد مدل ها در وظایف Wagtail می کنیم، جایی که ما به داده ها در طیف گسترده ای از مدل ها نیاز داریم. نگاهی کوتاه به معیار ما:
با این نوع دادههای مشخص، راهنمایی افراد به سمت گزینههای نابتر بسیار آسانتر است. و برای اینکه بتوانیم آن گزینهها را حتی با مهارتهای عامل، یا نمونه اولیه CLI جدید خود، که قرار است به خوبی با نمایندگان کار کند، قابل اجراتر کنیم.
همه چیز بد نبود، و مطمئنا من میخواهم این چالش را برای مدت طولانیتری ادامه دهم، اما فقط برای 50+ درصد از «تولید» عادی روزانه، نه تحقیق و توسعه. GLM 5.3 Flash خودش عالی بود! شایان ذکر است که از مقایسه مدلهای ما چه چیزی آن را برای چالشی مانند این بسیار مناسب میکند:
من آن را روی خود Wagtail کار کردم، سایت هایی که با آن ساخته شده بودند. وظایف رابط کاربری، تحقیق و توسعه هوش مصنوعی، همچنین کمی نوشتن مستندات. ارزش های زیادی واقعا چند ظرفیتی
بنابراین از نظر فنی این چالش یک شکست بود. فقط 50٪ استفاده در مدل هدف، 1B از 2B توکن. حدود 35 کیلووات ساعت مصرف انرژی به جای 10. اما ما چیزهای زیادی یاد گرفتیم که برای لحظه فعلی بسیار مهم است. با تأمل در این مورد برای ماه اکتبر، در اینجا چیزی است که آن را به کار میاندازد:
برای کارهای روزمره توسعه دهندگان، تمرکز بر روی یک یا دو مدل ارزان قیمت فلش کاملا مفید است. احتمالا یک هدف قابل اجرا این است که اکثر کارهای استنتاج هوش مصنوعی باید با چنین مدلهای کارآمدی انجام شود که به جای توکنهای بیمعنی، در هزینه یا مصرف انرژی اندازهگیری میشوند. این هدف اکتبر است! شما نیز باید آن را امتحان کنید، در این فرآیند چیزهای زیادی یاد خواهید گرفت.
و بیایید در Wagtail Space 2026 در نوامبر سلام کنید تا بشنوید که چگونه همه چیز به پایان می رسد!
متن اصلی (انگلیسی)
One month coding with GLM 5.3 Flash
Article URL: https://wagtail.org/blog/one-month-on-glm-53-flash/ Comments URL: https://news.ycombinator.com/item?id=49934620 Points: 217 # Comments: 175