پرش به محتوای اصلی

چت‌بات‌های لجباز؛ چرا هوش مصنوعی عذرخواهی می‌کند، اما از اشتباهش دست نمی‌کشد؟

زومیت۱۴۰۵ مهر ۹, پنجشنبه، ساعت ۲۳:۰۰حدود 6 دقیقه مطالعه

هوش مصنوعی در مکالمات طولانی گیج می‌شود و به‌جای اصلاح، اشتباهش را به شیوه‌های مختلف ادامه می‌دهد. ریشه‌ی این لجبازی کجاست؟

هوش مصنوعی در مکالمات طولانی گیج می‌شود و به‌جای اصلاح، اشتباهش را به شیوه‌های مختلف ادامه می‌دهد. ریشه‌ی این لجبازی کجاست؟

ماجرا معمولاً با یک درخواست ساده از دستیار هوش مصنوعی شروع می‌شود: «این یادداشت را برای جلسه‌ی فردا ویرایش کن». درخواست کمی دوپهلوست، اما مدل اصلاً معطل نمی‌کند و با لحنی مطمئن و خوش‌بینانه متنی برای جلسه‌ای با مدیران می‌نویسد.

کمی بعد، کاربر وارد عمل می‌شود تا ابهام را برطرف کند: «نه، جلسه با مهندس‌هاست. پروژه شکست‌خورده و باید بی‌تعارف و صریح درباره‌ی دلایلش حرف بزنیم.»

هوش مصنوعی عذرخواهی می‌کند، اشتباهش را می‌پذیرد و حتی دلایل شکست را هم به متن اضافه می‌کند. اما خروجی جدید، هنوز بوی جلسات هیئت‌مدیره می‌دهد! شکست به «فرصتی شیرین برای یادگیری» تبدیل می‌شود، جزئیات حیاتیِ فنی به حاشیه می‌روند و لحن متن همچنان می‌خواهد مخاطب را تحت‌تأثیر قرار دهد. مدل ظاهراً حرف کاربر را تصدیق می‌کند، اما اسکلت‌بندی متن هنوز حال‌وهوای برداشت اولیه را دارد.

پژوهشگران متا با همین مثالِ آشنا، رفتاری را توضیح می‌دهند که اغلب کاربران حرفه‌ای هوش مصنوعی بارها تجربه‌اش کرده‌اند. مدل عذر می‌خواهد، می‌گوید «حق با شماست» و حتی خطایش را درست توضیح می‌دهد. اما در نهایت ردپای برداشت اشتباه اولیه، شاید کمی پنهان‌تر در پاسخ دیده می‌شود.

لجبازی مدل‌های هوش مصنوعی را همیشه در فرم مخالفت آشکار نمی‌بینیم، گاهی آن را پشت موافقتی مؤدبانه تجربه می‌کنیم.

پژوهشگران اصرار پنهان مدل‌ها بر اشتباهشان را با تعبیرهایی مثل سختی استدلال و اینرسی باور توصیف می‌کنند. اینرسی باور یعنی اطلاعات جدیدی به مدل می‌رسد، اما برداشت قبلی هنوز روی جواب یا تصمیم بعدی سنگینی می‌کند.

رسیدن اطلاعات جدید به مدل همیشه به معنای اصلاح مسیر نیست.

وقتی از لجبازی حرف می‌زنیم، منظورمان قصد، غرور یا شخصیتی انسانی در مدل نیست. این اصطلاح را برای الگویی سنجش‌پذیر به کار می‌بریم؛ زیرا شواهد جدید باید نتیجه را عوض کنند، ولی اثر اطلاعات کهنه همچنان ادامه پیدا می‌کند.

مقاله‌ی جدید متا با عنوان شفاف‌سازی به معنای اصلاح نیست؛ مدل‌های زبانی نمی‌توانند رها کنند، ۲۱ سپتامبر ۲۰۲۶ منتشر شد. نویسندگان درخواست‌هایی مبهم در سه حوزه‌ی نویسندگی، برنامه‌ریزی و کدنویسی نوشتند و سراغ Gemini 2.5 Pro و Gemini 2.5 Flash رفتند.

مدل ابتدا بر پایه‌ی پیام ناقص کاربر دست‌به‌کار می‌شد، پیام بعدی ابهام را صریحاً توضیح می‌داد و مدل باید کارش را با خواسته‌ی تازه هماهنگ می‌کرد.

هر دو گفت‌وگو در پایان دقیقاً اطلاعات یکسانی در اختیار مدل می‌گذاشتند و تفاوتشان فقط به ترتیب رسیدن اطلاعات برمی‌گشت. وقتی از همان ابتدا توضیح کامل ارائه می‌شد، Gemini 2.5 Pro پنجاه درصد وظایف را با موفقیت انجام می‌داد.

اما وقتی درخواست اولیه کمی مبهم بود و توضیحات تکمیلی را کمی بعد به مدل می‌دادند، موفقیت به ۴۲٫۸ درصد می‌رسید . امتیاز Gemini 2.5 Flash نیز از ۵۵٫۴ به ۴۵٫۷ درصد کاهش پیدا کرد. مقصد یکی بود، اما راهی که مدل طی می‌کرد نتیجه را تغییر می‌داد.

پژوهشگران ردپای برداشت کنارگذاشته در جواب نهایی را آلودگی به فرضیه‌ی قدیمی نامیدند. این ردپا در ۱۲٫۵ درصد وظایف نویسندگی، ۱۴٫۱ درصد وظایف برنامه‌ریزی و ۲۵٫۶ درصد وظایف کدنویسی دیده می‌شد.

شاید در یک متن، فرض غلط با عوض‌کردن چند عبارت از بین برود؛ اما در یک برنامه می‌تواند به امضای تابع، ساختار داده، وابستگی‌ها یا مسیر اجرای کد راه پیدا کند و دیگر با چند وصله‌ی موضعی نمی‌شود همه‌ی این بخش‌ها را یک‌جا اصلاح کرد.

در کدنویسی، فاصله‌ی میان پذیرفتن و تغییر واقعی پررنگ‌تر می‌شد. مدل‌ها در ۹۳٫۵ درصد موارد می‌گفتند توضیح تازه‌ی کاربر را پذیرفته‌اند، اما کدها فقط در ۸۶٫۴ درصد موارد واقعاً اصلاح شد. مدل می‌توانست دقیقاً بگوید چه چیزی را اشتباه فهمیده و در همان حال برداشت غلطش را در برنامه حفظ می‌کرد. عذرخواهی‌اش هم در سطح کلمات خیلی خوب به نظر می‌رسید، ولی جواب نهایی کاملاً بازسازی نمی‌شد.

هوش مصنوعی خیلی زود به اولین برداشتش متعهد می‌شود و توضیحات بعدی شما را فقط یک پیوست بی‌اثر می‌بیند

نویسندگان مقاله این وضعیت را تعهد زودهنگام به یک برداشت می‌نامند. مدل وقتی با درخواستی مبهم روبه‌رو می‌شود، به‌جای اینکه چند احتمال را باز نگه دارد، خیلی زود یکی را پیش خودش قطعی می‌کند. توضیح بعدی کاربر هم مثل اطلاعاتی تکمیلی وارد گفت‌وگو می‌شود، نه نشانه‌ای که برداشت اول را باطل کند. درنهایت مدل جواب موجود را وصله‌پینه می‌کند، درحالی‌که برای اصلاح واقعی گاهی باید جواب را از صفر تولید کرد.

مطالعه‌ی متا هنوز در مرحله‌ی پیش‌انتشار قرار دارد و فقط دو مدل جمنای را تست می‌کند، پس به‌تنهایی نمی‌شود نتیجه‌اش را به همه‌ی مدل‌ها تعمیم داد. ولی پژوهشگران دیگری نیز تصمیم گرفتند رفتار مدل‌ها را در لحظه‌ای که برداشت اولیه‌شان را باوجود اصلاح کاربر در جواب جدید می‌آورند، بررسی کنند، آن‌هم در گفت‌وگوهای طولانی‌تر.

گروهی از پژوهشگران مایکروسافت و سیلزفورس ریسرچ، بیش از ۲۰۰ هزار گفت‌وگوی شبیه‌سازی‌شده را روی ۱۵ مدل از هشت خانواده اجرا کردند. آن‌ها به‌جای اینکه همه‌ی اطلاعات را همان ابتدا در اختیار مدل بگذارند، درخواست را به چند بخش تقسیم کردند و جزئیات لازم را کم‌کم در طول گفت‌وگو اضافه کردند، شبیه همان چیزی که در استفاده‌ی واقعی اتفاق می‌افتد.

در دنیای واقعی هم کاربر همه‌ی جزئیات پروژه، کد یا محاسبه را آماده ندارد و خواسته‌اش طی چند رفت‌وبرگشت کامل‌تر می‌شود. نتیجه‌ی آزمایش‌ها با عنوان « مدل‌های زبانی در گفت‌وگوهای چندمرحله‌ای گم می‌شوند » منتشر شد و از افت متوسط ۳۹ درصدی عملکرد در شش وظیفه خبر می‌داد.

بخش کوچکی از این افت عملکرد به ضعف توانایی خام مدل‌ها مربوط می‌شد و بخش بزرگ‌تری به بی‌ثباتی‌شان برمی‌گشت. مدلی که مسئله‌ای را در یک گفت‌وگو درست حل کرده بود، ممکن بود در اجرای دوباره‌ی همان گفت‌وگو راهی کاملاً دیگر برود.

وقتی پژوهشگران جواب‌ها را زیر ذره‌بین بردند، به چهار الگوی تکرارشونده رسیدند. مدل‌ها پیش از رسیدن همه‌ی جزئیات سراغ پاسخ کامل می‌رفتند، بیش از حد به جواب‌های قبلی خود تکیه می‌کردند، تحت‌تأثیر آخرین پیام کاربر بخشی از اطلاعات میانی گفت‌وگو را از دست می‌دادند و معمولاً بیش از اندازه مفصل پاسخ می‌دادند.

وقتی هوش مصنوعی در یک مکالمه پیچِ اشتباهی را رد کند، دیگر به‌سختی می‌تواند راه برگشت را پیدا کند

پاسخ‌های زودهنگام و طولانی، فرض‌های تازه‌ای وارد تاریخچه‌ی چت می‌کردند و وقتی کاربر بعداً اطلاعات جدیدی می‌داد، مدل به‌جای کنارگذاشتن کامل آن فرض‌ها، اغلب پاسخش را روی همان چیزی بنا می‌کرد که چند مرحله قبل خودش ساخته بود.

پایین‌آوردن «دما» هم چاره‌ی کار نشد. دما میزان تنوع مدل در انتخاب واژه‌های بعدی را تنظیم می‌کند و صفرکردنش معمولاً جواب‌ها را قابل‌پیش‌بینی‌تر می‌کند. بااین‌حال، بی‌ثباتی در گفت‌وگوهای چندمرحله‌ای حدود ۳۰ درصد باقی ماند. تغییری کوچک در چند واژه‌ی اول می‌توانست مدل را به راهی بکشاند که خطاهایش در پیام‌های بعدی روی‌هم تلنبار شوند. مدل وقتی یک‌بار پیچ اشتباه را رد می‌کرد، به‌سختی راه برگشت را می‌یافت.

دو سال قبل، معیار RefuteBench همین بازگشت به مسیر قبلی را در حوزه‌های پرسش‌وپاسخ، ترجمه و نوشتن ایمیل سنجیده بود. کاربر با جواب مدل مخالفت می‌کرد یا دستور تازه‌ای می‌داد و پژوهشگران بررسی می‌کردند که اثر اصلاح تا کجای گفت‌وگو دوام می‌آورد.

برخی مدل‌ها اصلاح را اول اجرا می‌کردند، اما هرچه مکالمه طولانی‌تر می‌شد، دوباره به جواب یا ترجیح قبلی‌شان برمی‌گشتند. نسخه‌ی دوم این معیار هم نشان داد پذیرفتن یک اصلاح در همان لحظه تضمین نمی‌کند که در پیام‌های بعدی هم سر جایش بماند.

اگر فکر می‌کنید مشکل فقط از فراموشی مدل‌ها ناشی می‌شود، کمی صبر کنید. گاهی اصلاح، روشن و صریح، درست در آخرین پیام جلوی چشم مدل قرار دارد و باز هم ردپای فرض قبلی در پاسخ جدید دیده می‌شود. پس مشکل از حافظه‌ی هوش مصنوعی نیست.

مشکل از جایی شروع می‌شود که مدل باید برداشت قدیمی‌اش را کنار بگذارد و مسئله را از نو صورت‌بندی کند.

خواندن متن کامل در زومیتبه زبان اصلی، در سایت ناشر باز می‌شودهمه‌ی اخبار فناوری