چتباتهای لجباز؛ چرا هوش مصنوعی عذرخواهی میکند، اما از اشتباهش دست نمیکشد؟
هوش مصنوعی در مکالمات طولانی گیج میشود و بهجای اصلاح، اشتباهش را به شیوههای مختلف ادامه میدهد. ریشهی این لجبازی کجاست؟
هوش مصنوعی در مکالمات طولانی گیج میشود و بهجای اصلاح، اشتباهش را به شیوههای مختلف ادامه میدهد. ریشهی این لجبازی کجاست؟
ماجرا معمولاً با یک درخواست ساده از دستیار هوش مصنوعی شروع میشود: «این یادداشت را برای جلسهی فردا ویرایش کن». درخواست کمی دوپهلوست، اما مدل اصلاً معطل نمیکند و با لحنی مطمئن و خوشبینانه متنی برای جلسهای با مدیران مینویسد.
کمی بعد، کاربر وارد عمل میشود تا ابهام را برطرف کند: «نه، جلسه با مهندسهاست. پروژه شکستخورده و باید بیتعارف و صریح دربارهی دلایلش حرف بزنیم.»
هوش مصنوعی عذرخواهی میکند، اشتباهش را میپذیرد و حتی دلایل شکست را هم به متن اضافه میکند. اما خروجی جدید، هنوز بوی جلسات هیئتمدیره میدهد! شکست به «فرصتی شیرین برای یادگیری» تبدیل میشود، جزئیات حیاتیِ فنی به حاشیه میروند و لحن متن همچنان میخواهد مخاطب را تحتتأثیر قرار دهد. مدل ظاهراً حرف کاربر را تصدیق میکند، اما اسکلتبندی متن هنوز حالوهوای برداشت اولیه را دارد.
پژوهشگران متا با همین مثالِ آشنا، رفتاری را توضیح میدهند که اغلب کاربران حرفهای هوش مصنوعی بارها تجربهاش کردهاند. مدل عذر میخواهد، میگوید «حق با شماست» و حتی خطایش را درست توضیح میدهد. اما در نهایت ردپای برداشت اشتباه اولیه، شاید کمی پنهانتر در پاسخ دیده میشود.
لجبازی مدلهای هوش مصنوعی را همیشه در فرم مخالفت آشکار نمیبینیم، گاهی آن را پشت موافقتی مؤدبانه تجربه میکنیم.
پژوهشگران اصرار پنهان مدلها بر اشتباهشان را با تعبیرهایی مثل سختی استدلال و اینرسی باور توصیف میکنند. اینرسی باور یعنی اطلاعات جدیدی به مدل میرسد، اما برداشت قبلی هنوز روی جواب یا تصمیم بعدی سنگینی میکند.
رسیدن اطلاعات جدید به مدل همیشه به معنای اصلاح مسیر نیست.
وقتی از لجبازی حرف میزنیم، منظورمان قصد، غرور یا شخصیتی انسانی در مدل نیست. این اصطلاح را برای الگویی سنجشپذیر به کار میبریم؛ زیرا شواهد جدید باید نتیجه را عوض کنند، ولی اثر اطلاعات کهنه همچنان ادامه پیدا میکند.
مقالهی جدید متا با عنوان شفافسازی به معنای اصلاح نیست؛ مدلهای زبانی نمیتوانند رها کنند، ۲۱ سپتامبر ۲۰۲۶ منتشر شد. نویسندگان درخواستهایی مبهم در سه حوزهی نویسندگی، برنامهریزی و کدنویسی نوشتند و سراغ Gemini 2.5 Pro و Gemini 2.5 Flash رفتند.
مدل ابتدا بر پایهی پیام ناقص کاربر دستبهکار میشد، پیام بعدی ابهام را صریحاً توضیح میداد و مدل باید کارش را با خواستهی تازه هماهنگ میکرد.
هر دو گفتوگو در پایان دقیقاً اطلاعات یکسانی در اختیار مدل میگذاشتند و تفاوتشان فقط به ترتیب رسیدن اطلاعات برمیگشت. وقتی از همان ابتدا توضیح کامل ارائه میشد، Gemini 2.5 Pro پنجاه درصد وظایف را با موفقیت انجام میداد.
اما وقتی درخواست اولیه کمی مبهم بود و توضیحات تکمیلی را کمی بعد به مدل میدادند، موفقیت به ۴۲٫۸ درصد میرسید . امتیاز Gemini 2.5 Flash نیز از ۵۵٫۴ به ۴۵٫۷ درصد کاهش پیدا کرد. مقصد یکی بود، اما راهی که مدل طی میکرد نتیجه را تغییر میداد.
پژوهشگران ردپای برداشت کنارگذاشته در جواب نهایی را آلودگی به فرضیهی قدیمی نامیدند. این ردپا در ۱۲٫۵ درصد وظایف نویسندگی، ۱۴٫۱ درصد وظایف برنامهریزی و ۲۵٫۶ درصد وظایف کدنویسی دیده میشد.
شاید در یک متن، فرض غلط با عوضکردن چند عبارت از بین برود؛ اما در یک برنامه میتواند به امضای تابع، ساختار داده، وابستگیها یا مسیر اجرای کد راه پیدا کند و دیگر با چند وصلهی موضعی نمیشود همهی این بخشها را یکجا اصلاح کرد.
در کدنویسی، فاصلهی میان پذیرفتن و تغییر واقعی پررنگتر میشد. مدلها در ۹۳٫۵ درصد موارد میگفتند توضیح تازهی کاربر را پذیرفتهاند، اما کدها فقط در ۸۶٫۴ درصد موارد واقعاً اصلاح شد. مدل میتوانست دقیقاً بگوید چه چیزی را اشتباه فهمیده و در همان حال برداشت غلطش را در برنامه حفظ میکرد. عذرخواهیاش هم در سطح کلمات خیلی خوب به نظر میرسید، ولی جواب نهایی کاملاً بازسازی نمیشد.
هوش مصنوعی خیلی زود به اولین برداشتش متعهد میشود و توضیحات بعدی شما را فقط یک پیوست بیاثر میبیند
نویسندگان مقاله این وضعیت را تعهد زودهنگام به یک برداشت مینامند. مدل وقتی با درخواستی مبهم روبهرو میشود، بهجای اینکه چند احتمال را باز نگه دارد، خیلی زود یکی را پیش خودش قطعی میکند. توضیح بعدی کاربر هم مثل اطلاعاتی تکمیلی وارد گفتوگو میشود، نه نشانهای که برداشت اول را باطل کند. درنهایت مدل جواب موجود را وصلهپینه میکند، درحالیکه برای اصلاح واقعی گاهی باید جواب را از صفر تولید کرد.
مطالعهی متا هنوز در مرحلهی پیشانتشار قرار دارد و فقط دو مدل جمنای را تست میکند، پس بهتنهایی نمیشود نتیجهاش را به همهی مدلها تعمیم داد. ولی پژوهشگران دیگری نیز تصمیم گرفتند رفتار مدلها را در لحظهای که برداشت اولیهشان را باوجود اصلاح کاربر در جواب جدید میآورند، بررسی کنند، آنهم در گفتوگوهای طولانیتر.
گروهی از پژوهشگران مایکروسافت و سیلزفورس ریسرچ، بیش از ۲۰۰ هزار گفتوگوی شبیهسازیشده را روی ۱۵ مدل از هشت خانواده اجرا کردند. آنها بهجای اینکه همهی اطلاعات را همان ابتدا در اختیار مدل بگذارند، درخواست را به چند بخش تقسیم کردند و جزئیات لازم را کمکم در طول گفتوگو اضافه کردند، شبیه همان چیزی که در استفادهی واقعی اتفاق میافتد.
در دنیای واقعی هم کاربر همهی جزئیات پروژه، کد یا محاسبه را آماده ندارد و خواستهاش طی چند رفتوبرگشت کاملتر میشود. نتیجهی آزمایشها با عنوان « مدلهای زبانی در گفتوگوهای چندمرحلهای گم میشوند » منتشر شد و از افت متوسط ۳۹ درصدی عملکرد در شش وظیفه خبر میداد.
بخش کوچکی از این افت عملکرد به ضعف توانایی خام مدلها مربوط میشد و بخش بزرگتری به بیثباتیشان برمیگشت. مدلی که مسئلهای را در یک گفتوگو درست حل کرده بود، ممکن بود در اجرای دوبارهی همان گفتوگو راهی کاملاً دیگر برود.
وقتی پژوهشگران جوابها را زیر ذرهبین بردند، به چهار الگوی تکرارشونده رسیدند. مدلها پیش از رسیدن همهی جزئیات سراغ پاسخ کامل میرفتند، بیش از حد به جوابهای قبلی خود تکیه میکردند، تحتتأثیر آخرین پیام کاربر بخشی از اطلاعات میانی گفتوگو را از دست میدادند و معمولاً بیش از اندازه مفصل پاسخ میدادند.
وقتی هوش مصنوعی در یک مکالمه پیچِ اشتباهی را رد کند، دیگر بهسختی میتواند راه برگشت را پیدا کند
پاسخهای زودهنگام و طولانی، فرضهای تازهای وارد تاریخچهی چت میکردند و وقتی کاربر بعداً اطلاعات جدیدی میداد، مدل بهجای کنارگذاشتن کامل آن فرضها، اغلب پاسخش را روی همان چیزی بنا میکرد که چند مرحله قبل خودش ساخته بود.
پایینآوردن «دما» هم چارهی کار نشد. دما میزان تنوع مدل در انتخاب واژههای بعدی را تنظیم میکند و صفرکردنش معمولاً جوابها را قابلپیشبینیتر میکند. بااینحال، بیثباتی در گفتوگوهای چندمرحلهای حدود ۳۰ درصد باقی ماند. تغییری کوچک در چند واژهی اول میتوانست مدل را به راهی بکشاند که خطاهایش در پیامهای بعدی رویهم تلنبار شوند. مدل وقتی یکبار پیچ اشتباه را رد میکرد، بهسختی راه برگشت را مییافت.
دو سال قبل، معیار RefuteBench همین بازگشت به مسیر قبلی را در حوزههای پرسشوپاسخ، ترجمه و نوشتن ایمیل سنجیده بود. کاربر با جواب مدل مخالفت میکرد یا دستور تازهای میداد و پژوهشگران بررسی میکردند که اثر اصلاح تا کجای گفتوگو دوام میآورد.
برخی مدلها اصلاح را اول اجرا میکردند، اما هرچه مکالمه طولانیتر میشد، دوباره به جواب یا ترجیح قبلیشان برمیگشتند. نسخهی دوم این معیار هم نشان داد پذیرفتن یک اصلاح در همان لحظه تضمین نمیکند که در پیامهای بعدی هم سر جایش بماند.
اگر فکر میکنید مشکل فقط از فراموشی مدلها ناشی میشود، کمی صبر کنید. گاهی اصلاح، روشن و صریح، درست در آخرین پیام جلوی چشم مدل قرار دارد و باز هم ردپای فرض قبلی در پاسخ جدید دیده میشود. پس مشکل از حافظهی هوش مصنوعی نیست.
مشکل از جایی شروع میشود که مدل باید برداشت قدیمیاش را کنار بگذارد و مسئله را از نو صورتبندی کند.