تحقیقات نشان می دهد که چگونه هوش مصنوعی در امتحانات بهتر می شود: دانشگاه ها چگونه می توانند پاسخ دهند
هنگامی که ChatGPT در پایان سال 2022 وارد شد، دانشگاهها تلاش کردند تا تعیین کنند که آیا هوش مصنوعی مولد برای قبولی در ارزیابیها و تسهیل تقلب برای دانشجویان به اندازه کافی خوب است یا خیر.
آرمین علیمردانی، ملیسا پورتر، وارویک گولت، گفتگو
ویرایش شده توسط Sadie Harley، بررسی توسط Andrew Zinin
این مقاله با توجه به روند و سیاستهای ویرایشی Science X بررسی شده است. ویراستاران ضمن اطمینان از اعتبار محتوا، ویژگی های زیر را برجسته کرده اند:
هنگامی که ChatGPT در پایان سال 2022 وارد شد، دانشگاهها تلاش کردند تا تعیین کنند که آیا هوش مصنوعی مولد برای قبولی در ارزیابیها و تسهیل تقلب برای دانشجویان به اندازه کافی خوب است یا خیر.
در آن زمان برخی ادعاهای بزرگ توسط شرکتهای هوش مصنوعی وجود داشت، از جمله اینکه ابزارها «عملکرد در سطح انسانی را در معیارهای مختلف حرفهای و دانشگاهی نشان میدادند». سرفصل ها درباره گذراندن امتحانات وکالت در ایالات متحده توسط هوش مصنوعی به خود می بالیدند.
اما شواهد اولیه حاکی از آن بود که هوش مصنوعی مولد همیشه با این تبلیغات سازگار نیست. تحقیقات قبلی ما نشان داد که مدلها در وظایفی که به مهارت ضروری تحلیل قانونی انتقادی نیاز دارند عملکرد ضعیفی داشتند. به عبارت دیگر، مدلهای هوش مصنوعی برای رقابت با یک دانشجوی حقوق واقعی در تحلیل حقوقی مشکل دارند.
اما همانطور که مدلهای هوش مصنوعی پیچیدهتر میشوند، میخواستیم بدانیم که آیا این هنوز هم درست است یا خیر.
آزمایش ما در سال 2023 هوش مصنوعی مولد را در یک امتحان حقوق کیفری واقعی استرالیا آزمایش کرد. این نشان داد که "هوش مصنوعی مولد به جای انسان در وظایف فکری سخت مانند آزمون حقوق [لیسانس] نزدیک نیست." مطالعه جدید ما دوباره آن آزمایش را مورد بازبینی قرار داد.
این بار، ما نه مدل از پنج ارائهدهنده هوش مصنوعی را در دو موضوع حقوقی اجباری در دانشگاه ولونگونگ آزمایش کردیم. اکثر ابزارهای هوش مصنوعی به راحتی از طریق اشتراک در دسترس هستند.
هنگامی که سوالات امتحان نهایی حقوق کیفری و قانون شکنجه دانش آموزان (که به جبران خسارت می پردازد) آماده شد، از هر مدل برای ایجاد پاسخ به همان برگه های امتحانی استفاده کردیم و در مجموع 18 پاسخ تولید کردیم.
مدلها سؤالات و درخواستهای امتحانی را دریافت کردند، اما هیچ یادداشت سخنرانی، کتابهای درسی یا مواد قانونی انتخابی نداشتند. آنها به اینترنت دسترسی داشتند و برخی از آنها دارای ویژگی "استدلال پیشرفته" بودند. این به هوش مصنوعی زمان بیشتری برای برنامه ریزی، در نظر گرفتن رویکردهای مختلف و بررسی استدلال خود قبل از پاسخ دادن می دهد.
شش مقاله از 18 مقاله توسط هماهنگکنندگان موضوع (نویسندگان در اینجا) درجهبندی شدند، و 12 مقاله باقیمانده در میان مقالات واقعی دانشجویی ترکیب شدند و توسط معلمانی که چیزی در مورد دخالت مدلهای هوش مصنوعی نمیدانستند، بهصورت کور درجهبندی شدند.
در مقایسه با سال 2023، بهبود قابل توجهی بود.
در حقوق کیفری، مقالات هوش مصنوعی به طور متوسط 76.3 درصد بوده است که از 82.5 درصد دانشجویان بهتر عمل کرده است. در جرایم جرمی، آنها به طور متوسط 66 درصد، عملکرد بهتری از 61 درصد از دانش آموزان داشتند. هفت مقاله از 18 مقاله هوش مصنوعی در یا بالاتر از صدک 90 دانش آموزان رتبه بندی شده اند.
این تغییری نسبت به نتایج سال 2023 در قانون کیفری است، زمانی که مقالات AI به طور متوسط 52.5٪ بودند و در حدود صدک 22 کار می کردند.
مهمتر از نمرات، عملکرد مدلها در سناریوهای قانونی فرضی بود که یکی از اجزای ارزیابی کلی بود.
در سال 2023، مدلهای هوش مصنوعی در تحلیل انتقادی این سناریوها ضعف آشکاری را نشان دادند.
در مطالعه جدید ما، تا حد زیادی ناپدید شد. در حقوق کیفری، هوش مصنوعی با میانگین 76 درصد در مقایسه با 59.6 درصد برای دانشجویان، بسیار بهتر عمل کرد. در شکنجهها، مدلهای هوش مصنوعی و دانشآموزان تقریبا در یک سطح بودند، در حالی که مدلهای هوش مصنوعی در سؤال مقاله به طرز چشمگیری بهتر عمل کردند.
به طور کلی، این مطالعه نشان میدهد که مدلهای هوش مصنوعی به اندازهای توانمند شدهاند که دانشآموزان میتوانند از آنها برای تقلب استفاده کنند و یکپارچگی نتایج ارزیابیهای بدون نظارت را زیر سوال میبرد.
با این حال، این بدان معنا نیست که هوش مصنوعی به یک متخصص حقوقی قابل اعتماد تبدیل شده است.
عملکرد در مطالعه ما به طور قابل ملاحظه ای بین مدل ها و افراد متفاوت بود. در واقع، ما متوجه شدیم که مدلهای هوش مصنوعی دارای قابلیتهای ناهموار هستند. برخی از مدل ها در یک موضوع عالی و در مورد دیگر ضعیف بودند.
تحلیل قوی می تواند در کنار استنادهای ضعیف، انتخاب منبع ضعیف یا مقامات ساختگی قرار گیرد. برای برخی از مدلها، ما میزان کمتری از توهم را شناسایی کردیم. با این حال، متوجه شدیم که آنها منابع کمتری را نیز ذکر کردند.
ما فقط دو موضوع حقوق را در یک دانشگاه استرالیا با استفاده از 18 مقاله تولید شده توسط هوش مصنوعی آزمایش کردیم. نتایج ممکن است در سایر موضوعات حقوقی (مثلا قراردادها) یا سایر رشته ها متفاوت باشد.
تلقین نیز مهم است. ما سعی کردیم اعلانها را استاندارد کنیم، اما مجبور شدیم تغییراتی ایجاد کنیم تا پاسخها در طولانیمدت واقعبینانه باشند.
علاوه بر این، این مطالعه ارزیابی نکرد که آیا عملکرد مدلها در درخواستها، نسخهها یا قالبهای ارزیابی مختلف ثابت میماند یا خیر.
مهمتر از همه، علیرغم تمام دستورالعمل های ارائه شده به معلمان، نمره دادن به مقالات امتحانی تحت تأثیر قضاوت های ذهنی قرار می گیرد.
بازار کار امروزی فارغ التحصیلان را ملزم می کند که مسئولانه و موثر با هوش مصنوعی کار کنند. اما دانشآموزان هنوز به دانش و مهارتهای پایه کافی برای تشخیص خطاها، تیز کردن نقاط ضعف و بهبود خروجی آن نیاز دارند. اگر نتوانند ارزشی فراتر از آنچه که هوش مصنوعی به تنهایی تولید می کند بیافزایند، کارشان ممکن است قابل تعویض باشد.
هیچ قالب ارزیابی واحدی نمی تواند به هر دو هدف دست یابد. ما سه رویکرد مکمل را پیشنهاد می کنیم.
اول، برخی ارزیابیها باید بدون هوش مصنوعی باقی بماند و شخصا تحت نظارت باشد. این به معنای امتحانات در محوطه دانشگاه، ارزیابی شفاهی یا حل مسئله با نظارت است. این تضمین می کند که دانش آموزان به اندازه کافی دانش مستقل و توانایی استدلال برای تشخیص اشتباه بودن هوش مصنوعی دارند. به عنوان مثال، در قانون سال اول، ما پیشنهاد می کنیم که این وظایف باید بخش عمده ارزیابی را تشکیل دهند.
دوم، برخی ارزیابیها باید عمدا نیاز به همکاری با هوش مصنوعی داشته باشند. اما دانشگاه ها باید فرآیند را ارزیابی کنند، نه فقط محصول نهایی صیقلی را. این بدان معناست که ما باید توانایی دانشآموزان را برای همکاری با مدلهای هوش مصنوعی ارزیابی کنیم: چه چیزی از آنها خواسته شد، چه منابعی را بررسی کردند، چه خطاهایی را شناسایی کردند، چه چیزی را پذیرفتند یا رد کردند و چگونه استدلال را بهبود بخشیدند.
سوم، دانشگاهها میتوانند از مدل «رله» استفاده کنند که منعکسکننده عملکرد حرفهای است. این رویکرد دارای دو نسخه است و هر کدام دارای دو مرحله است.
در نسخه اول انسان، دانش آموزان پیش نویسی را در محیطی تحت نظارت ارسال می کنند و سپس با هوش مصنوعی برای اصلاح و ارسال مجدد آن همکاری می کنند.
در نسخه اول هوش مصنوعی، دانش آموزان با هوش مصنوعی همکاری می کنند و پیش نویس خود را ارسال می کنند. سپس آنها باید از دانش و تحلیل انتقادی خود در یک محیط نظارت شده برای نقد، تأیید و بهبود آن بدون دسترسی به هوش مصنوعی استفاده کنند و کار خود را دوباره ارسال کنند.
نمره دهندگان باید هر ارسالی را جداگانه درجه بندی کنند. این هم دانش و مهارت های حقوقی دانش آموزان و هم توانایی آنها را برای همکاری با هوش مصنوعی ارزیابی می کند.
هدف این نیست که وانمود کنیم که دانشآموزان را میتوان به طور نامحدود از هوش مصنوعی دور نگه داشت، و نه اینکه یادگیری را به فناوری برون سپاری کرد. دانشگاهها به ارزیابیهایی نیاز دارند که همچنان نشان دهد که دانشآموزان میتوانند به طور مستقل چه کاری انجام دهند، و در عین حال به آنها آموزش میدهد که چگونه بر سیستمهای هوش مصنوعی با قابلیتهای روزافزون نظارت کنند، به چالش بکشند و بهبود بخشند.
آرمین علیمردانی و همکاران، ذهن حقوقی در مقابل. شبکه های عصبی: دانشکده های حقوق باید با پیشرفت روزافزون هوش مصنوعی در استدلال حقوقی، قانون، فناوری و انسان ها مقابله کنند (2026). DOI: 10.5204/lthj.4896
کارشناسی علوم زیستی و اکولوژی. پیشینه آزمایشگاه میکروبیولوژی با تجربه اخبار دارویی در صنایع نفت، گاز و تجدیدپذیر. نمایه کامل →
فوق لیسانس فیزیک با تجربه تحقیق. علاقه مندان به اخبار علمی طولانی مدت. نقش کلیدی در موفقیت سرمقاله Science X ایفا می کند. نمایه کامل →
این مقاله از The Conversation تحت مجوز Creative Commons بازنشر شده است. مقاله اصلی را بخوانید.
متن اصلی (انگلیسی)
Research shows how AI is getting better at exams: How universities can respond
When ChatGPT arrived at the end of 2022, universities scrambled to determine whether generative AI was good enough to pass assessments and make it easy for students to cheat.