پرش به محتوای اصلی

تحقیقات نشان می دهد که چگونه هوش مصنوعی در امتحانات بهتر می شود: دانشگاه ها چگونه می توانند پاسخ دهند

فیزیک‌ارگ۱۴۰۵ مهر ۸, چهارشنبه، ساعت ۱۷:۳۰حدود 6 دقیقه مطالعه

هنگامی که ChatGPT در پایان سال 2022 وارد شد، دانشگاه‌ها تلاش کردند تا تعیین کنند که آیا هوش مصنوعی مولد برای قبولی در ارزیابی‌ها و تسهیل تقلب برای دانشجویان به اندازه کافی خوب است یا خیر.

آرمین علیمردانی، ملیسا پورتر، وارویک گولت، گفتگو

ویرایش شده توسط Sadie Harley، بررسی توسط Andrew Zinin

این مقاله با توجه به روند و سیاست‌های ویرایشی Science X بررسی شده است. ویراستاران ضمن اطمینان از اعتبار محتوا، ویژگی های زیر را برجسته کرده اند:

هنگامی که ChatGPT در پایان سال 2022 وارد شد، دانشگاه‌ها تلاش کردند تا تعیین کنند که آیا هوش مصنوعی مولد برای قبولی در ارزیابی‌ها و تسهیل تقلب برای دانشجویان به اندازه کافی خوب است یا خیر.

در آن زمان برخی ادعاهای بزرگ توسط شرکت‌های هوش مصنوعی وجود داشت، از جمله اینکه ابزارها «عملکرد در سطح انسانی را در معیارهای مختلف حرفه‌ای و دانشگاهی نشان می‌دادند». سرفصل ها درباره گذراندن امتحانات وکالت در ایالات متحده توسط هوش مصنوعی به خود می بالیدند.

اما شواهد اولیه حاکی از آن بود که هوش مصنوعی مولد همیشه با این تبلیغات سازگار نیست. تحقیقات قبلی ما نشان داد که مدل‌ها در وظایفی که به مهارت ضروری تحلیل قانونی انتقادی نیاز دارند عملکرد ضعیفی داشتند. به عبارت دیگر، مدل‌های هوش مصنوعی برای رقابت با یک دانشجوی حقوق واقعی در تحلیل حقوقی مشکل دارند.

اما همانطور که مدل‌های هوش مصنوعی پیچیده‌تر می‌شوند، می‌خواستیم بدانیم که آیا این هنوز هم درست است یا خیر.

آزمایش ما در سال 2023 هوش مصنوعی مولد را در یک امتحان حقوق کیفری واقعی استرالیا آزمایش کرد. این نشان داد که "هوش مصنوعی مولد به جای انسان در وظایف فکری سخت مانند آزمون حقوق [لیسانس] نزدیک نیست." مطالعه جدید ما دوباره آن آزمایش را مورد بازبینی قرار داد.

این بار، ما نه مدل از پنج ارائه‌دهنده هوش مصنوعی را در دو موضوع حقوقی اجباری در دانشگاه ولونگونگ آزمایش کردیم. اکثر ابزارهای هوش مصنوعی به راحتی از طریق اشتراک در دسترس هستند.

هنگامی که سوالات امتحان نهایی حقوق کیفری و قانون شکنجه دانش آموزان (که به جبران خسارت می پردازد) آماده شد، از هر مدل برای ایجاد پاسخ به همان برگه های امتحانی استفاده کردیم و در مجموع 18 پاسخ تولید کردیم.

مدل‌ها سؤالات و درخواست‌های امتحانی را دریافت کردند، اما هیچ یادداشت سخنرانی، کتاب‌های درسی یا مواد قانونی انتخابی نداشتند. آنها به اینترنت دسترسی داشتند و برخی از آنها دارای ویژگی "استدلال پیشرفته" بودند. این به هوش مصنوعی زمان بیشتری برای برنامه ریزی، در نظر گرفتن رویکردهای مختلف و بررسی استدلال خود قبل از پاسخ دادن می دهد.

شش مقاله از 18 مقاله توسط هماهنگ‌کنندگان موضوع (نویسندگان در اینجا) درجه‌بندی شدند، و 12 مقاله باقی‌مانده در میان مقالات واقعی دانشجویی ترکیب شدند و توسط معلمانی که چیزی در مورد دخالت مدل‌های هوش مصنوعی نمی‌دانستند، به‌صورت کور درجه‌بندی شدند.

در مقایسه با سال 2023، بهبود قابل توجهی بود.

در حقوق کیفری، مقالات هوش مصنوعی به طور متوسط ​​76.3 درصد بوده است که از 82.5 درصد دانشجویان بهتر عمل کرده است. در جرایم جرمی، آنها به طور متوسط ​​66 درصد، عملکرد بهتری از 61 درصد از دانش آموزان داشتند. هفت مقاله از 18 مقاله هوش مصنوعی در یا بالاتر از صدک 90 دانش آموزان رتبه بندی شده اند.

این تغییری نسبت به نتایج سال 2023 در قانون کیفری است، زمانی که مقالات AI به طور متوسط ​​52.5٪ بودند و در حدود صدک 22 کار می کردند.

مهمتر از نمرات، عملکرد مدلها در سناریوهای قانونی فرضی بود که یکی از اجزای ارزیابی کلی بود.

در سال 2023، مدل‌های هوش مصنوعی در تحلیل انتقادی این سناریوها ضعف آشکاری را نشان دادند.

در مطالعه جدید ما، تا حد زیادی ناپدید شد. در حقوق کیفری، هوش مصنوعی با میانگین 76 درصد در مقایسه با 59.6 درصد برای دانشجویان، بسیار بهتر عمل کرد. در شکنجه‌ها، مدل‌های هوش مصنوعی و دانش‌آموزان تقریبا در یک سطح بودند، در حالی که مدل‌های هوش مصنوعی در سؤال مقاله به طرز چشمگیری بهتر عمل کردند.

به طور کلی، این مطالعه نشان می‌دهد که مدل‌های هوش مصنوعی به اندازه‌ای توانمند شده‌اند که دانش‌آموزان می‌توانند از آنها برای تقلب استفاده کنند و یکپارچگی نتایج ارزیابی‌های بدون نظارت را زیر سوال می‌برد.

با این حال، این بدان معنا نیست که هوش مصنوعی به یک متخصص حقوقی قابل اعتماد تبدیل شده است.

عملکرد در مطالعه ما به طور قابل ملاحظه ای بین مدل ها و افراد متفاوت بود. در واقع، ما متوجه شدیم که مدل‌های هوش مصنوعی دارای قابلیت‌های ناهموار هستند. برخی از مدل ها در یک موضوع عالی و در مورد دیگر ضعیف بودند.

تحلیل قوی می تواند در کنار استنادهای ضعیف، انتخاب منبع ضعیف یا مقامات ساختگی قرار گیرد. برای برخی از مدل‌ها، ما میزان کمتری از توهم را شناسایی کردیم. با این حال، متوجه شدیم که آنها منابع کمتری را نیز ذکر کردند.

ما فقط دو موضوع حقوق را در یک دانشگاه استرالیا با استفاده از 18 مقاله تولید شده توسط هوش مصنوعی آزمایش کردیم. نتایج ممکن است در سایر موضوعات حقوقی (مثلا قراردادها) یا سایر رشته ها متفاوت باشد.

تلقین نیز مهم است. ما سعی کردیم اعلان‌ها را استاندارد کنیم، اما مجبور شدیم تغییراتی ایجاد کنیم تا پاسخ‌ها در طولانی‌مدت واقع‌بینانه باشند.

علاوه بر این، این مطالعه ارزیابی نکرد که آیا عملکرد مدل‌ها در درخواست‌ها، نسخه‌ها یا قالب‌های ارزیابی مختلف ثابت می‌ماند یا خیر.

مهمتر از همه، علیرغم تمام دستورالعمل های ارائه شده به معلمان، نمره دادن به مقالات امتحانی تحت تأثیر قضاوت های ذهنی قرار می گیرد.

بازار کار امروزی فارغ التحصیلان را ملزم می کند که مسئولانه و موثر با هوش مصنوعی کار کنند. اما دانش‌آموزان هنوز به دانش و مهارت‌های پایه کافی برای تشخیص خطاها، تیز کردن نقاط ضعف و بهبود خروجی آن نیاز دارند. اگر نتوانند ارزشی فراتر از آنچه که هوش مصنوعی به تنهایی تولید می کند بیافزایند، کارشان ممکن است قابل تعویض باشد.

هیچ قالب ارزیابی واحدی نمی تواند به هر دو هدف دست یابد. ما سه رویکرد مکمل را پیشنهاد می کنیم.

اول، برخی ارزیابی‌ها باید بدون هوش مصنوعی باقی بماند و شخصا تحت نظارت باشد. این به معنای امتحانات در محوطه دانشگاه، ارزیابی شفاهی یا حل مسئله با نظارت است. این تضمین می کند که دانش آموزان به اندازه کافی دانش مستقل و توانایی استدلال برای تشخیص اشتباه بودن هوش مصنوعی دارند. به عنوان مثال، در قانون سال اول، ما پیشنهاد می کنیم که این وظایف باید بخش عمده ارزیابی را تشکیل دهند.

دوم، برخی ارزیابی‌ها باید عمدا نیاز به همکاری با هوش مصنوعی داشته باشند. اما دانشگاه ها باید فرآیند را ارزیابی کنند، نه فقط محصول نهایی صیقلی را. این بدان معناست که ما باید توانایی دانش‌آموزان را برای همکاری با مدل‌های هوش مصنوعی ارزیابی کنیم: چه چیزی از آنها خواسته شد، چه منابعی را بررسی کردند، چه خطاهایی را شناسایی کردند، چه چیزی را پذیرفتند یا رد کردند و چگونه استدلال را بهبود بخشیدند.

سوم، دانشگاه‌ها می‌توانند از مدل «رله» استفاده کنند که منعکس‌کننده عملکرد حرفه‌ای است. این رویکرد دارای دو نسخه است و هر کدام دارای دو مرحله است.

در نسخه اول انسان، دانش آموزان پیش نویسی را در محیطی تحت نظارت ارسال می کنند و سپس با هوش مصنوعی برای اصلاح و ارسال مجدد آن همکاری می کنند.

در نسخه اول هوش مصنوعی، دانش آموزان با هوش مصنوعی همکاری می کنند و پیش نویس خود را ارسال می کنند. سپس آنها باید از دانش و تحلیل انتقادی خود در یک محیط نظارت شده برای نقد، تأیید و بهبود آن بدون دسترسی به هوش مصنوعی استفاده کنند و کار خود را دوباره ارسال کنند.

نمره دهندگان باید هر ارسالی را جداگانه درجه بندی کنند. این هم دانش و مهارت های حقوقی دانش آموزان و هم توانایی آنها را برای همکاری با هوش مصنوعی ارزیابی می کند.

هدف این نیست که وانمود کنیم که دانش‌آموزان را می‌توان به طور نامحدود از هوش مصنوعی دور نگه داشت، و نه اینکه یادگیری را به فناوری برون سپاری کرد. دانشگاه‌ها به ارزیابی‌هایی نیاز دارند که همچنان نشان دهد که دانش‌آموزان می‌توانند به طور مستقل چه کاری انجام دهند، و در عین حال به آنها آموزش می‌دهد که چگونه بر سیستم‌های هوش مصنوعی با قابلیت‌های روزافزون نظارت کنند، به چالش بکشند و بهبود بخشند.

آرمین علیمردانی و همکاران، ذهن حقوقی در مقابل. شبکه های عصبی: دانشکده های حقوق باید با پیشرفت روزافزون هوش مصنوعی در استدلال حقوقی، قانون، فناوری و انسان ها مقابله کنند (2026). DOI: 10.5204/lthj.4896

کارشناسی علوم زیستی و اکولوژی. پیشینه آزمایشگاه میکروبیولوژی با تجربه اخبار دارویی در صنایع نفت، گاز و تجدیدپذیر. نمایه کامل →

فوق لیسانس فیزیک با تجربه تحقیق. علاقه مندان به اخبار علمی طولانی مدت. نقش کلیدی در موفقیت سرمقاله Science X ایفا می کند. نمایه کامل →

این مقاله از The Conversation تحت مجوز Creative Commons بازنشر شده است. مقاله اصلی را بخوانید.

خواندن متن کامل در فیزیک‌ارگبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Research shows how AI is getting better at exams: How universities can respond

When ChatGPT arrived at the end of 2022, universities scrambled to determine whether generative AI was good enough to pass assessments and make it easy for students to cheat.

همه‌ی اخبار علم