دانشمندان نمی توانند استفاده از هوش مصنوعی را متوقف کنند، حتی زمانی که از انجام این کار منع شده باشند
وقتی از دانشمندان خواسته شد مقالات کنفرانسی را بدون استفاده از ابزارهای هوش مصنوعی بررسی کنند، بسیاری از آنها این درخواست را نادیده گرفتند و به هر حال از هوش مصنوعی استفاده کردند.
ابزارهای هوش مصنوعی میانبر وسوسه انگیزی را ارائه می دهند
ممنوع کردن محققان از استفاده از هوش مصنوعی برای ارزیابی شایستگی مقالات علمی تفاوت چندانی با نتایجی که داوران به آن میرسند ندارد – تا حد زیادی به این دلیل که بسیاری از آنها این ممنوعیت را نادیده میگیرند و به هر حال از هوش مصنوعی استفاده میکنند.
تیمی به رهبری دانشمندان کامپیوتر در تحقیقات مایکروسافت، یک آزمایش تصادفی بزرگ را در طول کنفرانس بینالمللی یادگیری ماشینی (ICML)، یکی از بزرگترین کنفرانسهای هوش مصنوعی جهان در سال ۲۰۲۶، که در ماه جولای در سئول، کره جنوبی برگزار شد، انجام دادند.
حدود 24661 مقاله به کنفرانس ارسال شد که نیاز به نظارت 17886 داور داشت. هنگامی که محققان کار خود را ارسال می کردند، می توانستند نحوه بررسی آن را انتخاب کنند. اولین گزینه این بود که با استفاده از یک خطمشی محافظهکارانه که استفاده از مدلهای زبان بزرگ (LLM) را برای کمک به بازبینی کاملا ممنوع میکرد، توسط بازبینان ارزیابی شود.
گزینه دیگر این بود که ارزیابی توسط داوران با استفاده از یک خط مشی مجاز انجام شود که به استفاده از LLM برای کمک به درک مقالات، بررسی آثار مرتبط و صیقل دادن نوشته های خود داوران اجازه می داد، اما نه برای قضاوت در مورد شایستگی مقاله یا پیش نویس بررسی کار.
تیمی که توسط دانشمندان تحقیقاتی مایکروسافت هدایت میشود، دریافتند که مقالاتی که تحت این دو خطمشی بررسی میشوند، دارای نرخ پذیرش تقریبا یکسانی هستند - 27 درصد تحت خطمشی سختگیرانهتر و 26.5 درصد تحت خطمشی مجاز - در حالی که میانگین نمرات بررسی به ترتیب 3.31 و 3.32 از 6 بود. اعتماد داور نیز تقریبا بدون تغییر بود. مرورهایی که تحت خط مشی مجاز نوشته شده بودند حدود 5.5 تا 7 درصد طولانیتر بودند و توسط کارشناسان به عنوان کیفیت کمی بالاتر رتبهبندی شدند، اگرچه مقایسه داور به داور تفاوت معنیداری پیدا نکرد.
دلیل این عدم تفاوت پس از یک نظرسنجی ناشناس از 1486 بازبینانی که در تمرین شرکت کردند، مشخص شد. در آنجا، 22.5 درصد از داورانی که به آنها دستور داده شده بود از هوش مصنوعی استفاده نکنند، به هر حال به استفاده از LLM اعتراف کردند. میرو دودیک از تحقیقات مایکروسافت، که در این مطالعه شرکت داشت و همچنین یکی از سازمان دهندگان کنفرانس بود، میگوید: «عدم انطباق 23 درصدی که توسط خود گزارش میشود قطعا بالاتر از آن چیزی است که من پیشبینی میکردم.
کسانی که از هوش مصنوعی استفاده میکردند، زمانی که به آنها گفته شد این کار را نکنند تا بازخورد، پیشنویس متن بررسی، خواندن مقالات و خلاصه نقاط قوت و ضعف خود را انجام دهند. دودیک میگوید: «نظرسنجی پس از کنفرانس ما دلایلی را نشان میدهد که چرا بازبینها ممکن است در نهایت خطمشی را نقض کنند، مانند حجم کاری زیاد بازبینی و قوانین ناکافی واضح.»
کیوان کوشا از دانشگاه ولورهمپتون بریتانیا میگوید: «این مطالعه نشان میدهد که اجرای ممنوعیت هوش مصنوعی در بررسی همتایان بسیار دشوار است. کوشا می گوید: «به دلیل حجم کاری دانشگاهیان، وسوسه استفاده از هوش مصنوعی وجود دارد.
در بخش جداگانه ای از مطالعه، محققان با استفاده از Pangram، یک آشکارساز متن هوش مصنوعی، بررسی ها را تجزیه و تحلیل کردند. آنها دریافتند که تنها 52.2 درصد از بررسیها تحت سیاست محافظهکارانه بهعنوان کاملا نوشته شده توسط انسان طبقهبندی میشوند، در مقایسه با 37.0 درصد تحت سیاست مجاز - اگرچه محققان هشدار میدهند که آشکارسازهای متنی هوش مصنوعی کامل نیستند.
Sunnie S. Y. Kim در تحقیقات مایکروسافت میگوید: «من معتقدم که کار ما بینشهای مرتبطی برای سایر کنفرانسهای علوم رایانه دارد - و احتمالا مکانهایی در زمینههای دیگر نیز - که با چالشهای مشابهی روبرو هستند.
متن اصلی (انگلیسی)
Scientists can’t stop using AI, even when forbidden from doing so
When scientists were asked to review papers for a conference without using AI tools, many of them ignored the request and used AI anyway