آیا OpenAI بزرگترین سرقت IP تمام دوران را انجام داد؟
اسناد دادگاهی که اخیرا مهر و موم نشده است نشان می دهد که مدیران مایکروسافت و OpenAI درگیر این هستند که آیا سیستم های هوش مصنوعی آنها بر اساس محتوای دزدیده شده از ناشران ساخته شده است یا خیر.
ضبط های VCR دیجیتالی شدن کتاب استفاده از کدهای موجود برای ساخت یک سیستم عامل جدید.
قانونی بودن برخی از مهمترین فناوریها و محصولات در قرن گذشته به یک سوال منحصر به فرد رسیده است: آیا تحت استفاده منصفانه، دکترین قانونی که اجازه استفاده از آثار دارای حق چاپ را بدون مجوز میدهد، از آنها محافظت میشود؟
اکنون، این سوال به میدان اصلی نبرد در دعاوی مهم بین ناشران، استودیوها و شرکت های ضبط علیه شرکت های هوش مصنوعی بر سر مدل های زبان بزرگ تبدیل شده است. در آینده نزدیک، این پلتفرمها به عنوان دروازهای به اینترنت - و اطلاعات - برای میلیاردها نفر در سراسر جهان قرار خواهند گرفت. داستانهای مرتبط بنیانگذار هوش مصنوعی Business Gen: ابزارها جایگزین تولید فیلم زنده نمیشوند - با این حال دفترچه گزارشگر یک "مصاحبه" با تیلی نوروود نشان میدهد که پوچ و غمانگیز است
اگر از این شرکتهای هوش مصنوعی بپرسید، خواهند گفت که سس مخفی فناوری آنها نوآوری بوده است. نیویورک تایمز و یازده ناشر دیگر که از مایکروسافت و OpenAI به دلیل استفاده از مقالات آنها برای آموزش سیستم های هوش مصنوعی شکایت می کنند پاسخ متفاوتی دارند: سرقت.
در یک سند داخلی مایکروسافت در سال 2023 آمده است: «میلیونها نفر در سراسر جهان به زودی مدلهای بزرگ را که تمام کارشان را «هواپیمکننده» میکنند، دزدی حیرتانگیز با ابعاد بیسابقه میدانند.
این پیام روز پنجشنبه در اسناد دادگاهی که به تازگی مهر و موم نشده است، آشکار شد که جزئیات نگرانی اساسی مایکروسافت و OpenAI در مورد روشهایی که آنها سیستمهای هوش مصنوعی خود را با هزینه ناشران توسعه میدهند، آشکار شد. آنها شاید آشکارترین نشانهای را ارائه میکنند که نشان میدهد مدیران شرکتها میدانستند که ممکن است در هنگام توسعه فناوری خود با قوانین مالکیت معنوی مخالفت کرده باشند.
برنت هشت، مدیر علوم کاربردی مایکروسافت، هضم آثار دارای حق چاپ را "یک سرقت حیرتانگیز با ابعاد بیسابقه" و به طور بالقوه "بزرگترین سرقت نیروی کار در تاریخ بشر" توصیف میکند.
در این مرحله از دعوا، OpenAI و مایکروسافت بار اثبات این که رفتار آنها به منزله استفاده منصفانه است، بر عهده دارند، که تست تعادل چهار عاملی را روشن می کند. اولین شاخه می پرسد که مطالب دارای حق چاپ برای چه چیزی مورد استفاده قرار گرفته است، از جمله اینکه آیا استفاده تجاری بوده است و اینکه آیا مطالب را برای هدف جدیدی تغییر داده است یا خیر.
در اینجا، قضاوت قبلی دیوان عالی مبنی بر اینکه "انگیزه گریزان" و نقض استانداردهای اخلاقی صنعت، دفاع از استفاده منصفانه را تضعیف می کند، می تواند وارد عمل شود. تبادل نظر بین یک مهندس OpenAI و رئیس جمهور گرگ براکمن را در نظر بگیرید، زمانی که شرکت در حال بررسی راه هایی برای خراش دادن سایت بود، به او گفته شد که "هک برای دور زدن [] nytimes paywall" وجود دارد.
پاسخ نشان می دهد که یک مدیر اجرایی روش فنی برای دور زدن محدودیت دسترسی ناشر را می دانسته و آن را در شرکت به کار گرفته است. ناشران استدلال میکنند که این بخشی از رفتار گستردهتر است که در آن به کارکنان دستور داده شد تا استراتژیهایی را برای دور زدن دیوارهای پرداخت «بدون شناسایی» طراحی کنند.
در مقابل تبادل براکمن با شهادت ساتیا نادلا، مدیر عامل مایکروسافت، که اظهار داشت «هر چیزی که دارای دیوار پرداخت است باید توسط هر کسی که میخواهد از آن استفاده کند مجوز داشته باشد» مقایسه کنید. اگر به او اطلاع داده می شد که OpenAI محتوای محدود شده را حذف کرده و آموزش داده است، او اضافه کرد که از حق مایکروسافت برای ملزم کردن شرکت تحت رهبری سام آلتمن به آموزش مجدد مدل هایش "استناد" می کرد.
یکی دیگر از نقاط کانونی اصلی در این پرونده، عامل چهارم دکترین استفاده منصفانه، تأثیر استفاده بر بازار بالقوه یا ارزش اثر دارای حق چاپ است. ناشران استدلال کرده اند که چت بات ها بازار روزنامه نگاری خبری اصلی را تضعیف می کنند. نکته اصلی شکایت تایمز این است که سیستمهای هوش مصنوعی وقتی از آنها خواسته میشود تقریبا گزیدهای از مقالهها را به طور کلمه باز میگردانند. ناشر گفته است که این پاسخها بسیار فراتر از تکههای متنی است که معمولا با نتایج جستجوی معمولی نشان داده میشود.
یک مثال: بینگ چت به جز دو کلمه از 396 کلمه اول مقاله سال 2023 خود «اسرارهایی که حماس درباره ارتش اسرائیل می دانست» را کپی کرد. یک نمایشگاه 100 موقعیت دیگر را نشان میدهد که در آنها GPT OpenAI بر روی مقالات تایمز آموزش دیده و با کپی کلمه به کلمه آنها را حفظ کرده است.
نیک تورلی، رئیس ChatGPT OpenAI، در پرونده روز پنجشنبه گفت: «محصولات ما تا حد زیادی جایگزین هستند.
از زمان ظهور هوش مصنوعی مولد، ناشران شاهد نرخ کلیک بسیار پایینتری بودهاند. داده های داخلی مایکروسافت نشان می دهد که تایمز به طور قابل توجهی کلیک های کمتری را هنگام جستجوی کاربران از طریق چت بینگ به جای جستجوی سنتی وب دریافت کرده است و نرخ ها 87٪ به 93٪ کاهش یافته است.
همچنین در این جبهه نقش دارد: استدلال ناشران مبنی بر اینکه فرصتهای مجوز موجود و آینده با استفاده از مطالب دارای حق چاپ آنها بدون پرداخت هزینه تضعیف میشود. ناشران استدلال کردهاند که مایکروسافت و OpenAI نمیتوانند به طور قابل اعتمادی ادعا کنند که هیچ بازار مجوزی برای محتوای آنها وجود ندارد، وقتی با ناشران دیگر معامله میکنند.
بر اساس این پرونده، Hecht گفت که OpenAI و مایکروسافت در دفاع از حق نسخهبرداری خود، «ایده استفاده منصفانه را به تمسخر میگیرند».
متن اصلی (انگلیسی)
Did OpenAI Pull Off the Biggest IP Heist of All-Time?
Newly unsealed court documents show Microsoft and OpenAI executives grappling with whether their AI systems were built on content stolen from publishers.