مشکل محتوای بزرگ هوش مصنوعی: کار را بردارید، پول را نگه دارید
هرچه بیشتر در مورد نحوه تجارت هوش مصنوعی بیاموزیم، ناعادلانه تر به نظر می رسد
هوش مصنوعی بزرگ یک مشکل دارد. شرکتهای آن باید کارهای دیگران را جذب کنند. میدانید، کتابها، داستانهای خبری، عکسها، کدها، وبسایتها، آن یک الگوی رفتاری اصلی که با آن ساختهاید، و عملا هر چیز دیگری در اینترنت برای آموزش مدلهای زبان بزرگ آن (LLM) وجود دارد. همه ما این را می دانیم. همچنین می دانیم که شرکت های هوش مصنوعی از پرداخت هزینه برای هر یک از آن، اطاعت از مجوزهای مرتبط با آن، یا خدای ناکرده از تقسیم درآمدشان با شرکت ها و افرادی که در وهله اول کار را ایجاد کرده اند، متنفرند.
اخیرا روش پیشفرض هوش مصنوعی بزرگ برای انجام کسبوکار: «حالا آن را بگیرید، بعدا در مورد قانونی بودن بحث کنید» بیش از هر زمان دیگری در چهره شما ظاهر شده است. به عنوان مثال، به مبارزه حق چاپ بین نیویورک تایمز و OpenAI و مایکروسافت نگاه کنید. طبق گزارش 404 Media در مورد اسناد دادگاهی که اخیرا مهر و موم نشده است - دلایل شاکیان که دادگاه هنوز درباره آنها حکمی صادر نکرده است - ظاهرا مایکروسافت می دانسته است که چه کاری انجام می دهد که خواه ناخواه اینترنت را وارد می کند. مدیر علوم کاربردی مایکروسافت، دکتر.
به نقل از برنت هشت، در خلاصه 92 صفحه ای شاکیان خبری آمده است: پرونده مربوط به "یک سرقت حیرت انگیز با ابعاد بی سابقه" است. او در خلاصه قضاوت وکلای روزنامهنگاران [PDF] گفته است که احتمالا «بزرگترین سرقت نیروی کار در تاریخ بشریت» بود. از طرف یکی از کارکنان ارشد مایکروسافت بود. Hecht تنها کسی در مایکروسافت نبود که نظر داد.
در یک سند سیاست داخلی مایکروسافت که در مقالات دادگاه نیز نقل شده است، نویسندگان اذعان کردهاند که هوش مصنوعی مولد میتواند «بهطور قابلتوجهی در استخدام افرادی که دادههایی را تولید میکنند که مدل پایه آموزش داده شده است، مختل کند [زیرا] LLMها محصولی هستند که زنجیره تأمین آن را از بین میبرند». این به نوبه خود منجر به فروپاشی مدل می شود. از قضا، هوش مصنوعی غاز سازنده محتوا را که تخمهای طلای محتوای ارزشمند میگذارد، میکشد. قاضی سیدنی اچ استاین از دادگاه منطقه ای ایالات متحده برای ناحیه جنوبی نیویورک هنوز تصمیمی در مورد این پرونده صادر نکرده است.
OpenAI و مایکروسافت فعالانه ادعاهای شاکیان را تحت دفاع "استفاده منصفانه" به چالش می کشند. آنها معتقدند که استفاده از مقالات و کتابهای عمومی برای آموزش مدلهای زبانی بزرگ به پیشبرد دانش عمومی کمک میکند و به عنوان یک «جایگزین غیرقانونی بازار اقتصادی» عمل نمیکند. اما اظهاراتی که اسناد به آنها اشاره می کند واقعی است. هوش مصنوعی بزرگ می داند که به محتوا نیاز دارد. برخی از شرکتهای مربوطه به این موضوع توجهی ندارند. پول در حال حاضر، نگران بعدا شعار آنها است.
کسانی که میتوانند به اعداد درآمدی نگاه کنند، به خوبی میدانند که درگیر چیزی هستند که خود مایکروسافت آن را «حلقه عذاب» استراتژی محتوای هوش مصنوعی در آن اسناد دادگاه بدون مهر و موم مینامد. آیا این مانع آنها می شود؟ نه با توجه به پرونده [PDF]، که به شهادت سوگند سپرده نماینده شرکت خود OpenAI اشاره می کند، همچنین گواهی می دهد که LLM های آن خوشحال هستند که کارهای دیگران را حتی زمانی که یک paywall به طور اسمی از آن محافظت می کند، خلاء می کنند.
به نقل از نماینده آن، آنها از "هر گونه تلاش برای شناسایی محتوای paywall در مجموعه داده های آموزشی" یا "برای حذف محتوای paywall از مجموعه داده های آموزشی خود بی اطلاع بودند." هنگامی که به گرگ براکمن، بنیانگذار OpenAI گفته شد که OpenAI می تواند راه خود را از طریق فایروال هک کند، او پاسخ داد: "آه، خوب است." صرف نظر از اینکه این عبارات منعکس کننده یک نگرش گسترده تر هستند یا نه، نگرش های مشابهی در بین هوش مصنوعی بزرگ حاکم است.
چنین سیاست هایی در نهایت می تواند بازگردد و سازندگان LLM را نیش بزند. این در حال حاضر بازار روزنامه نگاری، داستان نویسی، خلق آثار گرافیکی، و هر چیزی را که در واقع از انسان ها برای تولید آثار اصلی می طلبد، تحت تاثیر قرار داده است. اما هوش مصنوعی بزرگ نمیخواهد برای آن هزینه بپردازد. این یک عارضه جانبی نیست. این مدل کسب و کار است. جو کاربر نمی توانست اهمیتی بدهد. آنها فقط یک پاسخ سریع می خواهند که درست به نظر برسد. برخی از آنها نمی توانستند به دریافت پاسخ های درست اهمیت دهند. در مورد جستجوی عمیق تر برای اینکه ببینید آیا اطلاعاتی که آنها به دست می آورند صحیح است یا خیر، آن را فراموش کنید!
همانطور که یک مهندس نرم افزار OpenAI می گوید: "هرچقدر هم که لینک ها را برجسته نشان دهیم، کاربران کلیک نمی کنند." خب کلیک میکنم این دلیل بزرگی است که چرا Perplexity هوش مصنوعی انتخابی من است. اینطور نیست که جواب مطمئن تری بدهد. نه، این به این دلیل است که برخلاف اکثر LLM ها، Perplexity منابع و پیوندها را ارائه می دهد، و من قبل از پذیرش آنچه به من می گوید آنها را بررسی می کنم. اما پس از آن من روزنامه نگاری هستم که مدارک تحصیلی اش در تاریخ است، جایی که استادانم به من گفتند که شما همیشه - همیشه - به منابع اولیه نگاه کنید. هوش مصنوعی بزرگ نیز همین رویکرد را با تولیدکنندگان کد خود اتخاذ می کند.
Ninth Circuit ایالات متحده اخیرا GitHub، Microsoft و OpenAI را در شکایت Doe v. دادگاه حکم داد که شاکیان بر اساس یک ماده خاص از قانون حق نسخهبرداری هزاره دیجیتال (DMCA) که مربوط به حذف یا تغییر اطلاعات مدیریت حق نسخهبرداری (CMI) است، ادعایی نداشتهاند. به طور خلاصه، دادگاه گفت که تولید کد جدید بدون گنجاندن CMI لزوما مشابه حذف یا تغییر اطلاعات حق چاپ از یک اثر موجود نیست.
قاضی اریک میلر نوشت: «کسی که اثر جدیدی خلق میکند و CMI را شامل نمیشود، نمیتوان گفت که چیزی را «حذف» یا «تغییر» کرده است.» این حکم ثابت نمی کند که GitHub Copilot یا هر مدل کدنویسی دیگری ممکن است بدون محدودیت در هر پروژه منبع باز آموزش ببیند. مشخص نکرد که کپی کد منبع در یک مجموعه آموزشی همیشه استفاده منصفانه است. تصمیم نگرفت که کد تولید شده نمی تواند حق چاپ را نقض کند. و مطمئنا GPL، Apache، BSD، MIT یا هر مجوز منبع باز دیگری را لغو نکرد.
به هر حال، متن باز مترادف این نیست که «هر کاری که می خواهید با آن انجام دهید» نیست. زمانی که هوش مصنوعی به کدهای منبع باز دست پیدا می کند، به نظر می رسد که اینطور باشد. این مشکل کدهای تولید شده توسط هوش مصنوعی است. برنامه نویسی که یک پیشنهاد Copilot دریافت می کند بسیار بعید است که بررسی کند که آیا GPL کد را پوشش می دهد یا آیا آپاچی قطعه از یک کتابخانه را پوشش می دهد. مطمئنا توسعهدهنده نمیتواند تشخیص دهد که کدام شرایط مجوز ممکن است برای کدی که به تازگی از Opus 5.5 یا GPT 6 ظاهر شده است اعمال شود.
همانطور که مردی از OpenAI گفت، مردم روی پیوندها کلیک نمی کنند، و در خطوط لوله برنامه نویسی با هوش مصنوعی، آنها حتی لینک ها را ندارند. یکی از دوستان وکیل منبع باز من نگرانی بزرگتر از این تصمیم محدود دارد. او به من گفت که آنچه به او میدهد "مکث روند گستردهتری است. موارد متعددی وجود دارد که در آن طرفها مجوزهای منبع باز را بهعنوان قرارداد و نه به عنوان مجوزهای IP/حق نسخهبرداری که برای آنها نوشته شده بود، مطرح میکنند. تئوریهای قرارداد به شاکی اجازه میدهد تا از سوالاتی که حق نسخهبرداری شما را مجبور به پاسخگویی میکند، چشم پوشی کند.
آیا شما صاحب کار هستید؟ آیا بیان قابل محافظت است؟ آیا واقعا کپی شده است؟» وی افزود: «این سؤالات مبنایی است که مجوزها بر آن ساخته می شود. مجوزهای منبع باز اعطای مجوز برای استفاده از مالکیت معنوی افراد هستند. اگر پرونده ای نمی تواند نشان دهد که مالکیت معنوی متعلق به یا نقض شده است، منصفانه است که بپرسیم آیا اجرای مجوز به عنوان یک قرارداد خالی از مجوز منبع باز پشتیبانی می کند یا بی سر و صدا آن را به چیز دیگری تبدیل می کند."
با وکلای گران قیمتی که نرخ های ساعتی آنها حتی میلیونرهای هوش مصنوعی را نگران می کند کنار بیایید. از این گذشته، عدم قطعیت IP یک مسئله کاغذی جزئی نیست. این یک مشکل امنیت و انطباق زنجیره تامین است. اگر از کد تولید شده توسط هوش مصنوعی استفاده می کنید، ممکن است تعهدات قانونی ناشناخته ای را به نرم افزار خود وارد کنید. اگر یک توسعهدهنده منبع باز هستید، کار شما ممکن است برای بهبود یک سرویس اختصاصی که کد را بدون منشأ، انتساب یا رابطه متقابل معنیدار برمیگرداند، استفاده شود. و اگر مشتری هستید، ممکن است به نرم افزاری تکیه کنید که هیچ کس نمی تواند به طور کامل منشأ آن را توضیح دهد.
حکم مدار نهم هیچ یک از اینها را حل نکرد. ما درگیر دعواهای منبع باز بسیار بیشتری هستیم که باعث می شود SCO در مقابل جهان شناخته شده لینوکس شبیه به یک بلیت پارکینگ به نظر برسد. پس از آن آخرین چروک وجود دارد: یک شکایت فدرال ضد تراست علیه Anthropic، OpenAI، SpaceXAI، و Google. شاکیان ادعا می کنند که شرکت ها برای کاهش سرعت توسعه سیستم های هوش مصنوعی پیشرفته هماهنگ شده اند. این شکایت به اظهارات عمومی رهبران هوش مصنوعی اشاره دارد که همگی خواستار هماهنگی برای "سرعت" توسعه هوش مصنوعی مرزی در یک آخر هفته هستند.
داریو آمودی، مدیر عامل آنتروپیک، از هماهنگی در سطح صنعت برای کند کردن توسعه مرزی بحث کرده است. سام آلتمن، مدیر عامل OpenAI، دمیس حسابیس از بنیانگذاران Google DeepMind و ایلان ماسک نیز نسخه هایی از این دیدگاه را به صورت عمومی بیان کرده اند که سیستم های هوش مصنوعی قدرتمند نیاز به کنترل و استقرار دقیق دارند. در چهره آن معقول به نظر می رسد. ایمنی هوش مصنوعی یک مسئله واقعی است. هر کس غیر از این می گوید توجه نکرده است. اما تفاوت زیادی بین همه بازیکنان بزرگ هوش مصنوعی وجود دارد که بین خودشان در مورد سرعت توسعه یک بازار توافق دارند.
این بسیار شبیه به رقبا است که تصمیم میگیرند چه کسی رقابت کند، چه چیزی بسازد و چه زمانی آن را بسازد. شرکتهای بزرگ هوش مصنوعی همگی مانند افراد خوبی به نظر میرسند و همزمان رقبای کوچکتر خود را خفه میکنند. برای انسان های فانی، این ممکن است مانند یک پرونده باز و بسته به نظر برسد. این نیست. قانون ضد انحصار مستلزم شواهدی از توافق و آسیب واقعی به رقابت است. اظهارنظرهای عمومی مشابه توسط مدیران کافی نیست. شاکیان برای برنده شدن به چیزی بیش از نقل قول در مورد ایمنی هوش مصنوعی یا توسعه مسئولانه نیاز دارند.
علاوه بر این، اگر آنها برنده شوند، پس چه؟ چیزی که اخیرا مانند پیروزیهای ضدانحصاری بزرگ به نظر میرسید، زمانی که به تنبیه افرادی مانند گوگل و کسبوکار تبلیغاتی آن میرسید، یا «بازنده پرونده، برنده توافق» با جستجوی Google بود، دندانهای خود را از دست داد. آیا الگوی اینجا را می بینید؟ هوش مصنوعی بزرگ به طور موثر استدلال کرده است که قانون کپی رایت، مجوزهای منبع باز و قوانین رقابت نباید سرعت آنها را کاهش دهد. هنگامی که سازندگان مخالفت می کنند، به آنها گفته می شود که آموزش استفاده منصفانه است. وقتی توسعه دهندگان مخالفت می کنند، به آنها گفته می شود که کد تولید شده کد جدیدی است.
وقتی رقبا مخالفت می کنند، به آنها گفته می شود که امنیت از بزرگترین شرکت ها برای هماهنگی می خواهد. خنده دار است که چگونه به نظر می رسد پاسخ همیشه هوش مصنوعی بزرگ را با داده ها، بازار و پول ترک می کند، اینطور نیست؟ مسئله اصلی این نیست که آیا باید به هوش مصنوعی اجازه توسعه داده شود یا خیر. توسعه خواهد یافت. مسئله این است که آیا شرکتهایی که آن را میسازند باید اجازه داشته باشند که کار دیگران را به عنوان یک منبع مواد خام رایگان در نظر بگیرند، سپس از محصولات حاصل برای از بین بردن ترافیک، درآمد و قدرت چانهزنی سازندگان استفاده کنند.
مگر اینکه اکنون هوش مصنوعی بزرگ را از این تصاحب زمین با پردازندههای گرافیکی متوقف کنیم، تنها تعداد انگشت شماری از تریلیونرها واقعا از هوش مصنوعی سود میبرند و بقیه ما در یک سیستم فئودالی پس از فناوری قرن بیست و یکم رعیت میشویم. ®
متن اصلی (انگلیسی)
Big AI's content problem: Take the work, keep the money
The more we learn about how AI does business, the more unfair it looks