پرش به محتوای اصلی

مشکل محتوای بزرگ هوش مصنوعی: کار را بردارید، پول را نگه دارید

دِ رجیستر۱۴۰۵ مهر ۵, یکشنبه، ساعت ۱۳:۰۵حدود 9 دقیقه مطالعه

هرچه بیشتر در مورد نحوه تجارت هوش مصنوعی بیاموزیم، ناعادلانه تر به نظر می رسد

هوش مصنوعی بزرگ یک مشکل دارد. شرکت‌های آن باید کارهای دیگران را جذب کنند. می‌دانید، کتاب‌ها، داستان‌های خبری، عکس‌ها، کدها، وب‌سایت‌ها، آن یک الگوی رفتاری اصلی که با آن ساخته‌اید، و عملا هر چیز دیگری در اینترنت برای آموزش مدل‌های زبان بزرگ آن (LLM) وجود دارد. همه ما این را می دانیم. همچنین می دانیم که شرکت های هوش مصنوعی از پرداخت هزینه برای هر یک از آن، اطاعت از مجوزهای مرتبط با آن، یا خدای ناکرده از تقسیم درآمدشان با شرکت ها و افرادی که در وهله اول کار را ایجاد کرده اند، متنفرند.

اخیرا روش پیش‌فرض هوش مصنوعی بزرگ برای انجام کسب‌وکار: «حالا آن را بگیرید، بعدا در مورد قانونی بودن بحث کنید» بیش از هر زمان دیگری در چهره شما ظاهر شده است. به عنوان مثال، به مبارزه حق چاپ بین نیویورک تایمز و OpenAI و مایکروسافت نگاه کنید. طبق گزارش 404 Media در مورد اسناد دادگاهی که اخیرا مهر و موم نشده است - دلایل شاکیان که دادگاه هنوز درباره آنها حکمی صادر نکرده است - ظاهرا مایکروسافت می دانسته است که چه کاری انجام می دهد که خواه ناخواه اینترنت را وارد می کند. مدیر علوم کاربردی مایکروسافت، دکتر.

به نقل از برنت هشت، در خلاصه 92 صفحه ای شاکیان خبری آمده است: پرونده مربوط به "یک سرقت حیرت انگیز با ابعاد بی سابقه" است. او در خلاصه قضاوت وکلای روزنامه‌نگاران [PDF] گفته است که احتمالا «بزرگ‌ترین سرقت نیروی کار در تاریخ بشریت» بود. از طرف یکی از کارکنان ارشد مایکروسافت بود. Hecht تنها کسی در مایکروسافت نبود که نظر داد.

در یک سند سیاست داخلی مایکروسافت که در مقالات دادگاه نیز نقل شده است، نویسندگان اذعان کرده‌اند که هوش مصنوعی مولد می‌تواند «به‌طور قابل‌توجهی در استخدام افرادی که داده‌هایی را تولید می‌کنند که مدل پایه آموزش داده شده است، مختل کند [زیرا] LLM‌ها محصولی هستند که زنجیره تأمین آن را از بین می‌برند». این به نوبه خود منجر به فروپاشی مدل می شود. از قضا، هوش مصنوعی غاز سازنده محتوا را که تخم‌های طلای محتوای ارزشمند می‌گذارد، می‌کشد. قاضی سیدنی اچ استاین از دادگاه منطقه ای ایالات متحده برای ناحیه جنوبی نیویورک هنوز تصمیمی در مورد این پرونده صادر نکرده است.

OpenAI و مایکروسافت فعالانه ادعاهای شاکیان را تحت دفاع "استفاده منصفانه" به چالش می کشند. آنها معتقدند که استفاده از مقالات و کتاب‌های عمومی برای آموزش مدل‌های زبانی بزرگ به پیشبرد دانش عمومی کمک می‌کند و به عنوان یک «جایگزین غیرقانونی بازار اقتصادی» عمل نمی‌کند. اما اظهاراتی که اسناد به آنها اشاره می کند واقعی است. هوش مصنوعی بزرگ می داند که به محتوا نیاز دارد. برخی از شرکت‌های مربوطه به این موضوع توجهی ندارند. پول در حال حاضر، نگران بعدا شعار آنها است.

کسانی که می‌توانند به اعداد درآمدی نگاه کنند، به خوبی می‌دانند که درگیر چیزی هستند که خود مایکروسافت آن را «حلقه عذاب» استراتژی محتوای هوش مصنوعی در آن اسناد دادگاه بدون مهر و موم می‌نامد. آیا این مانع آنها می شود؟ نه با توجه به پرونده [PDF]، که به شهادت سوگند سپرده نماینده شرکت خود OpenAI اشاره می کند، همچنین گواهی می دهد که LLM های آن خوشحال هستند که کارهای دیگران را حتی زمانی که یک paywall به طور اسمی از آن محافظت می کند، خلاء می کنند.

به نقل از نماینده آن، آنها از "هر گونه تلاش برای شناسایی محتوای paywall در مجموعه داده های آموزشی" یا "برای حذف محتوای paywall از مجموعه داده های آموزشی خود بی اطلاع بودند." هنگامی که به گرگ براکمن، بنیانگذار OpenAI گفته شد که OpenAI می تواند راه خود را از طریق فایروال هک کند، او پاسخ داد: "آه، خوب است." صرف نظر از اینکه این عبارات منعکس کننده یک نگرش گسترده تر هستند یا نه، نگرش های مشابهی در بین هوش مصنوعی بزرگ حاکم است.

چنین سیاست هایی در نهایت می تواند بازگردد و سازندگان LLM را نیش بزند. این در حال حاضر بازار روزنامه نگاری، داستان نویسی، خلق آثار گرافیکی، و هر چیزی را که در واقع از انسان ها برای تولید آثار اصلی می طلبد، تحت تاثیر قرار داده است. اما هوش مصنوعی بزرگ نمی‌خواهد برای آن هزینه بپردازد. این یک عارضه جانبی نیست. این مدل کسب و کار است. جو کاربر نمی توانست اهمیتی بدهد. آنها فقط یک پاسخ سریع می خواهند که درست به نظر برسد. برخی از آنها نمی توانستند به دریافت پاسخ های درست اهمیت دهند. در مورد جستجوی عمیق تر برای اینکه ببینید آیا اطلاعاتی که آنها به دست می آورند صحیح است یا خیر، آن را فراموش کنید!

همانطور که یک مهندس نرم افزار OpenAI می گوید: "هرچقدر هم که لینک ها را برجسته نشان دهیم، کاربران کلیک نمی کنند." خب کلیک میکنم این دلیل بزرگی است که چرا Perplexity هوش مصنوعی انتخابی من است. اینطور نیست که جواب مطمئن تری بدهد. نه، این به این دلیل است که برخلاف اکثر LLM ها، Perplexity منابع و پیوندها را ارائه می دهد، و من قبل از پذیرش آنچه به من می گوید آنها را بررسی می کنم. اما پس از آن من روزنامه نگاری هستم که مدارک تحصیلی اش در تاریخ است، جایی که استادانم به من گفتند که شما همیشه - همیشه - به منابع اولیه نگاه کنید. هوش مصنوعی بزرگ نیز همین رویکرد را با تولیدکنندگان کد خود اتخاذ می کند.

Ninth Circuit ایالات متحده اخیرا GitHub، Microsoft و OpenAI را در شکایت Doe v. دادگاه حکم داد که شاکیان بر اساس یک ماده خاص از قانون حق نسخه‌برداری هزاره دیجیتال (DMCA) که مربوط به حذف یا تغییر اطلاعات مدیریت حق نسخه‌برداری (CMI) است، ادعایی نداشته‌اند. به طور خلاصه، دادگاه گفت که تولید کد جدید بدون گنجاندن CMI لزوما مشابه حذف یا تغییر اطلاعات حق چاپ از یک اثر موجود نیست.

قاضی اریک میلر نوشت: «کسی که اثر جدیدی خلق می‌کند و CMI را شامل نمی‌شود، نمی‌توان گفت که چیزی را «حذف» یا «تغییر» کرده است.» این حکم ثابت نمی کند که GitHub Copilot یا هر مدل کدنویسی دیگری ممکن است بدون محدودیت در هر پروژه منبع باز آموزش ببیند. مشخص نکرد که کپی کد منبع در یک مجموعه آموزشی همیشه استفاده منصفانه است. تصمیم نگرفت که کد تولید شده نمی تواند حق چاپ را نقض کند. و مطمئنا GPL، Apache، BSD، MIT یا هر مجوز منبع باز دیگری را لغو نکرد.

به هر حال، متن باز مترادف این نیست که «هر کاری که می خواهید با آن انجام دهید» نیست. زمانی که هوش مصنوعی به کدهای منبع باز دست پیدا می کند، به نظر می رسد که اینطور باشد. این مشکل کدهای تولید شده توسط هوش مصنوعی است. برنامه نویسی که یک پیشنهاد Copilot دریافت می کند بسیار بعید است که بررسی کند که آیا GPL کد را پوشش می دهد یا آیا آپاچی قطعه از یک کتابخانه را پوشش می دهد. مطمئنا توسعه‌دهنده نمی‌تواند تشخیص دهد که کدام شرایط مجوز ممکن است برای کدی که به تازگی از Opus 5.5 یا GPT 6 ظاهر شده است اعمال شود.

همانطور که مردی از OpenAI گفت، مردم روی پیوندها کلیک نمی کنند، و در خطوط لوله برنامه نویسی با هوش مصنوعی، آنها حتی لینک ها را ندارند. یکی از دوستان وکیل منبع باز من نگرانی بزرگتر از این تصمیم محدود دارد. او به من گفت که آنچه به او می‌دهد "مکث روند گسترده‌تری است. موارد متعددی وجود دارد که در آن طرف‌ها مجوزهای منبع باز را به‌عنوان قرارداد و نه به عنوان مجوزهای IP/حق نسخه‌برداری که برای آنها نوشته شده بود، مطرح می‌کنند. تئوری‌های قرارداد به شاکی اجازه می‌دهد تا از سوالاتی که حق نسخه‌برداری شما را مجبور به پاسخگویی می‌کند، چشم پوشی کند.

آیا شما صاحب کار هستید؟ آیا بیان قابل محافظت است؟ آیا واقعا کپی شده است؟» وی افزود: «این سؤالات مبنایی است که مجوزها بر آن ساخته می شود. مجوزهای منبع باز اعطای مجوز برای استفاده از مالکیت معنوی افراد هستند. اگر پرونده ای نمی تواند نشان دهد که مالکیت معنوی متعلق به یا نقض شده است، منصفانه است که بپرسیم آیا اجرای مجوز به عنوان یک قرارداد خالی از مجوز منبع باز پشتیبانی می کند یا بی سر و صدا آن را به چیز دیگری تبدیل می کند."

با وکلای گران قیمتی که نرخ های ساعتی آنها حتی میلیونرهای هوش مصنوعی را نگران می کند کنار بیایید. از این گذشته، عدم قطعیت IP یک مسئله کاغذی جزئی نیست. این یک مشکل امنیت و انطباق زنجیره تامین است. اگر از کد تولید شده توسط هوش مصنوعی استفاده می کنید، ممکن است تعهدات قانونی ناشناخته ای را به نرم افزار خود وارد کنید. اگر یک توسعه‌دهنده منبع باز هستید، کار شما ممکن است برای بهبود یک سرویس اختصاصی که کد را بدون منشأ، انتساب یا رابطه متقابل معنی‌دار برمی‌گرداند، استفاده شود. و اگر مشتری هستید، ممکن است به نرم افزاری تکیه کنید که هیچ کس نمی تواند به طور کامل منشأ آن را توضیح دهد.

حکم مدار نهم هیچ یک از اینها را حل نکرد. ما درگیر دعواهای منبع باز بسیار بیشتری هستیم که باعث می شود SCO در مقابل جهان شناخته شده لینوکس شبیه به یک بلیت پارکینگ به نظر برسد. پس از آن آخرین چروک وجود دارد: یک شکایت فدرال ضد تراست علیه Anthropic، OpenAI، SpaceXAI، و Google. شاکیان ادعا می کنند که شرکت ها برای کاهش سرعت توسعه سیستم های هوش مصنوعی پیشرفته هماهنگ شده اند. این شکایت به اظهارات عمومی رهبران هوش مصنوعی اشاره دارد که همگی خواستار هماهنگی برای "سرعت" توسعه هوش مصنوعی مرزی در یک آخر هفته هستند.

داریو آمودی، مدیر عامل آنتروپیک، از هماهنگی در سطح صنعت برای کند کردن توسعه مرزی بحث کرده است. سام آلتمن، مدیر عامل OpenAI، دمیس حسابیس از بنیانگذاران Google DeepMind و ایلان ماسک نیز نسخه هایی از این دیدگاه را به صورت عمومی بیان کرده اند که سیستم های هوش مصنوعی قدرتمند نیاز به کنترل و استقرار دقیق دارند. در چهره آن معقول به نظر می رسد. ایمنی هوش مصنوعی یک مسئله واقعی است. هر کس غیر از این می گوید توجه نکرده است. اما تفاوت زیادی بین همه بازیکنان بزرگ هوش مصنوعی وجود دارد که بین خودشان در مورد سرعت توسعه یک بازار توافق دارند.

این بسیار شبیه به رقبا است که تصمیم می‌گیرند چه کسی رقابت کند، چه چیزی بسازد و چه زمانی آن را بسازد. شرکت‌های بزرگ هوش مصنوعی همگی مانند افراد خوبی به نظر می‌رسند و همزمان رقبای کوچک‌تر خود را خفه می‌کنند. برای انسان های فانی، این ممکن است مانند یک پرونده باز و بسته به نظر برسد. این نیست. قانون ضد انحصار مستلزم شواهدی از توافق و آسیب واقعی به رقابت است. اظهارنظرهای عمومی مشابه توسط مدیران کافی نیست. شاکیان برای برنده شدن به چیزی بیش از نقل قول در مورد ایمنی هوش مصنوعی یا توسعه مسئولانه نیاز دارند.

علاوه بر این، اگر آنها برنده شوند، پس چه؟ چیزی که اخیرا مانند پیروزی‌های ضدانحصاری بزرگ به نظر می‌رسید، زمانی که به تنبیه افرادی مانند گوگل و کسب‌وکار تبلیغاتی آن می‌رسید، یا «بازنده پرونده، برنده توافق» با جستجوی Google بود، دندان‌های خود را از دست داد. آیا الگوی اینجا را می بینید؟ هوش مصنوعی بزرگ به طور موثر استدلال کرده است که قانون کپی رایت، مجوزهای منبع باز و قوانین رقابت نباید سرعت آنها را کاهش دهد. هنگامی که سازندگان مخالفت می کنند، به آنها گفته می شود که آموزش استفاده منصفانه است. وقتی توسعه دهندگان مخالفت می کنند، به آنها گفته می شود که کد تولید شده کد جدیدی است.

وقتی رقبا مخالفت می کنند، به آنها گفته می شود که امنیت از بزرگترین شرکت ها برای هماهنگی می خواهد. خنده دار است که چگونه به نظر می رسد پاسخ همیشه هوش مصنوعی بزرگ را با داده ها، بازار و پول ترک می کند، اینطور نیست؟ مسئله اصلی این نیست که آیا باید به هوش مصنوعی اجازه توسعه داده شود یا خیر. توسعه خواهد یافت. مسئله این است که آیا شرکت‌هایی که آن را می‌سازند باید اجازه داشته باشند که کار دیگران را به عنوان یک منبع مواد خام رایگان در نظر بگیرند، سپس از محصولات حاصل برای از بین بردن ترافیک، درآمد و قدرت چانه‌زنی سازندگان استفاده کنند.

مگر اینکه اکنون هوش مصنوعی بزرگ را از این تصاحب زمین با پردازنده‌های گرافیکی متوقف کنیم، تنها تعداد انگشت شماری از تریلیونرها واقعا از هوش مصنوعی سود می‌برند و بقیه ما در یک سیستم فئودالی پس از فناوری قرن بیست و یکم رعیت می‌شویم. ®

خواندن متن کامل در دِ رجیستربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Big AI's content problem: Take the work, keep the money

The more we learn about how AI does business, the more unfair it looks

همه‌ی اخبار فناوری