پرش به محتوای اصلی

براده‌های جدید ویرایش نشده فاش می‌کنند که مدیر مایکروسافت خراشیدن با هوش مصنوعی را «بزرگ‌ترین سرقت نیروی کار در تاریخ بشر» می‌داند.

تک‌کرانچ۱۴۰۵ شهریور ۲۶, پنجشنبه، ساعت ۲۳:۱۶حدود 6 دقیقه مطالعه

پرونده‌های دادگاهی که اخیرا مهر و موم نشده است نشان می‌دهد که مایکروسافت به‌طور خصوصی شیوه‌های داده OpenAI را «سرقت» نامیده است، در حالی که هر دو شرکت محتوای تایمز با دیوار پرداخت را حذف می‌کنند، مجموعه داده‌هایی را از آن ساخته‌اند و به صورت داخلی هشدار می‌دهند که ناشران را از بین می‌برد.

اطلاعات ویرایش نشده جدید در دعوای حقوق کپی رایت نیویورک تایمز سه سال پیش علیه OpenAI و مایکروسافت اعتراف کرد که خراشیدن هوش مصنوعی مساوی با سرقت است و محصولات هوش مصنوعی تهدیدی بزرگ برای نشریات هستند.

بر اساس این شکایت، یکی از مدیران ارشد مایکروسافت به طور خصوصی شیوه‌های آموزش هوش مصنوعی شرکت‌ها را «سرقت» توصیف کرد و رهبری خود OpenAI گفت که مدل‌های هوش مصنوعی آن یک «تهدید وجودی» برای ناشران و روزنامه‌نگارانی است که کار آنها را آموزش داده است.

این مطالب بدون مهر و موم همچنین جزئیاتی را نشان می دهد که چگونه شرکت ها ظاهرا با دور زدن دیوارهای پرداخت ناشناخته، ساخت مجموعه داده های آموزشی از طریق جمع کردن انبوه و حذف عمدی اعلامیه های حق چاپ از داده های آموزشی، آن محتوا را به دست آورده و استفاده می کنند.

شایان ذکر است که بسیاری از اطلاعات جدید از خلاصه خود تایمز می آید، نه نمایشگاه های زیربنایی، که مهر و موم شده اند. نقل قول های زیر بدون زمینه اصلی ارائه شده اند.

این پرونده ویرایش نشده جدیدترین تشدید شکایت سه ساله است که در آن نیویورک تایمز در ابتدا ادعا کرد که شرکت ها با آموزش مدل های هوش مصنوعی در محتوای آن قانون کپی رایت را نقض کرده اند.

این سؤال که آیا شرکت‌های هوش مصنوعی می‌توانند به طور قانونی از مطالب دارای حق چاپ برای آموزش هوش مصنوعی استفاده کنند، پاسخ روشنی ندارد، اما قضات تا حد زیادی با استدلال شرکت‌های هوش مصنوعی مبنی بر اینکه آموزش «استفاده منصفانه» است، موافق بوده‌اند. این قانون قانونی به افراد اجازه می‌دهد در موارد خاص، مانند تقلید، گزارش خبری یا انتقاد، از آثار دارای حق نسخه‌برداری بدون اجازه استفاده کنند. در اوایل این ماه، دولت ترامپ مختصری در دفاع از استفاده بدون مجوز OpenAI از مطالب دارای حق چاپ برای آموزش LLM های خود ارائه کرد.

با این حال، چندین مورد از پذیرش‌های جدید برخلاف دفاع از استفاده منصفانه OpenAI است، به‌ویژه الزام این قانون مبنی بر اینکه استفاده جایگزین یا آسیبی به بازار برای اثر اصلی نمی‌زند.

به عنوان مثال، داده‌های خود مایکروسافت نشان می‌دهد که «موتور پاسخ» Copilot آن باعث شده است که نرخ کلیک دامنه نیویورک تایمز در مقایسه با جستجوی سنتی Bing تا 93 درصد کاهش یابد. یک ارائه داخلی مایکروسافت که توسط مدیر علوم کاربردی مایکروسافت، برنت هچت، در ژانویه 2024 نوشته شده است، این کاهش را به عنوان یک "حلقه عذاب" توصیف می کند که "به عملکرد مدل های ما و کل وب به طور همزمان آسیب می رساند."

در سند مایکروسافت، همانطور که در پرونده نقل شده است، آمده است: «بسیار غیرعادی است که یک محصول نهایی پایه های اقتصادی تأمین کنندگان ضروری آن را تهدید کند، اما این وضعیتی است که ما برای کسب و کار LLM خود با توجه به «زنجیره تأمین محتوای» آن ایجاد کرده ایم.

ساتیا نادلا، مدیرعامل مایکروسافت نیز در اوایل سال جاری در اظهاراتی شهادت داد که «هر چیزی که دارای دیوار پرداخت است باید توسط هرکسی که می‌خواهد از آن برای زمین یا آموزش استفاده کند مجوز دریافت کند» و تصریح کرد که اگر «آگاه می‌شد که OpenAI اطلاعاتی را که پشت دیوار پرداخت بود، خراش داده و آموزش داده بود»، «از مدل‌های Open برای AI مجدد درخواست می‌کرد».

سایر پذیرش‌ها با ستون‌های مختلف آزمون استفاده منصفانه مخالفت می‌کنند: نیک تورلی، رئیس ChatGPT OpenAI، در ارتباطات داخلی نوشت که ناشران با یک «تهدید وجودی» از سوی محصولاتی مانند ربات‌های چت مواجه هستند که «عمدتا جایگزین» هستند و «هرچه بهتر شوند، جایگزین‌های بیشتری خواهند شد».

گرگ براکمن، رئیس OpenAI، این مدل ها را «در اخبار عالی» توصیف کرد. نادلا در اوایل سال جاری با سوگند پذیرفت که مکالمه با ربات‌های چت «جایگزین ... ارائه اطلاعات در وب‌سایت در پلتفرم هوش مصنوعی در مقابل نیاز به رفتن به منبع اصلی است».

این نوع زبان نشان می‌دهد که چگونه این فناوری می‌تواند مستقیما با اثر اصلی رقابت کند، نه اینکه آن را تغییر دهد.

یک سند مایکروسافت بیان می‌کند که یک «خطر واقعی» وجود دارد که هوش مصنوعی مولد می‌تواند «به طور قابل‌توجهی در استخدام افرادی که داده‌هایی را تولید می‌کنند که مدل پایه آموزش داده شده‌اند، مختل کند».

مقیاس مطلق کپی کردن قابل توجه است. این اسناد برای اولین بار نشان می‌دهد که مجموعه داده‌های اواسط آموزشی OpenAI به تنهایی شامل بیش از 91692 نسخه از آثار منتشر شده توسط NYT، اخبار روزانه و مرکز گزارش‌های تحقیقی است. مجموعه داده‌های مشتق‌شده از Crawl شامل بیش از 2 میلیون سند تنها از nytimes.com است.

هخت در یک یادداشت داخلی ژانویه 2023 آن را «یک سرقت حیرت‌انگیز با ابعاد بی‌سابقه» و «بزرگ‌ترین سرقت نیروی کار در تاریخ بشر» خواند.

این پرونده با جزئیات جدیدی نشان می دهد که چگونه OpenAI و مایکروسافت برای دستیابی به محتوای شاکیان از جمله حذف آن از فهرست Bing اقدام کردند.

در این پرونده آمده است: "OpenAI کل مجموعه داده آموزشی GPT-3 را به مایکروسافت تحویل داد، که مایکروسافت از آن برای ارزیابی نحوه پیاده سازی مدل های OpenAI در محصولات تجاری خود استفاده کرد." مایکروسافت به طور مشابه داده های آموزشی را از طریق طرح هایی به نام تاکسی پروژه و پروژه مانگو به OpenAI ارائه کرد.

گفته می‌شود که این شرکت‌ها داده‌های Project Mango را در یک مجموعه داده آموزشی جمع‌آوری کرده‌اند که حاوی کپی‌هایی از حداقل 160903 اثر منحصربه‌فرد از ناشران اخبار است.

ظاهرا کارمندان OpenAI برای اینکه بیشترین بهره را از خراش دادن خود ببرند، طرحی برای دور زدن دیوارهای پرداخت بدون شناسایی ارائه کردند. بایگانی‌ها نشان می‌دهند که وقتی نیک رایدر، محقق OpenAI به براکمن در مورد "هک برای دور زدن nytimes paywall" گفت، براکمن پاسخ داد: "اوه خوب."

کارمندان OpenAI همچنین گفته می‌شود که مجموعه‌های داده آموزشی مانند WebText و WebText2 ساخته‌اند که به طور نامتناسبی بر محتوای اخبار خراشیده شده تکیه می‌کنند. آنها همچنین میلیون‌ها مقاله را از Common Crawl، یک مخزن آزاد و باز داده‌های خزیدن وب، بیرون کشیدند. این یافته‌ها همچنین تلاش‌های عمدی برای حذف اعلان‌های حق نسخه‌برداری از داده‌های آموزشی را قبل از رسیدن به مدل توصیف می‌کنند، زیرا محققان «نمی‌خواهند خروجی مدل» «اعلان‌های حق چاپ» برای کاربران ارائه شود.

OpenAI و مایکروسافت به درخواست‌هایی برای اظهار نظر پاسخ ندادند.

وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.

ربکا بلان یک گزارشگر ارشد در TechCrunch است که در آن تجارت، سیاست و روندهای نوظهور در شکل گیری هوش مصنوعی را پوشش می دهد. آثار او همچنین در فوربس، بلومبرگ، آتلانتیک، دیلی بیست و سایر نشریات ظاهر شده است.

می‌توانید با ارسال ایمیل به rebecca.bellan@techcrunch.com یا از طریق پیام رمزگذاری‌شده در rebeccabellan.491 در سیگنال، با ربکا تماس بگیرید یا آن را تأیید کنید.

آخرین روز برای رزرو میز نمایشگاه، 18 سپتامبر است. سرنخ های پر تاثیر، دسترسی سرمایه گذاران، و کانون توجه برند در سالن نمایشگاه Disrupt را از دست ندهید.

استارت آپ فناوری پاک Fluxnium راهی برای بهره برداری از سوخت هسته ای 50000 ساله تیم دی چانت پیدا کرد.

مدل استدلال جدید Salesforce و Nvidia همه چیزهایی است که آزمایشگاه‌های هوش مصنوعی باید از جولی بورت بترسند.

جنسن هوانگ از ترامپ تماس گرفت و چیز دیگری را نیز به نمایش گذاشت، کانی لویزوس

9 استارت‌آپ پرطرفدار از آخرین روز نمایشی Y Combinator، به گفته VCs Marina Temkin Dominic-Madori Davis

تسلا می‌گوید سرانجام در تاریخ 1 اکتبر از نسل دوم رودستر آنتونی ها رونمایی خواهد کرد

Revolut نقض اطلاعات مشتری از طریق درخواست های جعلی دولت Jagmeet Singh را تأیید می کند

مت مولنوگ به کارکنان Automattic می‌گوید (ترول‌ها؟) و می‌گوید که پس از برکناری سارا پرز، مدیر عامل، دوباره کنترل را به دست گرفته است.

خواندن متن کامل در تک‌کرانچبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Microsoft exec called AI scraping ‘the largest theft of labor in human history,’ new unredacted filings reveal

Newly unsealed court filings show Microsoft privately called OpenAI's data practices "theft" while both companies scraped paywalled Times content, built datasets from it, and warned internally it would gut publishers.

همه‌ی اخبار فناوری