
اسناد جدید ثبت شده توسط نیویورک تایمز نشان می دهد که مدیران مایکروسافت و OpenAI آنها درباره آموزش مدل های هوش مصنوعی و تهدید آن برای رسانه ها هشدار داده اند.
به گزارش سرویس هوش مصنوعی مجرداسناد تازه منتشر شده از پرونده حقوقی نیویورک تایمز علیه OpenAI و مایکروسافت نشان می دهد که در مکاتبات داخلی، برخی از مدیران این شرکت ها استفاده گسترده ناشران از محتوا برای آموزش هوش مصنوعی را با کلماتی مانند “سرقت” توصیف کرده و نسبت به تهدید احتمالی محصولات هوش مصنوعی برای صنعت رسانه هشدار داده اند. این اطلاعات در ادامه پرونده ای که سه سال پیش نیویورک تایمز علیه OpenAI و مایکروسافت مطرح کرد منتشر شده است.
این رسانه ادعا می کند که دو شرکت از حجم زیادی از محتوای دارای حق چاپ برای آموزش مدل های هوش مصنوعی مولد بدون کسب مجوز استفاده کرده اند. بسیاری از اطلاعات جدید از متن حقوقی نیویورک تایمز به دست آمده است و اصل اسناد مربوط به برخی نقل قول ها محرمانه می ماند. به همین دلیل، تعدادی از اظهارات منتشر شده بدون متن کامل مکاتبات داخلی ارائه شده است.
بیشتر بخوانید: منشی هوشمند صوتی شرکت ElevenLabs رونمایی شد
نگرانی مدیران از آسیب هوش مصنوعی به رسانه ها
یکی از مهم ترین بخش های اسناد جدید به اظهارات داخلی مدیران مایکروسافت و OpenAI در مورد تأثیر محصولات هوش مصنوعی بر ناشران مربوط می شود. در یک یادداشت داخلی در ژانویه 2023، مدیر علوم کاربردی مایکروسافت، برنت هچت، مجموعه عظیم محتوا برای آموزش مدل ها را “یک سرقت حیرت انگیز با ابعاد بی سابقه” توصیف کرد. او همچنین این فرآیند را «بزرگترین دزدی نیروی کار در تاریخ بشر» نامید.

برای مطالعه بیشتر: شرکت OpenAI یک دستیار هوشمند اختصاصی برای وکلا معرفی کرد
اسناد داخلی مایکروسافت همچنین نشان می دهد که این شرکت نگران پیامدهای اقتصادی سیستم های هوش مصنوعی برای سازندگان محتوا بود. یک سند هشدار میدهد که هوش مصنوعی مولد ممکن است کار افرادی را که دادههای مورد استفاده برای آموزش مدلهای زیربنایی را تولید میکنند، مختل کند.
نیک تورلی، مدیر ChatGPT در OpenAI نیز در مکاتبات داخلی نوشت که ناشران با “تهدید وجودی” محصولاتی مانند چت بات ها مواجه هستند. وی این محصولات را تا حد زیادی «قابل تعویض» توصیف کرد و گفت: با بهتر شدن، میزان تعویض نیز افزایش می یابد. گرگ براکمن، رئیس OpenAI نیز در مکاتبات داخلی گفت که مدل های این شرکت در زمینه اخبار بسیار خوب عمل می کنند.
کاهش شدید کلیک کاربران بر روی نیویورک تایمز
یکی از مهم ترین داده های ارائه شده در پرونده مربوط به تاثیر سیستم های پاسخ هوش مصنوعی بر ترافیک ناشران است. بر اساس داده های داخلی مایکروسافت، موتور پاسخگو Copilot نرخ کلیک کاربر در دامنه نیویورک تایمز را در مقایسه با جستجوی سنتی Bing 93 درصد کاهش داده است. هاچت در یک ارائه داخلی در ژانویه 2024 وضعیت را به عنوان “چرخه تخریب” توصیف کرد. وی هشدار داد که کاهش ترافیک سایت های تولید محتوا در نهایت می تواند هم به آموزش مدل های هوش مصنوعی و هم به کل اکوسیستم وب آسیب برساند.
یک سند مایکروسافت بیان می کند که معمول نیست که یک محصول نهایی پایه های اقتصادی تامین کنندگان اصلی خود را تهدید کند، اما کسب و کار بزرگ مدل های زبانی مایکروسافت در رابطه با زنجیره تامین محتوا در چنین وضعیتی قرار دارد. ساتیا نادلا، مدیر عامل مایکروسافت نیز در جلسه بازجویی قضایی خود گفت که هر محتوایی که در پشت دیوار پرداخت است باید برای استفاده در آموزش یا تغذیه سیستم های هوش مصنوعی مجوز داشته باشد.
نادلا همچنین گفت که اگر میدانست که OpenAI محتوایی را در پشت دیوار جمعآوری کرده و از آن برای آموزش مدلها استفاده میکند، میتوانست از حق مایکروسافت برای درخواست بازآموزی مدلهای هوش مصنوعی استفاده کند. او همچنین اعتراف می کند که دریافت پاسخ مستقیم از یک چت بات می تواند جایگزین بازدید کاربر از وب سایت اصلی شود.
میلیون ها سند خبری در مجموعه داده های آموزشی برای مدل های هوش مصنوعی
اسناد جدید جزئیات بیشتری در مورد حجم محتوای خبری مورد استفاده برای آموزش مدل های OpenAI ارائه می دهد. بر اساس این پرونده، مجموعه دادههای مرحله میانی آموزش مدلهای OpenAI شامل بیش از 91692 نسخه از آثار منتشر شده توسط نیویورک تایمز، اخبار روزانه و مرکز گزارشهای تحقیقی است. مجموعه داده مبتنی بر Common Crawl همچنین حاوی بیش از 2 میلیون سند از دامنه nytimes.com بود.
Common Crawl یک مخزن عمومی از داده های جمع آوری شده از وب است و شرکت ها و محققان می توانند از داده های آن برای ساخت مجموعه های آموزشی برای مدل های هوش مصنوعی استفاده کنند. در بخش دیگری از پرونده آمده است که OpenAI کل مجموعه داده آموزشی GPT-3 را در اختیار مایکروسافت قرار داده است. مایکروسافت همچنین از این داده ها برای بررسی نحوه استفاده از مدل های OpenAI در محصولات تجاری خود استفاده کرد.

حتما بخوانید: Grok با داده های استارتاپ های شکست خورده آموزش دیده است
مایکروسافت همچنین از طریق پروژه هایی به نام Project Taxi و Project Mango داده هایی را در اختیار OpenAI قرار داده است. بر اساس این دادخواست، مجموعه داده های Project Mango حاوی نسخه هایی از حداقل 160903 اثر منحصر به فرد متعلق به ناشران خبری بود. این پرونده همچنین ادعا می کند که OpenAI مجموعه داده هایی مانند WebText و WebText2 ایجاد کرده است که بخش قابل توجهی از محتوای آنها شامل محتوای خبری استخراج شده از وب است.
استفاده از آثار دارای حق چاپ برای آموزش مدل های هوش مصنوعی
بخش مهم دیگری از پرونده به روش های OpenAI برای دسترسی به محتوای ناشران مربوط می شود. بر اساس اسناد منتشر شده، برخی از کارکنان OpenAI راه هایی برای دور زدن دیوارهای پرداخت بدون شناسایی پیدا کرده اند. در یکی از مکاتبات، نیک رایدر، محقق OpenAI، به گرگ براکمن در مورد “هک برای عبور از دیوار پرداخت نیویورک تایمز” اطلاع داد. براکمن نیز پاسخ داد: “آه، خوب.” این پرونده همچنین ادعا می کند که OpenAI و مایکروسافت برخی از محتوای ناشران را از فهرست جستجوی Bing به دست آورده اند.
در این اسناد همچنین به حذف اطلاعات مالکیت معنوی از برخی داده های آموزشی اشاره شده است. بر اساس این ادعا، محققان اطلاعات کپی رایت را از مجموعه داده حذف کردند زیرا نمیخواستند مدلها این اعلانها را در خروجی خود برای کاربران نمایش دهند. موضوع استفاده از آثار دارای حق چاپ برای آموزش هوش مصنوعی همچنان یکی از اصلی ترین اختلافات حقوقی در صنعت هوش مصنوعی است.
شرکت های فعال در این زمینه معمولاً استدلال می کنند که مدل های آموزشی می توانند در چارچوب “استفاده منصفانه” قرار گیرند. در مقابل، ناشران و صاحبان محتوا استدلال می کنند که مدل های هوش مصنوعی از کار خود برای ایجاد محصولاتی استفاده می کنند که در برخی موارد با محتوای اصلی رقابت می کنند و می توانند ترافیک و درآمد آنها را کاهش دهند. استیون لیبرمن، وکیل نیویورک دیلی نیوز، گفت که شواهد جدید نشان می دهد که OpenAI و مایکروسافت از ماهیت اقدامات خود آگاه بوده اند.
















گفتگو در مورد این post