В судебном споре американских издателей с OpenAI и Microsoft появились новые подробности. Из частично рассекреченного документа следует, что директор по прикладным исследованиям Microsoft Брент Хехт называл массовое копирование журналистских материалов «крупнейшей кражей труда в истории человечества». Внутри компаний также обсуждали, что ответы чат-ботов могут заменить переходы на сайты СМИ.
Это громкие формулировки, но важна оговорка: большая часть новых сведений содержится в заявлении стороны издателей. Приложения с исходной перепиской по-прежнему закрыты, поэтому цитаты опубликованы без полного контекста. Суд пока не признал, что OpenAI или Microsoft нарушили авторское право.
Что появилось в документе
Иск против OpenAI и Microsoft подали The New York Times, New York Daily News и другие издатели. Они утверждают, что разработчики копировали защищённые статьи для обучения моделей без разрешения и затем создали продукты, способные заменять оригинальные публикации.
В январе 2023 года Хехт, согласно документу, назвал масштаб копирования «поразительной кражей беспрецедентного масштаба». Годом позже он описал риск «порочного круга»: сервисы с ИИ забирают аудиторию у сайтов, доходы издателей падают, качественных материалов становится меньше — и данные для будущих моделей ухудшаются.
В документе приводится внутренняя статистика Microsoft: кликабельность ссылок на сайт The New York Times в ответах Copilot могла быть на 93% ниже, чем в обычной выдаче Bing. Методика расчёта публично не раскрыта, поэтому показатель нельзя считать независимым измерением всего поискового трафика.
Что уже известно точно: документ действительно рассекречен, а цитаты вошли в публичное заявление истцов. Их полный контекст остаётся закрытым, и суд ещё не оценил доказательства по существу.
Сколько материалов попало в данные
Истцы утверждают, что только в наборах для промежуточного обучения находилось более 91,6 тысячи копий работ The New York Times, Daily News и Center for Investigative Reporting. Ещё один набор на основе Common Crawl якобы включал свыше двух миллионов документов с домена nytimes.com.
В отдельном проекте Microsoft и OpenAI, получившем название Mango, издатели насчитали не менее 160,9 тысячи уникальных произведений. В документе также говорится, что компании обменивались обучающими данными: OpenAI передавала Microsoft набор GPT-3, а Microsoft предоставляла материалы через проекты Taxi и Mango.
Сами по себе большие числа не доказывают нарушение закона. Спор идёт о том, можно ли считать обучение модели новым способом анализа произведений или это коммерческое копирование, которое требует лицензии. Ответ зависит не только от количества материалов, но и от того, как они получены и способен ли новый продукт заменить оригинал на рынке.
Спор о платных статьях
Один из самых чувствительных эпизодов касается материалов за платной подпиской. В заявлении истцов говорится, что сотрудник OpenAI сообщил Грегу Брокману о способе обойти защиту сайта The New York Times, а тот коротко одобрил находку. Издатели также утверждают, что из обучающих данных удаляли уведомления об авторском праве.
Позиция руководства Microsoft выглядит сложнее. Сатья Наделла на допросе заявил, что платный контент должен лицензироваться для обучения или получения фактов. По его словам, если бы он знал о сборе закрытых статей OpenAI, Microsoft могла потребовать переобучить модели.
TechCrunch сообщила, что OpenAI и Microsoft не ответили на запрос редакции перед публикацией. Представители Microsoft в других публикациях подчёркивали, что высказывание отдельного сотрудника не является официальной позицией компании.
Почему это важно для ИИ
OpenAI и Microsoft защищают обучение на открытом интернете ссылкой на принцип добросовестного использования. Он допускает работу с защищёнными произведениями без отдельного разрешения в некоторых случаях — например, при исследовании, критике или создании существенно нового результата.
Для суда особенно важен вопрос замещения. Руководитель ChatGPT Ник Терли, как утверждают истцы, называл такие продукты «в значительной степени заменяющими» сайты издателей. Наделла также признал, что пользователь может получить ответ прямо в ИИ-сервисе и не переходить к первоначальному источнику.
При этом единообразной судебной практики пока нет. Несколько американских судов принимали аргументы разработчиков о добросовестном использовании данных, а правительство США недавно поддержало позицию OpenAI в отдельном заключении. Новый документ усиливает аргументы издателей, но не решает спор автоматически.
Что будет дальше
Сторонам предстоит спорить о допустимости доказательств, контексте внутренней переписки и реальном влиянии ИИ на рынок новостей. Если суд решит, что использование закрытых статей требует лицензии, разработчикам придётся внимательнее разделять открытые и платные источники, пересобирать наборы данных и расширять соглашения с издателями.
Даже без окончательного решения документ показывает проблему, которую индустрия обсуждала внутри задолго до нынешнего бума. Чем лучше ИИ пересказывает новости, тем меньше причин у пользователя открывать первоисточник — и тем сложнее финансировать работу, на которой обучаются следующие модели.
Вывод
Рассекреченный документ не доказывает вину OpenAI и Microsoft, но показывает, что сотрудники понимали экономический риск для издателей и спорность работы с платными материалами. Теперь эти внутренние оценки стали частью публичного судебного дела, где компаниям придётся объяснить не только технологию обучения, но и то, как она влияет на рынок исходных публикаций.


