Самый наглядный эпизод нового иска занимает 88 слов. The Seattle Times утверждает, что ChatGPT почти дословно воспроизвёл фрагмент её расследования катастроф Boeing 737 MAX после запроса с заголовком, датой и адресом статьи. Для издателя это пример замены платного материала готовым ответом. Для суда — только начало проверки: наличие URL в запросе ещё не объясняет, взял ли сервис текст из параметров модели, поискового индекса или страницы в интернете.

В материале
  1. Иск касается не только обучения
  2. Почему пример с 88 словами не ставит точку
  3. Требование удалить модели — максимальная позиция истцов
  4. Что ответили компании
  5. Источники

The Seattle Times Company и Newsday подали 38-страничную жалобу 4 сентября в федеральный суд Южного округа Нью-Йорка. Ответчиками указаны несколько юридических лиц OpenAI и Microsoft. Дело получило номер 1:26-cv-07644; ни одно из центральных обвинений пока не подтверждено судебным решением.

Иск касается не только обучения

Издатели утверждают, что компании собрали сотни тысяч их публикаций, в том числе материалы за подпиской, и использовали тексты для обучения, дообучения и работы ИИ-продуктов. В жалобе упомянуты ChatGPT, Copilot и функции Bing, а среди возможных источников данных — Common Crawl, WebText, WebText2 и поисковый индекс Microsoft.

Но спор не ограничен вопросом «можно ли обучать модель на открытом интернете». Газеты заявляют ещё о трёх действиях: удалении сведений об авторе и правообладателе, выдаче фрагментов или близких пересказов пользователю и использовании журналистских брендов в ошибочных ответах. Поэтому в иске есть требования по авторскому праву, американскому закону DMCA и защите товарных знаков.

Из каких отдельных претензий состоит иск The Seattle Times и Newsday
Редакционная схема по жалобе от 4 сентября. Каждый пункт отражает позицию истцов, а не установленное нарушение.

Newsday отдельно указывает, что файл robots.txt запрещал автоматический обход сайта ботам OpenAI и Common Crawl. Это важно для спора о способе получения данных, но robots.txt сам по себе не отвечает на вопрос о нарушении авторского права: его юридическое значение зависит от обстоятельств доступа и конкретных требований.

Почему пример с 88 словами не ставит точку

Истцы считают дословный фрагмент признаком того, что текст сохранился внутри модели после обучения. Однако жалоба признаёт, что в запросе были заголовок, дата и URL. Современный чат-сервис может подключать поиск или технологию RAG — сначала находить документ, затем добавлять его в контекст модели. Без журналов работы системы нельзя уверенно разделить запоминание при обучении и получение текста во время запроса.

Разница принципиальна. Если фрагмент появился из весов модели, спор идёт о тренировочном наборе и запоминании. Если текст был получен по ссылке в момент ответа, важнее правила доступа, лицензирование поискового индекса и объём допустимого цитирования. В обоих случаях 88 слов могут быть существенным доказательством, но доказывают разные действия.

Что показывает пример из иска и чего по нему пока нельзя определить
Запрос и совпадающий фрагмент подтверждают результат теста, описанный газетами. Источник текста внутри системы потребует технических данных ответчиков.

Требование удалить модели — максимальная позиция истцов

Газеты просят компенсацию, постоянный запрет на предполагаемые нарушения и изъятие либо уничтожение копий публикаций. В тот же пункт они включили обучающие наборы и языковые модели, если те содержат их произведения или производные материалы.

Это требование не означает, что ChatGPT или Copilot уже обязаны удалить. Суд может отклонить его, ограничить более узкими данными, назначить денежную компенсацию или не найти нарушения вовсе. Практическая сложность тоже очевидна: стороне придётся показать, какие именно материалы находятся в конкретном наборе или модели и можно ли удалить их без уничтожения всего продукта.

Что ответили компании

OpenAI сообщила Reuters, что обучает модели на общедоступных данных и считает такую практику добросовестным использованием, но отдельно новый иск не комментировала. Microsoft заявила GeekWire, что удивлена разбирательством и готова обсуждать решения с издателями.

У сторон до этого были и партнёрские отношения. В 2024 году OpenAI и Microsoft вместе выделили $10 млн на программу Lenfest Institute, среди участников которой были обе газеты; Microsoft также финансировала отдельные проекты The Seattle Times. Такое финансирование не даёт автоматической лицензии на весь архив и не мешает подать иск, но показывает, насколько тесно сотрудничество медиа с ИИ-компаниями соседствует с конфликтом вокруг данных.

Следующими важными документами станут ответы OpenAI и Microsoft. Именно там появятся их возражения по каждому требованию, а затем суд определит, какие эпизоды можно объединить с уже идущими издательскими делами и какие технические материалы стороны должны раскрыть.

Источники