В федеральном суде Южного округа Нью-Йорка рассекретили ходатайство издателей во главе с The New York Times о вынесении решения в упрощённом порядке по иску к OpenAI и Microsoft. В открытом тексте оказались внутренние записки и показания, в которых сотрудники обеих компаний описывали обучение моделей на новостях как подмену журналистики, угрозу для цепочки поставки контента и, по оценке директора прикладной науки Microsoft Брента Хехта, возможно, «крупнейшую кражу труда в истории человечества».
Как внутри оценивали сбор новостей для моделей
Иск The New York Times к OpenAI и Microsoft подан в конце 2023 года. К нему присоединились другие издатели, среди них New York Daily News и ряд связанных газет. Спор идёт о том, законно ли компании копировали статьи для обучения языковых моделей и для ответов в ChatGPT и Copilot без лицензии, и можно ли считать это добросовестным использованием.
Добросовестное использование (fair use) – норма американского авторского права, которая в отдельных случаях разрешает копирование без согласия правообладателя. Суд смотрит на цель использования, характер произведения, объём заимствования и влияние на рынок оригинала. Если продукт подменяет спрос на исходный материал, этот довод обычно работает против ответчиков.
В рассекреченном ходатайстве истцы цитируют документ Хехта, написанный вскоре после подачи иска. Там массовый сбор чужих материалов для больших моделей назван «поразительной кражей небывалого масштаба» и, возможно, «крупнейшей кражей труда в истории человечества». В другой записке тот же сотрудник, по версии издателей, прямо расходится с публичной линией компаний: широкий парсинг новостей делает «полную насмешку из идеи fair use». Хехт отдельно фиксировал, что почти никто не собирался отдавать свой текст под такое применение и не получает за это оплату.
В OpenAI руководитель направления ChatGPT Ник Тёрли в июне 2023 года писал, что коммерческие продукты, обученные на новостях и способные их заменить, создают для издателей «экзистенциальную угрозу». Позже, в феврале 2024 года, он сформулировал жёстче: продукты «в основном подменяющие, точка» и «будут подменять всё сильнее по мере того, как станут лучше».
Во внутреннем документе Microsoft ту же логику свели к «петле обречённости»: конечный продукт подрывает экономику тех, кто поставляет ему тексты, а вместе с этим бьёт и по качеству моделей, и по вебу. «Крайне необычно, когда конечный продукт угрожает экономическим основам своих необходимых поставщиков, но именно такую ситуацию мы создали для бизнеса больших языковых моделей относительно цепочки поставки контента», – цитируют истцы.
Подмена клика и падение переходов
Издатели настаивают, что чат-боты не только учились на статьях, но и забирают аудиторию. Генеральный директор Microsoft Сатья Наделла под присягой согласился, что диалог с ботом подменяет переход на первоисточник: ответ появляется на площадке ИИ, и идти на сайт уже не нужно. Инженер OpenAI во внутренней переписке писал, что «как бы заметно ни показывали ссылки, пользователи не станут кликать». Тёрли о функции просмотра страниц в ChatGPT заметил, что после готового ответа «нет веской причины нажимать».
По данным Microsoft, которые приводят истцы, у ответа Copilot относительно обычного поиска Bing доля переходов падала на 87–93% для сайтов The New York Times, на 83–91% для площадок группы Daily News и на 51–94% для доменов Ziff Davis. В ходатайстве есть и опрос подписчиков Times: среди тех, кто пользовался или платил за ChatGPT именно ради новостей, 36% ответили, что им больше не нужен материал газеты.
После запуска ChatGPT в ту же схему, по мнению истцов, встроился и поиск Google. В материале отдельно упоминаются обзоры от ИИ над обычной выдачей: они забирают ещё часть трафика, который раньше шёл на новости. Если суд не потребует лицензировать такой контент, издатели предупреждают о ловушке для всей отрасли: выгодно платить всем сразу, но каждому отдельному разработчику выгоднее брать тексты бесплатно, пока платят другие.
Пейволл, чужие датасеты и «случайная маскировка»
Наделла под присягой говорил, что всё закрытое пейволлом нужно лицензировать и для обучения, и для подстановки в ответ, а обходить условия использования сайтов нельзя. Если бы ему сообщили, что OpenAI училась на материалах из-за пейволла, он, по своим словам, потребовал бы переобучить модели. Во внутренней переписке OpenAI картина другая: сотрудник Ник Райдер сообщил президенту компании Грегу Брокману, что найден «хак», позволяющий обходить пейволл The New York Times. Брокман ответил: «А, отлично».
Истцы отдельно разбирают источники данных. OpenAI, по их версии, получила у третьей стороны Annotated Corpus – почти все статьи The New York Times с 1 января 1987 года по 19 июня 2007 года, более 1,8 млн текстов, – хотя соглашение ограничивало коммерческое применение. Сотрудники понимали, что учить на этом модель «некорректно», но набор всё равно использовали. Microsoft обвиняют в том, что датасет, собранный под поиск Bing, затем пошёл в обучение моделей OpenAI без нового согласия издателей, которое давалось только на обычный поисковый обход.
Издатели проверяли, воспроизводят ли продукты фрагменты статей дословно. Простые просьбы «выдай весь текст» дополнили запросами саммари, маркированных тезисов, оценки предвзятости материала и разбора любой статьи с главной страницы издания. В ходатайстве они просят суд сейчас оценить только те случаи, где совпадение с оригиналом обширное и буквальное: этого, по их расчёту, достаточно, чтобы подорвать довод о fair use.
Отдельная претензия касается фильтра, которым OpenAI глушила выдачу текстов истцов после иска. Хехт называл такую схему «случайной маскировкой»: у тех, кто имеет права на контент, становится меньше возможности увидеть, что именно ушло в обучение. В ходатайстве это читают иначе: копии статей искали не чтобы прекратить нарушение, а чтобы истцам было труднее собрать доказательства.
Что отвечают компании и чего ждут в суде
OpenAI к моменту публикации разбора в Ars Technica не прокомментировала документ. Представитель Microsoft назвал продукты компании преобразовательным добросовестным использованием и заявил, что они не подменяют новостные сайты. Показания Наделлы в компании описывают как наблюдения о том, как люди ищут информацию, а не как вывод по авторскому праву. Записки Хехта, по этой версии, отражают личный взгляд одного сотрудника и не являются ни юридическим анализом, ни позицией корпорации.
Адвокат New York Daily News и семи связанных газет Стивен Либерман считает иначе: впервые опубликованные материалы показывают, что в OpenAI и Microsoft понимали, что поступают неправильно, и именно поэтому добивались конфиденциальности документов. «Теперь кот выпущен из мешка», – сказал он.
Решение в упрощённом порядке (summary judgment) – процедура, при которой суд может закрыть часть спора без полноценного разбирательства, если по ключевым фактам нет существенного разногласия. Даже при отказе в таком ходатайстве дело может уйти в процесс, а спорные эпизоды тогда разбирают уже на слушаниях.
Издатели просят признать копирование для обучения, подстановку статей в ответы и дословную выдачу нарушением и отказать в защите fair use хотя бы по фрагментам с широким буквальным совпадением. Остальное оставляют на процесс. Контраст на рынке уже есть: в 2025 году Anthropic согласилась выплатить авторам 1,5 млрд $ по иску о книгах из пиратских библиотек, которые ушли в обучение Claude. В США позиция государства пока другая: в сентябре 2026 года Министерство юстиции подало отзыв в пользу OpenAI и назвало обучение моделей на чужих текстах исключительно преобразовательным.
Что из этого следует
Рассекреченные цитаты не решают спор сами по себе: суд ещё должен оценить, насколько внутренние оценки сотрудников совпадают с юридическим составом нарушения и с влиянием на рынок новостей. Для издателей главное – связка двух фактов: модели учились на чужих статьях, а готовый ответ уже заменяет переход на сайт. Если этот довод устоит, лицензирование новостей перестанет быть добровольной опцией отдельных сделок и станет условием для всей отрасли.