Недавно рассекреченные судебные документы показывают, как Anthropic тайно закупала, уничтожала и сканировала книги, чтобы обучать свой ИИ‑чатбот Claude.
Все это напоминает оживший рассказ Рэя Брэдбери.
Где‑то в бескрайних просторах американских складов машины разрезали корешки книг, словно ломтики салями. Затем сканеры оптом обрабатывали их содержимое. Спустя считанные миллисекунды работа, на создание которой у людей могли уйти годы, оказывалась в цифровом пространстве и позже использовалась для обучения моделей ИИ, чтобы те могли воспроизводить голос и структуру наших языков.
Дальше бумага превращалась в отходы, которые отправляли на переработку: их пускали в макулатуру и использовали для производства туалетной бумаги и картонных коробок.
В названии, отсылающем и к секретной операции, и к документам, разоблачающим финансовые махинации, Project Panama был тайным планом Anthropic «отсканировать все книги в мире, уничтожая их в процессе», как следует из внутреннего документа по планированию, ставшего достоянием общественности после раскрытия судебных материалов в конце июля.
«Мы не хотим, чтобы кто‑то узнал, что мы над этим работаем», — говорится в документе.
Раскрытие тайных усилий Anthropic, о которых впервые сообщил Washington Post (источник на английском языке), еще больше омрачило гонку вооружений в сфере ИИ.
Оно также дало один из самых наглядных на сегодняшний день примеров того, как одна из крупнейших компаний в области ИИ относится к труду писателей, художников, фотографов и других создателей.
Как Project Panama обеспечивал сырьё для бумажной мельницы
Project Panama стартовал в начале 2024 года, когда руководство Anthropic искало книги, вышедшие задолго до появления онлайн‑каталогов, которые могли бы научить их чат‑бот Claude «хорошо писать», а не копировать «низкокачественный интернет‑язык», говорится в недавно обнародованных документах.
Стартап закупал десятки тысяч книг за раз у нескольких поставщиков, включая Better World Books и базирующуюся в Великобритании World of Books.
Тяжёлую работу по сканированию и уничтожению книг компания передала подрядчику: тот использовал гидравлическую машину, чтобы срезать корешки и нарезать страницы одну за другой, после чего их быстро копировали и загружали с помощью промышленного оборудования для сканирования изображений.
По словам подрядчика, который в итоге работал с Anthropic, компания «искала опытного поставщика услуг по сканированию документов, чтобы оцифровать от 500 000 до двух миллионов книг за шестимесячный период».
Почему книги, а не интернет?
Внутренние документы по планированию показывают, что руководство Anthropic было уверено: эта инициатива обеспечит более качественную коммуникацию и поможет справиться с «коллапсом» моделей ИИ — деградацией, которая возникает, когда ИИ обучается на текстах, загрязнённых собственным контентом ИИ.
В отличие от значительной части современной сети, книги предлагают огромные массивы написанной людьми и профессионально отредактированной литературы, которая ещё не испорчена контентом, сгенерированным ИИ.
Задача для компаний, работающих с ИИ, заключалась в том, как получить эти книги. Но из материалов суда следует, что руководство Anthropic могло считать, что им всё сойдёт с рук, а даже если нет, цель оправдает средства.
Согласно одному из документов, сооснователь Anthropic Бен Манн в июне 2021 года получил огромный массив контента, защищённого авторским правом, из «теневой библиотеки» LibGen. В материалах дела даже приводится снимок экрана браузера Манна в момент загрузки пиратских книг.
В следующем году Манн поделился ссылкой на Pirate Library Mirror — полный каталог незаконно приобретённых книг — с другими сотрудниками Anthropic. «Как раз вовремя!!!» — написал он.
Юридическая развязка
О существовании Project Panama стало известно только из тысяч страниц судебных документов, рассекреченных в рамках иска о нарушении авторских прав, поданного группой писателей, которые заявили, что Anthropic незаконно использовала их произведения для обучения Claude.
В 2024 году группа авторов во главе с романисткой Андреа Бартц и авторами нон‑фикшн Чарльзом Грэбером и Кирком Уоллесом Джонсоном подала против Anthropic коллективный иск, утверждая, что компания нарушила законы об авторском праве, использовав пиратские книги для обучения своей модели ИИ.
В прошлом месяце Anthropic, чья оценка сейчас составляет 965 млрд долларов США (875 млрд евро), согласилась выплатить 1,5 млрд долларов (около 1,3 млрд евро) для урегулирования дела, что покрывает около 500 000 произведений.
«Это крупнейшее известное возмещение по делам об авторском праве в истории», — заявил Джастин Нельсон, ведущий адвокат истцов.
Это дело стало первым из целой волны исков против компаний, работающих с ИИ, которое удалось урегулировать.
Meta, OpenAI, Google и Microsoft также сталкиваются с исками о нарушении авторских прав от авторов, выдвигающих аналогичные обвинения в пиратстве. Несколько писателей, отказавшихся участвовать в коллективном урегулировании, ведут индивидуальные дела против Anthropic.
Что означает это решение
Пока другие дела проходят через судебные инстанции, прошлонедельное урегулирование может оказаться лишь первой главой куда более продолжительной юридической борьбы.
В первоначальном решении, вынесенном в прошлом году, судья постановил, что использование компанией законно приобретённых книг подпадает под доктрину добросовестного использования в соответствии с законодательством США.
Однако в этом решении была проведена грань между книгами, которые компания купила и отсканировала, и миллионами книг, которые она ранее скачала незаконно.
«Знаковое решение суда от июня 2025 года остаётся в силе», — заявила заместитель генерального юрисконсульта Anthropic Апарна Сридхар в комментарии для Post. «Вопрос, по которому мы пошли на урегулирование, касался того, как некоторые материалы были получены, а не того, можем ли мы использовать их для разработки [ИИ]».
Для некоторых, однако, рассекреченные документы стали более серьёзным приговором, разрушив последние иллюзии о том, что крупнейшие технологические корпорации понимают культурную ценность. Не говоря уже о том, чтобы уважать святость человеческого творчества.