Эксклюзив

«Неоцифрованные месторождения данных»: зачем ИИ-компании скупают и уничтожают книги

18 августа 2026
10:14
«Неоцифрованные месторождения данных»: зачем ИИ-компании скупают и уничтожают книги
Rhamely / Unspalsh

Продавцы подержанных книг по всему миру стали сообщать о подозрительных заявках от неизвестных покупателей: в них часто оказываются издания, никак не связанные между собой по тематике, а заказы от разных клиентов порой поступают на один и тот же адрес. Книготорговцы предполагают, что за такими закупками могут стоять компании по разработке искусственного интеллекта (ИИ), которые приобретают книги для последующей оцифровки — в процессе сканирования экземпляры фактически уничтожаются. Насколько распространена такая практика и почему ИИ-компании «охотятся» за редкими изданиями, RTVI рассказали эксперты.

О том, что книги действительно могут закупать и уничтожать ради обучения ИИ-моделей, стало известно из материалов судебного разбирательства, связанных с деятельностью компании Anthropic. Документы, обнародованные в этом году, показали, что весной 2024 года компания приобрела миллионы новых и подержанных книг — на складах у них срезали корешки, после чего страницы сканировали, а бумага превращалась в отходы.

Наблюдения книготорговцев из разных стран позволяют предположить, что к подобному способу сбора данных может прибегать не только Anthropic. О необычных крупных заказах рассказывают СМИ продавцы книг в США, Австралии и Европе. В этом месяце, например, ирландский книжный магазин Kennys сообщил о «безумном» заказе сразу на 5 000 малоизвестных изданий.

Никита Рвачев, эксперт ИИ-лаборатории компании из списка Fortune 100 и автор телеграм-канала «Мысли Рвачева», убежден, что случай с Anthropic не единичный: подобный подход используют как другие разработчики ИИ-моделей, так и компании, занимающиеся сбором данных.

«Я абсолютно уверен, что этот подход используется и будет использоваться не только Anthropic, но и любой другой компанией, которая обучает модели (Google, OpenAI, SpaceXAI), а также компаниями, которые занимаются сбором данных для обучения (например Toloka AI)», — указал Рвачев.

Новое расследование 404 Media указывает на то, что похожая схема закупки и оцифровки книг может использоваться Amazon. Журналисты поместили устройство слежения в редкое издание, заказанное подозрительным покупателем, и проследили его путь до конечного пункта назначения.

Им оказался склад Amazon в Лас-Вегасе, штат Невада. На логотипе объекта, работающего под обозначением VGT3, изображен динозавр с оскаленными зубами, держащий в лапах книгу. Сотрудники склада рассказали журналистам, что туда поступают крупные партии печатных изданий, после чего с книг срезают переплеты, чтобы ускорить сканирование страниц.

Зачем ИИ-компаниям бумажные книги

По словам Рвачева, технологические гиганты сегодня конкурируют в создании так называемых frontier-моделей — наиболее передовых систем искусственного интеллекта, уровень которых во многом определяется качеством данных.

Изначально такие модели обучали на публично доступных данных: новостях уважаемых изданий, постах в Reddit и т. д. Эта информация достаточно быстро закончились, и теперь разработчики вынуждены искать новые источники информации высокого качества, указал эксперт.

«Думаю, мы уже находимся в этой точке, когда данных из интернета недостаточно: сложно отфильтровать качество, часть данных уже была «отправлена» генеративному ИИ, часть данных юридически защищена, а часть данных защищена техническими методами. Поэтому компании ищут различные способы добыть качественные данные из других источников», — отметил он.

Преимущество букинистических изданий заключается в том, что они гарантированно не сгенерированы, отметил Рвачев. Как писал The Atlantic, разработчики ИИ особенно заинтересованы в книгах, вышедших до запуска ChatGPT в 2022 году. Интернет, напротив, все больше наполняется материалами, созданными самими нейросетями. Если такой контент повторно используется для обучения моделей, возникает риск так называемого замкнутого контура, при котором ошибки начинают воспроизводиться и накапливаться.

«Многое из того, что написано в интернете за последние несколько лет, написано не человеком, а ИИ. И если в нейросеть попадают неверные данные, то в таком замкнутом контуре ошибка будет только реплицироваться. Поиск данных, созданных до эры ИИ, пытается решить эту проблему. Сюда входят и книги, и научные работы, и даже физические письма», — добавил эксперт.

Почему книги уничтожают

По мнению эксперта, причина использования такого деструктивного сканирования прежде всего операционная: удалить переплет и пропустить книгу через оборудование проще и быстрее, чем сканировать целую книгу.

Оцифровка вручную имеет недостатки: изгиб корешка может искажать текст, а некоторые страницы иногда оказываются пропущенными. При слишком быстрой работе сотрудников возникают и другие ошибки, например, в кадр могут попасть пальцы, закрывающие часть страницы.

При этом технически существуют и другие, более безопасные методы. Еще в 2009 году Google запатентовала метод бережного сканирования книг с использованием инфракрасного излучения.

Юридическая защищенность и категории ценных книг

Роман Ямпольский, профессор компьютерных наук и инженерии Университета Луисвилля (Кентукки), рассказал, что история Anthropic привлекла внимание общественности именно потому, что позволила увидеть внутреннюю практику компании. По его мнению, масштабы подобной деятельности в индустрии могут быть значительно шире, чем известно публично.

Эксперт пояснил, что далеко не все книги существуют в цифровом виде, а приобретение печатного издания и его самостоятельная оцифровка может давать компании более прозрачную юридическую основу для дальнейшей работы с текстом.

«То, что электронная копия находится в интернете, не означает, что ее можно законно использовать для обучения модели. Покупка физической книги и самостоятельное сканирование может создавать более понятную юридическую основу. Для AI-компании важен не физический объект, а информация, которой еще нет в ее обучающем корпусе» — утверждал Ямпольский.

В современном мире доступ к редким книгам становится конкурентным преимуществом, причем для разработчиков ИИ важна не коллекционная, а информационная редкость. В этом смысле следующая фаза ИИ-гонки может быть не только гонкой вычислительных мощностей, но и гонкой за данные.

«Дорогое первое издание известного романа почти бесполезно для обучения, если его текст давно оцифрован. Гораздо интереснее может быть малоизвестная техническая монография, старый справочник, региональное издание или книга на редком языке, содержание которой практически отсутствует в интернете. Для разработчика ИИ наиболее ценна книга, несущая информацию, которой модель еще не видела. В этом смысле библиотеки и архивы могут превратиться в своеобразные неоцифрованные месторождения данных», — сказал эксперт.