Скандал вокруг промышленного сканирования книг для обучения AI
Б@blognotAI-инженер
1 недАнализ ситуации с массовой скупкой и уничтожением редких книг корпорациями для обучения AI и ответная реакция Anna’s Archive.
Корпорации скупают и уничтожают редкие книги для обучения AI, что вызывает вопросы о сохранении культурного наследия.
- Технологические гиганты нуждаются в качественных данных, созданных до эпохи AI, что делает физические книги дефицитным ресурсом.
- Процесс сканирования часто требует повреждения или уничтожения оригиналов, что ставит под угрозу сохранность редких изданий.
- Юридические споры вокруг авторского права вынуждают компании искать способы легального получения данных, что меняет рынок книгоиздания.
Тут уже пару недель интернет бушует на тему того, что большие компании массово закупают редкие книги и сканируют их, что в промышленном масштабе приводит к разрушению — надо срезать обложку, как минимум. Скандал впервые возник с проектом Anthropic, который всплыл во время рассмотрения иска, закончившийся мировом соглашением на 1,5 млрд, а сейчас журналисты 404 Media отследили тэгом заказ на редкую книгу до склада Amazon. Правда, Amazon сканирует книги очень давно для функции Look Inside, и в официальном комментарии отметил, что покупают книги для развития сервисов, но логика в выводах журналистов есть — заказы анонимные и оптовые, а та же Look Inside до сих пор делалась совместно с издательствами.
Библиотека Anna’s Archive опубликовала призыв к волонтёрам по всему миру: массово сканировать книги, журналы и редкие издания и загружать их в её хранилище. За небольшие загрузки обещают пожизненный доступ, за крупные — компенсацию расходов на сканирование.
Интерес компаний к текстам, созданным "до AI", понятен и даже экономически оправдан — это конечный ресурс, при этом очень ценный. Но если настоящая опасность, с которой хотят бороться активисты, это его монополизация крупными компаниями, то и бороться надо с этим — требуя публичного доступа к результатам сканирования, например, особенно, если книга уже в public domain.
Напомню заодно, что из проклятий археологов в адрес Генриха Шлимана, который нашел легендарную Трою, можно составить библиотеку даже большую, чем все комментарии в интернете по поводу AI. Любительски раскапывая легендарный город, дилетант Шлиман разрушил все культурные слои, причем включая тот, что непосредственно относился к событиям Илиады. С книгами активистам-любителям предлагается поступить аналогично.
Самая большая ирония во всем этом касается того самого иска в адрес Anthropic — мировое соглашение касалось именно хранения скачанных пиратских копий книг, а сканирование купленных книг суд признал добросовестным использованием. То есть юридическая логика делает любое использование пиратской библиотеки Anna's Archive для больших компаний абсолютно токсичным, а всю затею — активистской акцией с возможным немалым культурным ущербом.
https://annas-archive.gl/blog/physical-destruction.html
КонтекстAI
Речь идет о продолжающихся спорах между правообладателями и разработчиками AI по поводу использования защищенных авторским правом материалов для обучения моделей. Ранее Anthropic столкнулась с иском из-за использования пиратских баз данных, что привело к юридическим последствиям и попыткам компаний легализовать процесс через покупку и сканирование физических копий.
Кратко (AI)
Крупные технологические компании обвиняют в массовой скупке и физическом уничтожении редких книг для обучения нейросетей. В ответ библиотека Anna’s Archive призвала волонтеров сканировать литературу, чтобы предотвратить монополизацию данных. Автор отмечает юридические риски использования пиратских копий и возможный культурный ущерб от непрофессионального сканирования.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖