Криптовалюты38411
Капитал. рынка$ 2.29T+0.24%
Объём 24ч$ 23.26B+7.30%
ДоминацияBTC56.89%+0.20%ETH10.09%-0.06%
ETH Gas0.17 Gwei
Cryptorank
/

Они не могут без нас… пока что


Они не могут без нас… пока что

Поделиться:

Рынки предсказаний

Что в фокусе у трейдеров?

Смотреть аналитику →
Prediction Banner

Сервис ISBNdb, объединяющий метаданные 113 млн изданий, предложил ИИ-компаниям специфическую услугу: закупку книг партиями до миллиона штук с последующей оцифровкой и утилизацией. Когда об этой схеме написали СМИ, компания поспешила удалить страницу с описанием услуги и заявила, что никаких сделок не заключала. Как утверждают ее представители, речь шла лишь о «проверке рыночного спроса». 

В другом сегменте рынка платформы ActID и New Claw готовы платить людям от $15 до $700 за право использовать их лица как основу для персонажей ИИ-сериалов и рекламы.

ForkLog разобрался, для чего лаборатории вынуждены скупать «органику», что такое «коллапс модели» и что еще человеческого понадобится машинам.

Уроборос

Термином «коллапс модели» описывают процесс, при котором ИИ-система деградирует по мере того, как обучается на данных, сгенерированных другими нейросетями, а не человеком. С каждым новым циклом результат становится более усредненным, предсказуемым и постепенно теряет связь с исходной реальностью, которую LLM должна была отражать.

Впервые термин формализовала и ввела в научный оборот международная группа исследователей под руководством Ильи Шумайлова. В мае 2023 года она опубликовала резонансную работу «Проклятие рекурсии: обучение на сгенерированных данных заставляет модели забывать».

Шумайлов и его коллеги математически доказали, что при регулярном подмешивании синтетических данных модели сначала перестают корректно воспроизводить информацию о редких событиях и явлениях, как и тонкие закономерности, а затем начинают деградировать: разнообразие ответов снижается, а ошибки накапливаются.

Масштаб проблемы подтверждают цифры. В апреле 2025 года исследователи компании в сфере веб-аналитики Ahrefs проверили 900 000 вновь индексируемых страниц и статей в поиске Google. Выяснилось, что доля материалов с признаками автогенерации превысила 74%.

По оценке независимого исследовательского института Epoch AI, весь пригодный для обучения текст в интернете может закончиться в период между 2026 и 2032 годами.

Для следующих поколений моделей это означает быстро сокращающийся запас источников, гарантированно свободных от машинного текста. По этой причине книги, изданные до 2022 года, обладают особой ценностью. Для ИИ-компаний они один из немногих источников, в котором почти гарантированно нет ни синтетического мусора, ни намеренно встроенной ловушки.

Некоторые авторы прибегли к встречной мере — «отравлению» данных. Они прячут в тексте символы, которые модель либо не считывает, либо интерпретирует как скрытую команду. 

Исследование совместной команды Британского института безопасности искусственного интеллекта, Anthropic, Института Алана Тьюринга, Университета Оксфорда и ETH Zurich предварительно доказало, что LLM можно незаметно обучить вредоносным паттернам с помощью критически малого объема «отравленных» данных — от 250 документов. Причем обычные методы выравнивания не способны распознать и удалить уязвимости.

451 градус по Антропику

Дальнейшая судьба книг очевидна не для всех, кто их продает.

В августе 2024 года три известных американских автора, Андреа Бартц, Чарльз Грейбнер и Кирк Уоллес Джонсон, подали коллективный иск против Anthropic. Руководство обвинили в нарушении авторских прав при обучении семейства моделей Claude. 

Согласно материалам судебного процесса, компания вложила десятки миллионов долларов в «неофициальный» проект Panama под руководством экс-менеджера Google Books Тома Терви. Anthropic анонимно скупала тиражи печатных книг, срезала гидравлическими ножами переплеты и сканировала их в промышленных масштабах с последующей утилизацией. Все это происходило тихо, без публичных анонсов — как обычная логистическая операция.

В июне 2025 года судья Уильям Алсуп постановил: оцифровка законно приобретенных печатных книг и последующее использование цифровых копий для обучения языковых моделей подпадает под доктрину добросовестного использования. 

Теперь достаточно купить бумажную книгу, сохранить чек — и происхождение обучающих данных можно подтвердить документально.

По информации 404 Media, эта практика давно вышла за пределы отдельных стартапов: поставщики данных вроде ISBNdb превратили скупку и уничтожение печатных книг в сервис под ключ. 

ISBNdb более двух десятилетий работала как крупнейшая международная база метаданных печатных книг с более чем 113 млн наименований. Сервисом традиционно пользовались библиотеки, магазины и издатели.

21 июля 2026 года журналист Эмануэль Майберг обнаружил особый промо-раздел на сайте ISBNdb: «Поиск печатных книг под потребности датасетов для ваших LLM».

На этой странице компания предлагала ИИ-лабораториям услуги оптового брокера:

  • организацию выкупа печатных книг до 2022 года выпуска партиями от 1000 до 1 млн экземпляров за один заказ;
  • гарантии того, что книги «чисты» от ИИ-слопа и алгоритмов «отравления» данных;
  • юридическую защиту с помощью жесткого правила соглашения о неразглашении и законности подхода — приобретения книг на вторичном рынке.

Руководство площадки прямо заявляло:

«Проблема восприятия реальна. „ИИ-компания уничтожила два миллиона книг“ — это не тот заголовок, который вызовет симпатию у общества».

В рамках расследования 404 Media опросило независимых букинистов, чтобы проверить, начался ли этот процесс. Они подтвердили, что с апреля 2026 года наблюдали аномальные закупки. Один из торговцев подержанных книг рассказал, что его продажи выросли с двадцати экземпляров до нескольких сотен за неделю.

Закупщиков не интересовал жанр или ценность — главным критерием было наличие кода ISBN. Приобретали даже откровенно переоцененные или редкие иностранные издания, полностью игнорируя стоимость.

Однако, кроме финансовой выгоды, радости от ажиотажа было немного: тот же продавец отметил, что уникальные издания в этой схеме теряются безвозвратно — единственный оставшийся экземпляр может закончить свой путь под сканером, а не на чьей-то книжной полке.

После публикации расследования история разлетелась по сети.

28 июля ISBNdb удалила промо-страницу с сайта. Через два дня руководство выпустило заявление, сменив риторику:

«Факты: ISBNdb никогда не покупала, не сканировала и не продавала книги — ни для обучения ИИ, ни для чего-либо еще. Мы не обучаем модели ИИ. Эта страница была лишь тестом на рыночный спрос; подобный сервис так и не был запущен».

image
Источник: ISBNdb.

Во второй статье 404 Media, вышедшей после оправданий ISBNdb, журналистка Саманта Коул отреагировала на произошедшее, напомнив, как компания, предлагавшая ИИ-гигантам защитить их от репутационных скандалов, сама попалась на попытке монетизировать массовое сканирование книг. После чего была вынуждена спешно удалять следы этой инициативы после разоблачения.

Разрыв между стоимостью сырья и готового продукта в этой сделке трудно назвать пропорциональным. Книга, которую уничтожают сразу после сканирования, стоит на вторичном рынке от $2 до $5. Модель, обученная в том числе на миллионах таких экземпляров, оценивается в миллиарды долларов.

https://forklog.com/news/ai/sud-ssha-utverdil-vyplatu-anthropic-1-5-mlrd-po-isku-za-knizhnoe-piratstvo

Нужно больше

За последние три года Интернет-суд Гуанчжоу рассмотрел около 700 дел, связанных с незаконным использованием чужой внешности с помощью ИИ. В марте 2026 года пекинский суд вынес беспрецедентное решение: использование чужой внешности в сгенерированных искусственным интеллектом дипфейках без разрешения незаконно, даже если изображение было модифицировано.

Эта судебная практика отражает стремительный рост рынка ИИ-контента. Журналисты Rest of World Кинлин Ло и Виола Чжоу подробно описали, как в Китае сформировалась индустрия ИИ-минидорам. По их данным, более 95% из 128 000 подобных фильмов, выпущенных за первые три месяца 2026 года, были произведены с использованием искусственного интеллекта. 

Короткие сериалы для мобильных телефонов в Китае обладают многомиллиардной аудиторией. Спрос на живые, узнаваемые лица для таких проектов породил новый вид сделки: аренду внешности. 

Платформы вроде ActID и New Claw устроены как обычный маркетплейс: компании платят людям от $15 до $700 за лицензирование их изображения. Пользователи сами загружают фото, сделанные в специальных студиях, затем продюсеры выбирают лица по полу, возрасту и категориям вроде «соседская девушка», «брутальный» или «супермодель», с фильтром по жанру проекта. 

image
Источник: Rest of World.

Руководитель отдела операций New Claw Лонг Лю в комментарии Rest of World объяснил логику платформы просто: 

«Продажа прав на использование фото дает им возможность зарабатывать, продолжая офлайн-карьеру». 

New Claw пришла в этот бизнес после того, как прежнее продакшн-направление компании понесло серьезные убытки. По словам Лю, с конца прошлого года традиционное производство драм сократилось, рекламные бюджеты уменьшились, а к ИИ-контенту начали переходить даже люксовые бренды.

Другая платформа — ActID, основанная в Шэньчжэне в марте 2026 года, успела зарегистрировать около 800 пользователей, из которых порядка 300 согласились лицензировать изображения для ИИ-продакшена. Среди них профессиональные актеры массовки, инфлюенсеры и люди без актерского опыта. Цена варьируется от $15 до $74 за эпизод при комиссии платформы в 10%. 

Директор по маркетингу ActID Камилла Янь в комментарии СМИ отметила, что ИИ-сериалы не требуют особого актерского мастерства. Она объяснила логику отбора:  

«Продюсерам нужны привлекательные лица для главных ролей, но также необходимы и характерные персонажи, например, пожилые люди».

Заявленная цель платформ — как раз защитить людей от того, что произошло с площадкой ИИ-дорам Hongguo, принадлежащей ByteDance. В апреле 2026 года двое инфлюенсеров обвинили компанию в краже и изменении их лиц. Сериал с 40 млн просмотров пришлось удалить. 

С начала 2026 года китайский техгигант уничтожил свыше 85 000 роликов с несанкционированным использованием чужих лиц и голосов.

https://forklog.com/news/ai/disney-obvinila-bytedance-v-piratstve-i-potrebovala-ogranichit-rabotu-seedance-2-0

Пекинский адвокат Иле Дэн в комментарии Rest of World назвала рынок лицензирования лиц позитивным шагом к формированию понятных коммерческих и юридических правил. Однако Дэн считает, что платформы не способны полностью устранить риск: попав в оборот, биометрические данные могут выйти из-под долгосрочного контроля их владельцев. В частности, нельзя гарантировать защиту от несанкционированной замены лиц, незаконного сбора данных или повторного использования загруженных изображений для обучения ИИ. 

«Многие агентства до сих пор платят людям считанные десятки долларов за сбор данных. Но если внимательно изучить контракты, условия лицензирования часто настолько размыты, что невозможно понять, кто и для чего в итоге использует эту внешность», — пояснила адвокат.

На практике этот контроль оказался хрупким.

Люди, продавшие лицензию на свое лицо, впоследствии столкнулись с тем, что их цифровые клоны использовались в недобросовестной рекламе или в материалах, которые можно отнести к политической пропаганде — то есть именно в тех контекстах, которые изначальное согласие едва ли предполагало.

Два наиболее резонансных случая произошли с британскими гражданами, продавшими права на свои цифровые аватары стартапу Synthesia:

  • в 2021 году Дэн Дьюхерст заключил официальный контракт с ИИ-платформой, рассчитывая, что цифровая копия его изображения будет использоваться в обучающих целях. В 2024 году актер узнал из расследования The Guardian, что его «клон» стал главным «ведущим» на фейковом новостном YouTube-канале House of News. За проектом стояли связанные с правительством Николаса Мадуро в Венесуэле структуры, которые занимались распространением дезинформации. Аватар на английском языке рассказывал о «буме туризма и процветании экономики страны», маскируя реальный экономический кризис;
  • Модель и креативный директор из Лондона Марк Торрес передал данные для создания цифрового двойника, пройдя полноценную сессию захвата движений и мимики. Однако позже его образ без разрешения использовали в пропагандистских роликах, поддерживающих Ибрагима Траоре — диктатора Буркина-Фасо, захватившего власть в результате военного переворота. 
https://youtu.be/TqNXqbTUpQ8

Оба случая стали прецедентами для британского профсоюза актеров Equity, который сейчас добивается законодательного запрета на передачу неконтролируемых прав на цифровую внешность без четкого ограничения контекста использования.

Не забудьте квитанцию

Книги и лица — не все, что нужно ИИ-компаниям.

На рынке голосовых данных складывается похожая ситуация. В июне 2026 года участники профсоюза SAG-AFTRA ратифицировали соглашение, расширяющее защиту от использования синтетических копий голоса без согласия, — тот же принцип лицензирования, что и с лицами, только в рамках коллективного договора.

Роботам нужны примеры естественных движений людей в реальном мире. Современные симуляции физики пока недостаточно точно воспроизводят, как рука обхватывает кружку или нога находит опору на неровном полу, а значит, синтетические данные для роботов сталкиваются с проблемой, похожей на коллапс моделей ИИ: при нехватке качественных реальных примеров система хуже осваивает редкие и сложные сценарии. По данным MIT, в 2025 году в разработку гуманоидов вложили более $6 млрд, компании вроде Scale AI и Encord нанимают операторов записывать на камеру бытовые движения, а Tesla платит до $48 в час людям, которые часами в костюме захвата движения повторяют рутинные действия для обучения машин Optimus.

Если вынести за скобки разницу в носителе — тексты, лица, голоса, движения, — схема везде одна и та же. Раньше подобные данные брали без спроса: сканировали архивы, скрейпили фотографии, обучались на голосах из открытого доступа. Теперь за это платят. Только структура сделки не меняется: актив все так же безвозвратно уходит из-под контроля владельца, просто теперь с квитанцией.

Книги и человеческая внешность кажутся разными категориями, но для ИИ-индустрии они превращаются в один тип ресурса — данные для обучения моделей. То и другое компании готовы покупать, но рынок устроен так, что защиты сделка не предполагает. После передачи прав человек уже не может полностью контролировать, кто и как будет использовать дальше его голос, лицо или созданный им контент.

Читать материал на Forklog

В этой новости

Монеты

$ 1.92K

+0.06%

$ 0.304

+0.07%

$ 0.000131

+13.3%

Фонды

Рынки предсказаний

Что в фокусе у трейдеров?

Смотреть аналитику →
Prediction Banner

Поделиться:

В этой новости

Монеты

$ 1.92K

+0.06%

$ 0.304

+0.07%

$ 0.000131

+13.3%

Фонды

Рынки предсказаний

Что в фокусе у трейдеров?

Смотреть аналитику →
Prediction Banner

Поделиться:

Читать больше

ИИ-агент Anthropic завел поддельные аккаунты для обмана разработчика

ИИ-агент Anthropic завел поддельные аккаунты для обмана разработчика

4 августа британский Институт безопасности ИИ (AISI) сообщил, что во время кибертесто...
Исследовательница OpenAI перешла в «телепатический» стартап Conduit

Исследовательница OpenAI перешла в «телепатический» стартап Conduit

Бывшая сотрудница Наоми Башкански присоединилась к проекту Conduit в качестве одного ...