Коллапс модели и рынок человеческих данных для обучения ИИ - Digital Актив

Коллапс модели и рынок человеческих данных для обучения ИИ

0
(0)

Коллапс модели и дефицит чистых источников

Коллапс модели представляет собой процесс деградации системы искусственного интеллекта при обучении на синтетических данных, созданных другими нейросетями, а не человеком. С каждым циклом результаты становятся более усредненными, предсказуемыми и постепенно утрачивают связь с реальностью, которую большая языковая модель (LLM) изначально должна была отражать.

Термин ввела в научный оборот международная группа исследователей под руководством Ильи Шумайлова, опубликовавшая в мае 2023 года работу «Проклятие рекурсии: обучение на сгенерированных данных заставляет модели забывать». Авторы математически обосновали, что при систематическом добавлении синтетических данных модели сначала перестают корректно воспроизводить информацию о редких событиях и тонких закономерностях, а затем начинают накапливать ошибки при одновременном снижении разнообразия ответов.

Масштаб явления подтверждается статистикой. В апреле 2025 года аналитики Ahrefs проверили 900 000 новых страниц в индексе Google и зафиксировали, что доля материалов с признаками автоматической генерации превысила 74%. По оценке института Epoch AI, пригодный для обучения текст в интернете может закончиться в период между 2026 и 2032 годами. Для следующих поколений моделей это означает сокращение источников, гарантированно свободных от машинного текста.

Некоторые авторы применяют встречную меру — «отравление» данных, пряча в тексте символы, которые модель либо не считывает, либо интерпретирует как скрытую команду. Совместное исследование Британского института безопасности ИИ, Anthropic, Института Алана Тьюринга, Оксфордского университета и ETH Zurich предварительно доказало, что LLM можно незаметно обучить вредоносным паттернам с помощью критически малого объема «отравленных» данных — от 250 документов. Обычные методы выравнивания не способны распознать и удалить уязвимости.

Массовая скупка книг как стратегия поставщиков данных

Книги, изданные до 2022 года, обладают особой ценностью для ИИ-компаний как один из немногих источников, практически гарантированно не содержащих синтетического мусора или намеренно встроенных ловушек. Сервис ISBNdb, объединяющий метаданные 113 млн изданий, предложил лабораториям специфическую услугу — закупку печатных книг партиями до миллиона штук с последующей оцифровкой и утилизацией.

21 июля 2026 года журналист Эмануэль Майберг обнаружил на сайте ISBNdb промо-раздел под названием «Поиск печатных книг под потребности датасетов для ваших LLM». Платформа предлагала организацию выкупа изданий до 2022 года выпуска партиями от 1000 до 1 млн экземпляров за заказ, гарантии «чистоты» книг от ИИ-слопа и алгоритмов отравления, а также юридическую защиту через соглашения о неразглашении и законность приобретения на вторичном рынке.

Независимые букинисты в ходе опроса, проведенного изданием 404 Media, подтвердили аномальные закупки с апреля 2026 года. Один из торговцев сообщил, что его продажи выросли с двадцати экземпляров до нескольких сотен за неделю. Закупщиков не интересовал жанр или ценность — главным критерием было наличие кода ISBN. 28 июля ISBNdb удалила страницу с сайта, а через два дня руководство выпустило заявление: «ISBNdb никогда не покупала, не сканировала и не продавала книги — ни для обучения ИИ, ни для чего-либо еще. Эта страница была лишь тестом на рыночный спрос; подобный сервис так и не был запущен».

Практика массового сканирования книг получила юридическое обоснование в июне 2025 года, когда судья Уильям Алсуп постановил, что оцифровка законно приобретенных печатных изданий и использование цифровых копий для обучения языковых моделей подпадает под доктрину добросовестного использования. Разрыв между стоимостью книги на вторичном рынке (от $2 до $5) и оценкой обученной на миллионах экземпляров модели (миллиарды долларов) трудно назвать пропорциональным.

Лицензирование внешности и новые рынки биометрических данных

Платформы ActID и New Claw выстроили маркетплейс, где компании выплачивают людям от $15 до $700 за лицензирование изображений для использования в качестве основы для персонажей ИИ-сериалов и рекламы. Пользователи загружают фото, сделанные в специальных студиях, а продюсеры выбирают лица по полу, возрасту и категориям вроде «соседская девушка» или «супермодель» с фильтром по жанру проекта.

ActID, основанная в Шэньчжэне в марте 2026 года, зарегистрировала около 800 пользователей, из которых порядка 300 согласились лицензировать изображения для ИИ-продакшена. Цена варьируется от $15 до $74 за эпизод при комиссии платформы в 10%. Руководитель отдела операций New Claw Лонг Лю объяснил: «Продажа прав на использование фото дает им возможность зарабатывать, продолжая офлайн-карьеру». Директор по маркетингу ActID Камилла Янь отметила, что ИИ-сериалы не требуют особого актерского мастерства: «Продюсерам нужны привлекательные лица для главных ролей, но также необходимы и характерные персонажи, например, пожилые люди».

За последние три года Интернет-суд Гуанчжоу рассмотрел около 700 дел, связанных с незаконным использованием чужой внешности с помощью ИИ. В марте 2026 года пекинский суд признал незаконным применение внешности в сгенерированных дипфейках без разрешения, даже если изображение было модифицировано. С начала 2026 года китайский техгигант ByteDance уничтожил свыше 85 000 роликов с несанкционированным использованием чужих лиц и голосов.

Риски утраты контроля над переданными данными

Пекинский адвокат Иле Дэн назвала рынок лицензирования лиц позитивным шагом к формированию коммерческих и юридических правил, но указала на неспособность платформ полностью устранить риск. По ее словам, «многие агентства до сих пор платят людям считанные десятки долларов за сбор данных. Но если внимательно изучить контракты, условия лицензирования часто настолько размыты, что невозможно понять, кто и для чего в итоге использует эту внешность».

Два прецедентных случая подтверждают хрупкость контроля. В 2021 году британский актер Дэн Дьюхерст заключил контракт с ИИ-платформой Synthesia, рассчитывая на использование цифровой копии в обучающих целях. В 2024 году его «клон» стал ведущим фейкового новостного YouTube-канала House of News, за которым стояли связанные с правительством Николаса Мадуро структуры. Модель Марк Торрес передал данные для создания цифрового двойника, однако его образ без разрешения использовали в пропагандистских роликах, поддерживающих диктатора Буркина-Фасо Ибрагима Траоре. Британский профсоюз актеров Equity добивается законодательного запрета на передачу неконтролируемых прав на цифровую внешность без четкого ограничения контекста использования.

Аналогичная ситуация складывается на рынке голосовых данных. В июне 2026 года профсоюз SAG-AFTRA ратифицировал соглашение, расширяющее защиту от использования синтетических копий голоса без согласия. Для ИИ-индустрии книги и человеческая внешность превращаются в один тип ресурса — данные для обучения моделей. Компании готовы покупать и то и другое, однако рынок устроен так, что после передачи прав человек не может полностью контролировать дальнейшее использование его голоса, лица или созданного им контента.

Материалы Сайта носят информационно-новостной и аналитический характер и не являются рекомендацией. Сайт не несет ответственности за любые прямые или косвенные убытки, возникшие вследствие использования неточного или запоздалого новостного фона

Насколько публикация полезна?

Нажмите на звезду, чтобы оценить!

Средняя оценка 0 / 5. Количество оценок: 0

Оценок пока нет. Поставьте оценку первым.

Проекты нашей сети

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Прокрутить вверх
Source: CurrencyRate.Today