Взлом Suno показал, откуда ИИ-генератор мог брать музыку для обучения
Журналисты сообщили о взломе Suno, одного из самых известных ИИ-сервисов для генерации музыки. По данным издания, хакер получил доступ к исходному коду и внутренним материалам компании, где описывались механизмы сбора аудио и текстов с YouTube Music, Deezer, Genius, стоковых библиотек и подкастов.
The Verge пишет, что в утекших материалах упоминались YouTube Music, Deezer, Genius, Pond5, Jamendo, Freesound и International Music Score Library Project. Один из файлов, по данным 404 Media, указывал на 2 013 545 клипов YouTube Music, уже обработанных Suno к моменту последнего обновления. В другом файле фигурировали сотни тысяч часов аудио из разных источников.
СМИ уточняют, что хакер якобы использовал supply chain attack и получил учетные данные сотрудника Suno. Это позволило ему получить доступ к исходному коду, который, по данным 404 Media, показывал сбор десятилетий аудио с онлайн-платформ, музыкальных библиотек и RSS-лент подкастов.
Особенно чувствительная часть истории связана с YouTube. По данным СМИ, утекший код указывал на использование сторонней компании Bright Data для сбора музыки с платформы, а также на поиск a cappella-версий песен, то есть аудио с вокалом без инструментальной части. Лейблы уже обвиняли Suno в незаконном использовании защищенных записей и обходе защит YouTube, тогда как сама компания настаивает, что обучение на публично доступных материалах допустимо по доктрине fair use.
Инцидент затронул не только вопрос авторских прав. Хакер также получил доступ к части клиентской информации, включая email-адреса, номера телефонов и платежные данные Stripe. Suno заявила 404 Media, что узнала об инциденте еще в ноябре 2025 года, быстро его локализовала и не считает, что были скомпрометированы чувствительные персональные данные или полные номера банковских карт.
История Suno показывает, что рынок генеративной музыки входит в фазу жесткого аудита происхождения данных. Для правообладателей ключевой вопрос - не только умеет ли ИИ создавать похожие треки, но и на каких каталогах он обучался. Для самих ИИ-компаний риск двойной: юридические претензии из-за обучающих датасетов и репутационный ущерб от утечек, которые раскрывают внутреннюю кухню сбора данных.