Исследование Alex Kryve Music & AI Initiative · The Lab
От автора
В этой статье технические характеристики генеративного аудио намеренно рассматриваются на уровне общих принципов.
Я не буду приводить конкретные способы удаления, изменения или маскировки цифровых отпечатков, водяных знаков, метаданных и других механизмов определения происхождения файла. Также здесь не будет практических рекомендаций о том, как сделать созданный или обработанный с помощью AI материал похожим для детектора на материал другого происхождения.
Причина проста.
Исследование механизмов идентификации необходимо для понимания технологии. Но превращать такое исследование в инструкцию по обходу этих механизмов — совершенно другая задача.
Нас интересует противоположное:
насколько вообще возможно сегодня определить происхождение музыки по её звучанию — и где заканчивается слуховой анализ и начинается доказуемое цифровое происхождение файла?
1. Что именно мы пытаемся определить?
Когда человек говорит:
«Я слышу, что эта музыка сделана ИИ»,
возникает первый технический вопрос:
что именно он утверждает, что услышал?
Музыку, полностью сгенерированную моделью?
AI-композицию?
Сгенерированный вокал?
Сгенерированный инструмент?
Реконструированную инструментальную партию?
AI-assisted production?
AI-обработку живого исполнения?
Разделение на stems?
Pitch correction?
Мастеринг?
Это принципиально разные процессы.
Современная запись может одновременно содержать человеческую композицию, живой вокал, живые инструменты, MIDI, сэмплы, amp simulation, drum replacement, Melodyne или Auto-Tune, программные ревербераторы, генеративные элементы, AI-assisted processing и автоматизированный мастеринг.
Поэтому бинарный вопрос:
«AI или не AI?»
становится всё менее информативным.
Гораздо точнее другой:
что именно сделал AI?
2. Что технически отличает живое исполнение от генеративного аудио?
Одного универсального признака не существует.
Однако существует целый комплекс характеристик, которые можно исследовать статистически.
| Характеристика | Живое исполнение | Возможные особенности генеративного аудио |
|---|---|---|
| Microtiming | Небольшие осмысленные отклонения от временной сетки | Может быть чрезмерно ровным или содержать статистически необычные отклонения |
| Динамика | Громкость атак связана с музыкальной фразой и физикой исполнения | Иногда наблюдается чрезмерное усреднение или необычная динамическая структура |
| Transients | Атака связана с конкретным физическим событием | Возможны сглаженные или реконструированные атаки |
| Гармоники | Подчиняются физике инструмента и способу звукоизвлечения | Возможны необычные спектральные отношения |
| Pitch | Естественные микроколебания высоты | Возможна как чрезмерная стабильность, так и неестественная микронестабильность |
| Noise floor | Шумы имеют физическую причину: помещение, усилитель, дыхание, пальцы | Фон иногда меняет структуру без очевидной физической причины |
| Stereo / Phase | Пространство связано с расположением источников и микрофонов | Возможны статистически необычные пространственные или фазовые отношения |
| Reverb | Отражения связаны с определённым пространством | Пространственные характеристики могут изменяться вместе с содержанием |
| Тембр во времени | Связан с одним физическим инструментом и трактом записи | Иногда возможен постепенный timbral drift |
| Связь инструментов | Microtiming и динамика музыкантов взаимосвязаны | Корреляции могут иметь иную статистическую структуру |
Но здесь начинается самое важное.
Ни один из этих признаков сам по себе не является доказательством использования AI.
3. Microtiming: человеческая «неточность», которая на самом деле является системой
Представим барабанщика, играющего ровные четверти.
Математическая сетка могла бы выглядеть так:
0 / 500 / 1000 / 1500 ms
Живой музыкант может сыграть:
+8 / −4 / +11 / +3 ms
Однако человеческое исполнение интересно не самим существованием ошибки.
Хороший музыкант ошибается не случайно.
Барабанщик может слегка толкать композицию вперёд перед припевом.
Басист может располагаться немного позади kick.
Гитарист — атаковать чуть раньше snare.
Эти микроскопические отношения и создают groove.
Поэтому при техническом анализе интереснее не вопрос:
«Есть ли отклонения от сетки?»
а вопрос:
«Как эти отклонения коррелируют между собой?»
Но и здесь нельзя получить абсолютный ответ.
Современные генеративные системы способны моделировать microtiming.
А живого барабанщика можно полностью quantize.
В результате мы получаем парадокс:
человек может технически звучать более “машинно”, чем машина.
4. Динамика исполнения
Человек редко играет последовательность нот с совершенно одинаковой энергией.
Например, условная динамика музыкальной фразы может выглядеть так:
72 — 76 — 81 — 88 | 69 — 74 — 79 — 91
Изменение энергии связано с направлением фразы.
Генеративная система также способна имитировать динамику. Однако статистическая структура таких изменений иногда может отличаться от живого исполнения.
Проблема в том, что после компрессии, limiting, transient shaping и мастеринга исходная динамика может быть изменена настолько сильно, что различия перестают быть очевидными.
Поэтому хорошие показатели LUFS, RMS или crest factor ничего сами по себе не говорят о происхождении исполнения.
5. Transients: момент рождения звука
Удар барабанной палочки — это физическая последовательность событий:
палочка → мембрана → корпус → snare → помещение → микрофон.
Атака гитарной струны:
медиатор → струна → лад → pickup → amplifier → cabinet → microphone.
Каждый этап оставляет временной и спектральный след.
Генеративная система создаёт правдоподобное представление результата этого процесса.
Поэтому при увеличенном анализе иногда могут наблюдаться отличия в структуре атаки и затухания.
Но снова возникает проблема современной студии.
Drum replacement, transient designer, amp simulation, saturation, compression и mastering способны радикально изменить настоящую атаку.
Следовательно:
необычный transient — признак для анализа, но не доказательство происхождения.
6. Спектр и гармоники
Физический музыкальный инструмент подчиняется законам акустики.
Основная частота и её гармоники связаны между собой.
Для условной ноты 110 Hz мы можем наблюдать компоненты:
110 → 220 → 330 → 440 → 550 Hz…
Но важны не только частоты.
Важно то, как их амплитуда развивается во времени.
У реальной струны гармоники изменяются вследствие физических процессов: затухания колебаний, взаимодействия с корпусом, датчиком, усилителем и помещением.
В генеративном аудио иногда можно обнаруживать spectral smearing, необычную эволюцию гармоник или нестабильность высокочастотных компонентов.
Но современные модели постоянно совершенствуются.
Поэтому спектрограмма может дать материал для вероятностного анализа.
Она не может сказать:
«Вот эта частота — AI».
Такой универсальной «частоты искусственного интеллекта» не существует.
7. Пространство, стерео и фаза
Реальная запись имеет геометрию.
Есть источник звука.
Есть помещение.
Есть микрофон.
Есть расстояние.
Поэтому левый и правый каналы находятся в определённых временных и фазовых отношениях.
В генеративном аудио иногда могут возникать пространственные отношения, которые трудно объяснить физическим расположением источника.
Особенно интересны в этом отношении:
cymbals, reverbs, distorted guitars, backing vocals и ambience.
Однако и здесь любой вывод ограничен.
Stereo widening, artificial reverb, chorus, delay, Mid/Side processing и современный mastering способны создать очень сложную фазовую картину из полностью человеческой записи.
8. Тембральная устойчивость во времени
Это один из наиболее интересных критериев.
Если музыкант записывает Stratocaster через конкретный усилитель и конкретный тракт, через сорок секунд этот Stratocaster физически остаётся тем же инструментом.
В генеративном аудио иногда может наблюдаться очень небольшое изменение спектральной идентичности источника.
На слух человек может продолжать воспринимать его как одну и ту же гитару.
При анализе характеристик во времени можно увидеть постепенный timbral drift.
Подобное возможно и с вокалом: могут изменяться отношения формант, harmonic-to-noise characteristics, структура сибилянтов или дыхания.
Но снова:
это диагностический признак, а не доказательство.
9. Почему набор признаков важнее одного признака
Именно поэтому серьёзные системы детекции не должны сводиться к одному параметру.
Их задача — анализировать множество характеристик одновременно и оценивать вероятность принадлежности материала к определённому классу.
Это принципиально отличается от человеческого:
«Я просто слышу».
На момент публикации Deezer заявляет для своей системы точность 99,8% при обнаружении полностью AI-generated музыки. При этом компания подчёркивает именно категорию 100% AI-generated music.
Это очень существенная оговорка.
100% AI-generated track и гибридная запись — не одно и то же.
10. А насколько хорошо это определяет человек?
Здесь результаты становятся особенно интересными.
В исследовании Deezer/Ipsos 97% участников не смогли корректно отличить полностью AI-generated музыку от человеческой в blind listening test.
Но ещё интереснее опубликованное 26 августа 2026 года исследование в Frontiers in Psychology.
В эксперименте участвовал 71 человек с музыкальной подготовкой. Они оценивали 18 фрагментов трёх категорий:
- AI-generated;
- human–AI collaboration;
- human-composed.
Получено 1 278 отдельных оценок происхождения.
Результат оказался поразительным.
Для AI-generated материала распределение ответов было практически случайным:
31,2% назвали его AI-generated; 36,4% — human–AI collaboration; 32,4% — human composition.
Для human–AI collaborative музыки:
32,4% — AI; 36,6% — collaboration; 31,0% — human.
Даже полностью человеческие композиции правильно определили как человеческие только в 45,3% случаев.
Следовательно, 54,7% настоящих human-composed фрагментов музыканты ошибочно отнесли либо к AI, либо к human–AI collaboration.
Связь между реальным происхождением и ответом слушателя статистически существовала, но была очень слабой: Cramér's V = 0,095.
Это уже серьёзный повод осторожнее относиться к заявлениям:
«Я слышу AI со стопроцентной уверенностью».
11. Более странный эффект: мы можем начать слышать AI после того, как нам о нём сказали
Есть ещё более интересная сторона проблемы.
В двух предварительно зарегистрированных исследованиях с общей выборкой 399 человек исследователи изучали, влияет ли предполагаемое авторство на восприятие музыки.
В одном из экспериментов одним и тем же музыкальным фрагментам давали маркировку Human или AI.
Результат: участники реже представляли историю и оценивали возникающий внутренний нарратив как менее насыщенный, когда музыка была обозначена как AI — независимо от её настоящего происхождения.
Это чрезвычайно важный результат.
Маркировка не изменила WAV.
Не изменила композицию.
Не изменила исполнение.
Она изменила контекст восприятия.
12. Значит ли это, что техническая детекция бессмысленна?
Нет.
Это означает совершенно другое.
Нужно различать как минимум четыре уровня.
1. Слуховое восприятие
«Мне кажется, это AI».
Это субъективная оценка.
2. Акустический анализ
«В сигнале обнаружены характеристики, статистически связанные с определённым способом генерации».
Это уже технический анализ.
3. Классификация детектором
«Модель оценивает вероятность принадлежности материала к определённой категории как X%».
Это результат конкретной модели.
4. Provenance
«Существуют проверяемые данные о происхождении и истории цифрового объекта».
И это уже совершенно другая категория доказательств.
13. Metadata, fingerprint и watermark — разные вещи
Эти понятия часто смешивают.
Metadata — данные, связанные с цифровым объектом.
Fingerprint — характеристика, вычисляемая из самого содержимого и позволяющая идентифицировать его или близкие версии.
Watermark — информация, внедряемая непосредственно в цифровое содержимое и способная служить идентификатором.
Современные системы provenance могут использовать сразу несколько уровней.
Стандарт C2PA, например, различает cryptographic hard bindings и soft bindings — к последним могут относиться fingerprinting и invisible watermarking.
Это принципиально важно:
детектор пытается сделать вывод о происхождении. Provenance пытается сохранить сведения о происхождении.
Это две разные задачи.
14. Почему я считаю официальное скачивание принципиально важным
Для автора, работающего с генеративной платформой, я бы сформулировал очень простое практическое правило:
Результат совместной работы необходимо получать с платформы официально предусмотренным способом — через её функцию Download — и сохранять первоначально полученный файл.
Особенно показателен здесь Suno.
В условиях, вступающих в силу 3 сентября 2026 года, Suno прямо связывает разрешённое коммерческое использование соответствующего Output с получением permitted Download через утверждённый канал платформы. Получение копии другими способами, включая stream ripping или запись воспроизведения, запрещается.
Более того, Suno оставляет за собой право добавлять к Output:
fingerprint, watermark или metadata, указывающие применимый service tier и то, являлся ли файл разрешённым Download. Условия также запрещают удалять, скрывать или обходить такие элементы с целью исказить происхождение, тарифный уровень или статус Output.
Поэтому официальный Download — это уже не просто кнопка:
«сохранить WAV».
Он потенциально является частью цепочки происхождения и правомерного получения файла.
15. Что именно хранится внутри файла?
Здесь необходимо быть особенно аккуратными.
Мы можем утверждать только то, что подтверждено документацией.
Suno прямо говорит о возможности указания:
- provenance;
- service tier;
- permitted Download status.
Но публичные условия не дают основания утверждать, что в каждом скачанном аудиофайле обязательно зашифрованы имя пользователя, адрес, платёжные данные или иные персональные сведения.
Это важно исправить в распространённом представлении о provenance.
Более того, C2PA специально предусматривает защиту приватности: происхождение контента не обязано включать реальную личность человека. Стандарт допускает различные модели идентификации и прямо рассматривает privacy как одну из целей архитектуры.
Следовательно, правильнее говорить так:
Платформа может обладать значительно большим объёмом информации об истории создания и получения файла, чем пользователь видит внутри обычных метаданных WAV или MP3.
Файл, серверные записи, аккаунт, fingerprint, watermark и история Download могут быть разными уровнями одной системы.
16. Зачем платформам вообще нужна такая информация?
Причин несколько.
Защита происхождения
Можно установить связь цифрового объекта с определённым процессом создания или системой.
Споры о правах
История создания, аккаунта и разрешённого получения Output потенциально может иметь значение при разбирательствах.
Борьба с массовым злоупотреблением
Платформы заинтересованы в отличии нормального творческого процесса от автоматизированного массового извлечения контента.
Статистика использования
Необходимо понимать, какие инструменты используются, каким образом и насколько активно.
Улучшение продукта
Usage data позволяет изучать реальные рабочие процессы и совершенствовать модели и интерфейсы.
Формирование доверия
Именно эту задачу решает более широкое движение Content Credentials: не пытаться угадать происхождение по внешнему виду или звучанию, а создавать проверяемую историю цифрового объекта.
17. Самая сложная категория — hybrid production
Представим запись:
текст — человек; музыка — человек; вокал — живой; гитара — живая; бас — живой; барабаны — живые;
но затем материал прошёл через AI-assisted arrangement, reconstruction, processing или mastering.
Сколько процентов AI содержится в такой песне?
10%?
40%?
60%?
Сам вопрос может быть поставлен неправильно.
Нет универсальной физической единицы:
«один процент искусственного интеллекта».
Процент, выдаваемый публичным детектором, — это не обязательно процент творческого вклада AI.
Он может быть результатом классификации признаков сигнала.
Это принципиально разные вещи.
18. Мой собственный незаконченный эксперимент
Именно поэтому мне стало интересно проверить эту проблему практически.
У меня есть песня, которая первоначально была полностью спета мной и сыграна живыми музыкантами.
Позднее запись прошла обработку с использованием AI-инструментов.
Я сознательно поставил ей соответствующую маркировку.
Но мне стало интересно пойти дальше.
Я пропустил материал через один из публичных AI-detectors и получил оценку порядка 50–60% AI.
Для меня это не означает:
«половину песни создал искусственный интеллект».
Я точно знаю историю этой записи.
Поэтому результат означает другое:
детектор обнаружил в финальном сигнале характеристики, которые его модель связывает с AI.
Эксперимент пока не закончен.
И именно поэтому окончательных выводов из него я пока делать не хочу.
Мне интересен результат.
19. Следующий эксперимент
А теперь мне хочется провести эксперимент ещё проще.
Полностью написать песню самому.
Полностью сыграть её самому.
Спеть самому.
Зафиксировать весь процесс создания.
И затем поставить на готовую запись маркировку об использовании AI.
Не для того, чтобы скрыть происхождение.
Наоборот.
Настоящее происхождение должно быть заранее задокументировано и после завершения эксперимента раскрыто.
Но некоторое время аудитория будет знать только одно:
AI was used.
И дальше начинается самое интересное.
20. Что услышит общество?
Будут ли люди находить AI там, где его нет?
Скажет ли кто-нибудь:
«Вот здесь сразу слышно, что барабаны AI»,
если я буду знать и иметь запись того, как сыграл эту партию сам?
Услышит ли кто-нибудь:
«характерная AI-гитара»,
если она была сыграна моими руками?
Назовёт ли кто-нибудь мой собственный голос синтетическим?
Будут ли технически образованные слушатели объяснять, какие именно признаки AI они услышали?
Изменится ли отношение к самой песне?
Изменятся ли комментарии?
Будет ли меньше эмоциональных реакций?
Изменится ли оценка качества?
И что особенно интересно:
изменит ли человек своё мнение о музыке после того, как узнает правду?
21. А затем раскрыть происхождение
Вторая часть эксперимента важнее первой.
Показать исходные записи.
Показать процесс исполнения.
Показать происхождение материала.
И сказать:
вот вокал.
вот барабаны.
вот гитара.
вот музыкант.
После этого можно исследовать уже совершенно другую реакцию.
Что произойдёт с человеком, который пять минут назад со стопроцентной уверенностью объяснял, почему барабаны являются AI?
Он изменит мнение?
Признает ошибку?
Начнёт искать другое объяснение?
Перенесёт «AI-признак» на другой элемент?
Или заявит, что AI всё равно каким-то образом присутствует?
22. В этот момент эксперимент перестаёт быть экспериментом об искусственном интеллекте
Объект исследования меняется.
Теперь объект исследования —
мы сами.
Наше восприятие.
Наши ожидания.
Предубеждения.
Confirmation bias.
Доверие к маркировке.
И удивительная человеческая способность сначала сформировать убеждение, а потом найти в воспринимаемом объекте доказательства этого убеждения.
Исследования уже показывают, что это не просто философское предположение.
В эксперименте с 399 участниками сама маркировка музыки как AI уменьшала склонность слушателей видеть в ней человеческий нарратив — независимо от настоящего происхождения произведения.
А исследование профессионально подготовленных слушателей показывает противоположную сторону той же проблемы: даже без маркировки люди крайне ненадёжно определяют реальное происхождение музыкального материала.
Соедините эти два результата.
И получается чрезвычайно интересная гипотеза:
мы всё хуже способны определить AI по самой музыке — но информация о присутствии AI всё ещё способна изменить то, что мы в этой музыке слышим.
23. Что сегодня действительно можно доказать?
Поэтому я предлагаю разделять четыре совершенно разных утверждения.
| УровеньЧто мы реально знаем | |
|---|---|
| «Я слышу AI» | Субъективное впечатление слушателя |
| Акустический анализ | В сигнале присутствуют определённые технические характеристики |
| AI detector: X% | Конкретная модель классифицировала сигнал с определённой вероятностью |
| Provenance | Существуют проверяемые сведения о происхождении и истории объекта |
Первое не заменяет второе.
Второе не заменяет третье.
А третье не заменяет четвёртое.
Особенно важно:
вероятность, которую показывает детектор, не является процентом авторства AI.
24. Почему меня забавляет фраза «я слышу AI»
Не потому, что человеческий слух бесполезен.
Напротив.
Опытный музыкант и звукорежиссёр способны услышать невероятно тонкие особенности исполнения и производства.
Меня забавляет другое:
уверенность, с которой субъективное впечатление иногда превращают в утверждение о происхождении произведения.
Человек может услышать плохой transient.
Но он не знает, появился ли он при генерации, после компрессии или при мастеринге.
Он может услышать идеально ровные барабаны.
Но он не знает, сгенерированы они или живой барабанщик был quantized.
Он может услышать странную гитару.
Но не знает, была ли она сгенерирована или пропущена через amp simulation и последующую обработку.
Он может услышать идеально чистый вокал.
Но не знает, перед ним voice generation или настоящий певец после Melodyne.
Мы слышим результат.
Мы не слышим историю файла.
25. И человек, понимающий инструмент, способен двигаться в обе стороны
Это, пожалуй, один из главных выводов.
Чем глубже музыкант понимает генеративный инструмент, тем меньше AI становится кнопкой:
«Сделай мне песню».
Он становится ещё одним инструментом production environment.
И человек может использовать его совершенно по-разному.
Можно стремиться сохранить человеческую неровность.
Можно её уничтожить.
Можно сделать генеративный материал более органичным.
Можно намеренно сделать живое исполнение более механическим.
Можно сохранить живой вокал практически нетронутым.
Можно обработать живой вокал так, что слушатель будет уверен в его искусственном происхождении.
Поэтому человек, понимающий принципы работы современных инструментов, действительно способен двигаться в обе стороны — в зависимости от творческой задачи.
И именно здесь попытка определить происхождение произведения исключительно по слуху начинает терять смысл.
26. Возможно, мы задаём неправильный вопрос
Дискуссия вокруг AI-музыки слишком долго строилась вокруг вопроса:
«Использовался ли AI?»
Но современное производство делает этот вопрос почти бессодержательным.
Гораздо важнее:
Кто написал произведение?
Кто его исполнил?
Какие элементы были сгенерированы?
Какие элементы были преобразованы?
Что сделал человек?
Что сделал алгоритм?
Каков подтверждаемый provenance произведения?
И наконец:
что именно сделал AI?
Заключение
Возможно, мы уже приближаемся к моменту, когда понятия «AI sound» как универсального акустического признака просто не существует.
Существуют статистические признаки.
Существуют артефакты.
Существуют детекторы.
Существуют fingerprints.
Существуют watermarks.
Существуют metadata.
И существуют системы provenance.
Но это разные уровни информации.
Blind listening показывает, насколько ненадёжно человеческое определение происхождения музыки: в свежем исследовании даже подготовленные музыканты ошибочно классифицировали 54,7% полностью человеческих произведений, а AI-generated и human–AI collaborative материалы определяли практически на уровне случайного выбора.
Одновременно исследования показывают, что одна только надпись AI способна изменить наше восприятие совершенно независимо от настоящего происхождения музыки.
И поэтому, возможно, следующий этап разговора об AI и музыке должен начаться не с попытки доказать:
«Я слышу AI».
А с гораздо более серьёзного вопроса:
«Что я действительно знаю о происхождении этой записи — и что я просто решил услышать после того, как мне сказали, как она была создана?»
И именно поэтому мне хочется провести этот эксперимент.
Не для того, чтобы доказать, что искусственный интеллект победил человека.
И не для того, чтобы доказать обратное.
А чтобы посмотреть, что произойдёт с нашим восприятием музыки в тот момент, когда знание о её происхождении и наше представление об этом происхождении перестанут совпадать.
Возможно, результат этого эксперимента расскажет нам об искусственном интеллекте гораздо меньше, чем мы ожидаем.
Но о нас самих — значительно больше.
Alex Kryve Music & AI Initiative The Lab · August 2026