Большинство конвертаций портят звук не субъективно, а измеримым образом: добавляют искажения, шум и необратимо теряют информацию.
Физика звука: непрерывная волна → дискретные точки
Реальный звук- это непрерывная функция давления воздуха во времени (аналоговая волна).
Цифровой звук - это дискретные отсчёты + округлённые значения амплитуды.
При любом конвертировании мы:
- дискретизируем (берём точки),
- квантуем (округляем),
- сжимаем (выбрасываем данные).
Каждый шаг приводит к необратимой потере части информации.
Математика дискретизации: теорема Найквиста-Шеннона
Чтобы восстановить оригинальную волну без искажений, частота дискретизации \( f_s \) должна быть строго больше двойной максимальной частоты сигнала:
... это стандарт Red Book (IEC 908), принятый для совместимости с аудио‑CD.
44.1 кГц выбрано именно для CD (исторически связано с совместимостью с видеоносителями и частотой дискретизации 48 кГц). Что происходит при плохом ресэмплинге (самая частая ошибка при конвертации CD ↔ 48 кГц):
Если анти-алиасинговый фильтр слабый или отсутствует, частоты выше \( f_s/2 \) складываются обратно в слышимый диапазон. Это называется алиасинг...Математически:
Результат:
вместо чистого 15 кГц появляется нежелательные спектральные компоненты на частоте 5 кГц (побочные тона на 5 кГц) или Металлический оттенок в звучании.
Большинство онлайн-конвертеров используют дешёвые (простые) фильтры (упрощённые фильтры) → алиасинг + 10–30 дБ искажений.
SSRC с fast=false как раз использует фильтр очень высокого порядка (сотни тапов), поэтому почти не даёт алиасинга.
Квантование и потеря битности (24 бит → 16 бит)
Каждый бит даёт ≈6 дБ динамического диапазона. Формула отношения сигнал/шум квантования:
- 16 бит (CD) → теоретически 98 дБ - это теоретический максимум при идеальном квантовании; на практике динамический диапазон ниже из‑за шума и нелинейностей.
- 24 бит → 146 дБ
При
понижении битности без dithering ошибка квантования становится коррелированной с сигналом → появляются
гармонические искажения (не случайный шум, а регулярные призвуки). dithering (добавление шума малого уровня) предотвращает коррелированные искажения при понижении битности.
Математически это
нелинейная операция - ошибка квантования коррелирует с сигналом.
Повторное понижение битности каждый раз поднимает шумовой пол на 6–12 дБ. Это приблизительная оценка; точный прирост
зависит от алгоритма и сигнала
Lossy-сжатие MP3: почему оно портит даже один раз
MP3 использует психоакустическую модель + преобразование MDCT. Алгоритм выбрасывает частотные компоненты, которые считает "неслышными". Психоакустическая модель также учитывает маскировку сигналов (временную и частотную), что влияет на восприятие потерь.
Но модель приблизительная. Она плохо работает:
- на тихих сигналах,
- на сложных гармониках (скрипка, фортепиано),
- на транзиентах (ударные).
При повторном кодировании/декодировании (многократное перекодировании):
- ошибки накапливаются нелинейно,
- появляются пре-эхо, "птички" (высокочастотные щелчки или же кратковременные высокочастотные артефакты) , потеря стерео и плоский верх (потеря высокочастотной детализации).
После 3–5 циклов MP3 → WAV → MP3 искажения уже измеряются десятками процентов по THD+N...
по данным измерений с использованием анализатора Audio Precision
===
Каждый шаг:
- добавляет алиасинг и квантование,
- усиливает шум,
- теряет 10–20 % динамики.
Физически: Физически информация необратимо утрачена, её нельзя восстановить.
Математически: Информационная энтропия сигнала снижается…, шум растёт.
Итог (подтверждено измерениями)
- Однократная правильная конвертация (CD/винил → MP3 320 кбит/с с хорошим LAME и dithering) - потери терпимы.
- Любая повторная конвертация - гарантированно добавляет искажения, видимые на FFT-анализаторе.
Поэтому всегда работают в WAVE 24/96 (192) до самого последнего шага, а в lossy конвертируют только один раз по заявке. Оптимальная практика - работать только с файлами БЕЗ ПОТЕРЬ.