← К оглавлению
Alterna · глава 21.1

Цифровой звук

Акустика, PCM, дискретизация, квантование, многоканальный звук, форматы и кодеки.

01

Физика звука

Как устроен звук: частота, амплитуда, диапазон слышимости

ФГОСОГЭ №3,4

Звуковая волна

Звук — это механическая волна, распространяющаяся в упругой среде (воздух, вода, твёрдое тело). Источник звука колеблется, создавая чередование сжатий и разрежений воздуха. Человеческое ухо воспринимает эти колебания как звук.

Частота — число колебаний в секунду, измеряется в герцах (Гц). Определяет высоту звука: высокая частота = высокий тон.

Амплитуда — максимальное отклонение от положения равновесия. Определяет громкость звука. Измеряется в децибелах (дБ): 0 дБ — порог слышимости, 60 дБ — разговор, 120 дБ — болевой порог.

20 Гц
Нижняя граница слышимости (бас-гитара, орган)
20 кГц
Верхняя граница (свист, летучие мыши)
Важно Человек слышит частоты от 20 Гц до 20 кГц. Примеры: мужской голос ~100–250 Гц, женский ~250–400 Гц, скрипка ~200 Гц–4 кГц, писк ~4 кГц.
🎵 Интерактивная визуализация звуковой волны
02

PCM: дискретизация и квантование

Как аналоговый сигнал превращается в цифровой

ФГОСФОПОГЭ №3,4ЕГЭ №7

Формула объёма аудиофайла

Это расширение формулы из главы 9.4. Для звука формула учитывает частоту дискретизации, глубину кодирования и количество каналов:

V = R × t × i × K / 8

R — частота дискретизации (Гц), t — время (с), i — разрядность (бит), K — количество каналов. Результат — в байтах.

📊 PCM-визуализация: дискретизация и квантование

Задача: объём аудиофайла

Стереозапись длительностью 3 минуты, частота дискретизации 44 100 Гц, разрядность 16 бит. Объём = 44100 × 180 × 16 × 2 / 8 = 31 824 000 байт ≈ 30.4 МБ.

03

Частота дискретизации и теорема Найквиста

Почему CD использует 44.1 кГц и как выбирать частоту

ФГОСФОП

Теорема Найквиста — Котельникова

Чтобы точно восстановить аналоговый сигнал из цифрового, частота дискретизации должна быть минимум в 2 раза выше максимальной частоты в сигнале:

Rmin = 2 × Fmax

Человек слышит до 20 кГц → минимальная частота дискретизации = 40 кГц. Для запаса используют 44.1 кГц (CD) или 48 кГц (video).

ЧастотаПрименениеМакс. частота сигналаКачество
8 000 ГцТелефон, VoIP4 кГцРазборчивость речи
22 050 ГцРадио, сжатое аудио11 кГцFM-качество
44 100 ГцAudio CD, MP322.05 кГцПолный диапазон
48 000 ГцВидео, профессиональное24 кГцСтудийное
96 000 ГцHi-Res, студия48 кГцВысокое разрешение
192 000 ГцSACD, DSD96 кГцУльтра-Hi-Res
CD-качество Audio CD: 44 100 Гц / 16 бит / стерео. Битрейт = 44100 × 16 × 2 = 1 411 200 бит/с ≈ 1411 кбит/с (bitrate). Минута стерео = ~10.6 МБ без сжатия.
04

Многоканальный звук

От моно до Dolby Atmos: конфигурации акустических систем

ФГОСФОП
🔇 Моно (1.0)

Один канал. Применяется в радио, подкастах, телефонной связи. K = 1. Объём в 2 раза меньше стерео.

🎧 Стерео (2.0)

Два канала: L (левый) и R (правый). Стандарт для музыки, фильмов, игр. K = 2.

🔊 Квадро (4.0)

FL, FR, RL, RR. Используется в концертном звуке и старых системах домашнего кинотеатра.

🎬 5.1

FL + FR + FC (центр) + LFE (сабвуфер) + RL + RR. Стандарт домашнего кинотеатра, DVD, Blu-ray.

🎧 7.1

Добавлены боковые каналы (SL, SR) к 5.1. Используется в современных кинотеатрах и играх.

🏠 7.1.4 (Dolby Atmos)

Добавлены 4 потолочных/верхних канала. Объектно-ориентированный звук: звук как «объект» в 3D-пространстве.

🔊 Интерактивная схема акустических систем
Выберите конфигурацию
05

Аудиоформаты и кодеки

Сжатие, битрейт, сравнение форматов

ФГОСОГЭ №3,4
📂 WAV — несжатый PCM
Без сжатия · 1411 кбит/с (CD)

Формат Microsoft/IBM: аудиоданные хранятся как «сырой» PCM-поток. Точность 100%, но большой размер. Минута стерео 44.1 кГц/16 бит = ~10.6 МБ.

📂 FLAC — Free Lossless Audio Codec
Без потерь · ~600–900 кбит/с

Сжимает аудио без потерь ( reversible). Типичное сжатие 30–50% по сравнению с WAV. Идеален для архивов и студийной записи.

📂 MP3 — MPEG-1 Audio Layer 3
С потерями · 128–320 кбит/с

Первый массовый формат сжатия с потерями. Удаляет «несущественные» частоты (психоакустическая модель). При 128 кбит/с — потеря качества заметна при сравнении; при 320 кбит/с — большинство не слышит разницы.

📂 AAC — Advanced Audio Coding
С потерями · 128–320 кбит/с

Преемник MP3. Лучше сжатие при том же качестве (примерно на 30%). Используется в iTunes, YouTube, Spotify, Bluetooth-аудио.

📂 OGG Vorbis
С потерями · 128–320 кбит/с

Открытый свободный кодек. Качество сопоставимо с AAC, но менее распространён. Используется в играх и стриминге.

📂 DSD — Direct Stream Digital
1-бит · 2.8–11.2 МГц

Используется в SACD (Super Audio CD). Очень высокая частота дискретизации (2.8224 МГц — в 64 раза выше CD) и 1-битное квантование. «Передискретизация» из PCM.

📈 Сравнение битрейтов и размера файла
MP3 128
~1.1 МБ/мин
MP3 192
~1.6 МБ/мин
MP3 320
~2.7 МБ/мин
AAC 256
~2.1 МБ/мин
FLAC
~5 МБ/мин (lossless)
WAV
~10.6 МБ/мин
Одна минута стерео, 44.1 кГц/16 бит. Сравните потери при 128 кбит/с и качество lossless.
🌊 Спектрограмма: сравнение форматов
Выбор формата Архив / студия: FLAC (lossless, сжатие 30–50%). Музыка для плеера: AAC 256 или MP3 320. Веб / стриминг: AAC 128 или OGG. Телефон / VoIP: Opus или AMR (8–64 кбит/с).
06

Аудиоинтерфейсы и разъёмы

Как звук попадает в компьютер и обратно: аналоговые, цифровые и сетевые интерфейсы

ФГОСФОПОГЭ №7
🔌 3.5 мм (Mini-Jack)

Аналоговый стерео: TRS (tip-ring-sleeve) — левый, правый, земля. Стандарт для наушников, колонок, микрофонов. Не защищён от помех, длина кабеля до ~3 м.

🎤 XLR (3-pin)

Балансный аналоговый: 3 контакта (hot, cold, ground). Симметричная передача — помеха вычитается. Длина до 100 м. Стандарт для студийных микрофонов и профессиональной аппаратуры.

🎸 Jack 6.35 мм (TRS/TS)

Увеличенный Mini-Jack: TS (mono) или TRS (stereo/balanced). Используется в гитарных усилителях, микшерах, профессиональных наушниках.

光纤 TOSLINK

Оптоволоконный цифровой: передаёт S/PDIF (стерео PCM до 96 кГц/24 бит) или многоканальный Dolby/DTS. Не подвержен ЭМ-помехам, длина до 10 м.

📡 S/PDIF (коаксиальный)

Цифровой через коаксиальный RCA-кабель: 75 Ом, до 96 кГц/24 бит. Альтернатива TOSLINK, но электрическая — подвержен помехам.

🔗 USB Audio

Цифровой через USB: USB 1.1 (16 бит/48 кГц), USB 2.0 (24 бит/192 кГц), USB 3.0. Классы USB Audio 1.0/2.0/3.0. Питание от шины (48 мА). Стандарт для внешних声卡.

📊 Сравнение интерфейсов
Интерфейс Тип Макс. частота Каналы Длина кабеля Применение
3.5 мм Аналог 2 (стерео) ~3 м Наушники, колонки
XLR Баланс 1 (mono) 100 м Микрофоны, студии
Jack 6.35 Аналог 1–2 ~10 м Гитары, микшеры
TOSLINK Цифр (оптика) 96 кГц/24 бит 2–8 10 м Home theatre, DAC
S/PDIF Цифр (коакс) 96 кГц/24 бит 2–8 10 м AV-ресиверы
USB Audio Цифр (USB) 192 кГц/24 бит до 128 5 м (USB 2.0) Внешние声卡
HDMI ARC Цифр 192 кГц/24 бит до 8 15 м ТВ, звуковые панели
Аналог vs Цифр Аналоговые интерфейсы (3.5 мм, XLR, Jack) передают непрерывный электрический сигнал — качество зависит от кабеля и помех. Цифровые (TOSLINK, S/PDIF, USB) передают биты — сигнал не искажается, но необходимы ЦАП (DAC) для преобразования в звук.
07

Психоакустическая модель

Почему MP3 звучит нормально при малом битрейте: как ухо «обманывает» кодек

ФГОСЕГЭ №7
👂 Маскировка (masking)

Громкий звук скрывает тихий рядом по частоте и во времени. Кодек удаляет замаскированные компоненты — мы их не слышим. Временна́я: перед громким звуком тихий не различим. Частотна́я: рядом с громким тоном тихие тоны не слышны.

📉 Порог слышимости

Нижняя кривая на графике: звуки ниже порога не воспринимаются. Зависит от частоты — на 3–4 кГц ухо максимально чувствительно (эволюция: частота детского крика). Ниже 20 Гц и выше 20 кГц — неслышимо.

🎚 Критическая полоса

Ухо анализирует спектр полосами ~1/3 октавы (критические полосы Баркла-Хэмпстона). Внутри полосы звуки взаимодействуют (маскируют), между полосами — независимы. MP3 группирует частоты по полосам.

🧠 Стерео-маскировка

Если L и R почти одинаковы, кодек кодирует как Mono + «разностный» канал с низким битрейтом. Экономия ~30% битрейта без потери ощущения стерео-пространства.

📈 Порог слышимости и маскирующий сигнал
📊 Шкала децибел: от шёпота до ракеты
Наведите на график: яркий сигнал — маскирует тихие вокруг
Как MP3 использует психоакустику MP3 (MPEG-1 Layer 3) разбивает спектр на 32 поддиапазона, вычисляет порог маскирования для каждого, и распределяет биты: больше бит — громкие компоненты, меньше — тихие/замаскированные. При 128 кбит/с удаляются частоты выше ~16 кГц (за пределами критических полос) и замаскированные компоненты. При 320 кбит/с удаление минимально.
08

Аудиомикшер

Web Audio API: смешивание каналов в реальном времени

ФГОСФОП
🎚️ Интерактивный микшер 5.1

Регулируйте громкость каждого канала, панорамируйте (L/R), включайте/выключайте. Нажмите «Генерировать тон» для воспроизведения.

Нажмите «Генерировать тон» для запуска
🎯

Мини-тест: 5 вопросов

XP: 0
🧩Быстрый тест по теме

Проверь себя! 5 вопросов, 20 XP за каждый правильный ответ.