Частотный диапазон человеческого голоса — из чего он складывается, где находится основной тон, как работают гармоники и насколько далеко может простираться спектр реального голосового сигнала. Разбираем теорию и необычный практический эксперимент со спектроанализатором.
Частотный диапазон человеческого голоса нельзя свести к одной цифре. В голосовом сигнале есть основной тон, который формируется работой голосовых связок, его гармоники, резонансы тела и голосового тракта, а также высокочастотные составляющие, возникающие при артикуляции.
В этой статье мы посмотрим, как частотный диапазон человеческого голоса работает на практике. Поводом для эксперимента стал необычно высокий детский визг, который был записан, а затем исследован с помощью спектроанализатора.
Автор эксперимента — саундпродюсер студии «Рекламофон», профессионально занимающийся музыкой и звуком. Основная работа студии связана с рекламным аудиоконтентом, поэтому анализ человеческого голоса имеет вполне прикладное значение и для звукозаписи.
Всё началось не в лаборатории, а дома. После рождения дочери я обратил внимание на одну особенность: когда ребёнок хотел привлечь внимание, выражал недовольство или просто радовался игре, он иногда издавал настолько высокий и пронзительный визг, что после него буквально звенело в ушах.
Для обычного родителя это просто очередной громкий детский звук. Для человека, который много лет занимается записью и обработкой звука, возник другой вопрос: какие частоты на самом деле присутствуют в таком голосовом сигнале?
Профессиональный слух подсказывал, что дело не только в громкости. Спектр казался необычно высокочастотным — настолько, что захотелось проверить ощущения инструментально.
Отдельно о профессиональной работе с голосом можно посмотреть материал о выборе диктора или актёра для записи, а более широкий взгляд на анализ звука есть на странице «Звуком можно исследовать мир».
Для эксперимента удачно совпали три обстоятельства:
Многолетняя работа со звуком действительно тренирует аналитическое восприятие. Похожая тема затрагивается и в статье о сходстве и плагиате в песнях и музыкальных треках.
Для начала — короткое объяснение частотного диапазона человеческого голоса. Частотный спектр голоса — это совокупность составляющих частот, присутствующих в звуковом сигнале.
Упрощённо голос можно представить как сочетание нескольких компонентов:
Именно поэтому частотный диапазон человеческого голоса и высота основного тона — не одно и то же. Например, фундаментальная частота может находиться на сотнях герц, но в спектре одновременно присутствуют гармоники значительно выше неё.
Это особенно важно при профессиональной записи голоса диктора. О том, как резонансы и особенности голоса проявляются при студийной записи, можно дополнительно прочитать в статье о профессиональной записи диктора.
Для простого понимания спектра человеческого голоса удобно условно разделить его на две части.
Первая — тональная: работа связок, основной тон, гармоники и резонансы. Вторая — артикуляционная: шумовые составляющие речи, которые особенно заметны в согласных.
Мы сталкивались с этим ещё в школе, когда изучали звонкие и глухие согласные. В звуках «Д», «В», «Ж», «Г» присутствует работа голосовых связок, тогда как при произнесении «Т», «Ф», «Ш», «К» значительную роль играет шум, создаваемый артикуляцией.
Поэтому вопрос «какой частотный диапазон у человеческого голоса» требует уточнения: речь идёт об основном тоне или обо всём спектре уже сформированной речи?
Практический пример того, насколько спектр можно ограничить и всё равно сохранить разборчивость речи, — телефония.
Помимо производства медиаконтента и проектов Russian Voiceover, студия выполняет записи телефонных приветствий и голосовых меню.
В телефонных системах часто используется существенно более узкая полоса, чем полный спектр студийной записи. В исходном примере статьи приводится диапазон порядка 300–3400 Гц. Низких частот в таком голосе заметно меньше, но разборчивость речи сохраняется достаточно хорошо.
Это хороший пример применения частотного диапазона человеческого голоса в аудиорекламе: конечный технический носитель определяет, какую часть исходного спектра действительно имеет смысл сохранять.
В исходной статье в качестве ориентира используется традиционно приводимый диапазон человеческого слуха примерно от 20 Гц до 20 кГц. Верхняя граница индивидуальна и с возрастом обычно уменьшается.
При этом технический формат записи тоже влияет на то, какая часть спектра останется в готовом файле. В сжатом аудио верхние частоты могут быть ограничены алгоритмом кодирования.
Подробнее о практической работе с форматом MP3 можно прочитать в статье MP3 в моно или стерео.
А пример того, почему одних технических параметров недостаточно для хорошего рекламного результата, есть в материале о двух примерах неудачной рекламы из нашей работы.
С этими ориентирами — спектром человеческого голоса и воспринимаемым слухом диапазоном — и сравним экспериментальную запись.
Для исследования требовалась запись, способная сохранить как можно больше высокочастотной информации.
Большие студийные микрофоны из нашего парка оборудования для этой конкретной задачи казались не самым очевидным вариантом. В статье отдельно упоминается влияние конструкции микрофона и даже ламповых каскадов на высокочастотную составляющую.
Поэтому для эксперимента использовался портативный рекордер Zoom H6 с записью в формате 96 кГц / 24 бит.
Первая попытка сразу показала другую проблему — визг оказался настолько громким, что входной сигнал клиповал. Такая запись для анализа не подходит: перегруз сам создаёт дополнительные спектральные составляющие и мешает увидеть естественный спектр.
Пришлось увеличить расстояние до источника. После нескольких попыток удалось получить дубль без перегруза, пригодный для дальнейшего анализа.
После записи сигнал был перенесён в компьютер, нормализован по пиковому уровню и исследован спектральными анализаторами.
В момент максимальной высоты визга анализатор показал очень необычную картину.
В исходном эксперименте основной тон оказался примерно в районе 4 кГц, а видимые гармонические составляющие простирались почти до верхней границы измеряемого спектра — порядка 50 кГц.
Именно здесь особенно хорошо видно, почему основной тон и полный частотный диапазон человеческого голоса нельзя считать одним и тем же параметром.
Один статичный спектр показывает только конкретный момент. Поэтому интереснее посмотреть развитие сигнала во времени.
На спектрограмме хорошо прослеживается восходящее движение тона, короткая пауза и последующее нисходящее глиссандо. Вместе с основным тоном перемещаются и его гармоники.
На следующем изображении основной тон и расположенные выше гармоники видны ещё нагляднее.
Разные анализаторы и способы отображения дают несколько отличающуюся визуальную картину. Но неизменными остаются хорошо выраженный основной пик и следующие за ним гармонические составляющие.
На следующем скриншоте соотношение основного тона и обертонов особенно хорошо читается визуально.
Из проведённого эксперимента автор статьи выделил несколько наблюдений:
Эти результаты хорошо иллюстрируют одну из основных особенностей частотного диапазона человеческого голоса: высота воспринимаемой ноты — лишь одна составляющая сложного спектра.
Если хотите повторить измерения самостоятельно, исходный сигнал сохранён в WAV: скачать запись визга в формате 96 кГц / 24 бит.
Его можно открыть в аудиоредакторе или спектральном анализаторе и самостоятельно посмотреть расположение основного тона и гармоник.
В исходной статье отдельно рассматривается возможное возражение: чем короче импульс, тем шире может становиться его спектр. Поэтому теоретически резкий щелчок способен создать высокочастотные составляющие.
Но в данной записи автор сравнивает эту гипотезу с фактической осциллограммой и спектрограммой.
В качестве аргументов приводятся следующие особенности:
Одна из типичных ошибок при объяснении частотного диапазона человеческого голоса — взять только частоту основного тона и назвать её всем диапазоном голоса.
На практике необходимо различать:
Для заказчика студийной записи это означает простую вещь: характеристики голоса нельзя оценивать только одной цифрой в герцах. Итоговое восприятие зависит от тембра, дикции, микрофона, обработки и среды, где запись будет воспроизводиться.
Для слушателя вся эта теория может оставаться незаметной. Но при профессиональном производстве она используется постоянно: при выборе микрофона, эквализации, компрессии, подготовке телефонного звука, сведении рекламы и работе с разными типами голосов.
Именно поэтому частотный диапазон человеческого голоса в аудиорекламе — не абстрактная физическая характеристика, а один из рабочих инструментов звукорежиссуры.
Если требуется профессиональная запись рекламного материала, на главной странице можно записать рекламный ролик в студии.
Продолжить тему можно в разделе статей студии «Рекламофон».
Автор статьи также занимается созданием и обработкой звука и преподаванием вокала онлайн.
Ещё один технический материал: уникальный ламповый студийный прибор TotalTube.