Методы и стандарты
Предыдущая
Содержание
Дальше
1. Импульсно-кодовая модуляция (PCM - Pulse-Code Modulation)
2. m-Law и A-Law кодирование
3. Помехоустойчивость методов ИКМ
4. Методы эффективного кодирования речи
5. Линейное предсказание
Речь представляет собой колебания сложной формы, зависящей от
произносимых слов, тембра голоса, интонации, пола и возраста
говорящего.
Сжатие речи при ее передаче сокращает объем передаваемых данных,
затраты и, благодаря этому, позволяет снижать цены на услуги и
привлекать новых пользователей. Именно поэтому рынок цифровой
телефонии развивается под непосредственным технологическим диктатом
ученых и разработчиков кодеков речи.
Очевидно, что только начиная с каких-то пороговых значений
соотношения скорости передачи и доступной емкости каналов операторы
связи имеют достаточную (для развития и своего, и рынка) прибыль. В
настоящее время можно сказать, что этот порог уже превышен. Это
привело к тому, что расценки на цифровую связь стали более чем
конкурентны по сравнению с проводной аналоговой, а благодаря скорому
переходу к кодекам речи на скорости порядка 2,4 кбит/с и ниже, цена
минуты междугородного разговора может в ближайшие годы снизиться до
нескольких центов за минуту. Тут уже из-за массовости услуги можно
говорить о сверхприбылях, и неудивительно, что только ленивый на
рынке сегодня не косит глаз в сторону услуг передачи речи.
Сказав про успехи, нельзя не сказать хотя бы пару слов и о
недостатках. Качество звучания сжатой речи, что в сотовой, что в
Интернет-телефонии, мягко говоря, "не очень". Некоторые (из тех,
конечно, кто имеет такой выбор) до сих пор предпочитают аналоговые
сотовые сети цифровым, поскольку в последних речь часто звучит
механически, случаются посторонние звуки и т. п. - и все из-за
сжимающих кодеков речи, так как в остальном цифровые протоколы
передачи обеспечивают лучшее качество звучания. В компьютерной
телефонии снижению качества мы, помимо кодеков речи, обязаны
заметным запаздываниям сигнала и ошибкам при сборке пакетов.
Впрочем, это болезни роста: понятно, что если с кодеком на 2,4
кбит/с "узкий" канал справляется с трудом, то на скорости 1,2 кбит/с
проблем будет меньше. Да и пропускная способность компьютерных сетей
возрастает настолько быстро, что в ближайшей перспективе сетевая
задержка снизится в несколько раз и дефекты сборки пакетов будут
маловероятны или исчезнут. И тогда и у пользователей, и у операторов
на первое место могут встать высокие требования именно к
низкоскоростным кодекам речи.
Спектр речи весьма широк (примерно от 50 до 10000 Гц), но для
передачи речи в аналоговой телефонии когда-то отказались от
составляющих, лежащих вне полосы 0,3-3,4 кГц, что ухудшило
восприятие ряда звуков (например, шипящих, существенная часть
энергии которых сосредоточена в верхней части речевого спектра), но
мало затронуло разборчивость. Ограничение частоты снизу (до 300 Гц)
также ухудшает восприятие из-за потерь низкочастотных гармоник
основного тона. А в цифровой телефонии к влиянию ограничения спектра
добавляются еще шумы дискретизации, квантования и обработки,
дополнительно зашумляющие речь.
Решающими в выборе полосы 0,3-3,4 кГц были экономические
соображения и нехватка телефонных каналов. Более того, в те времена,
когда время ожидания заказанного разговора составляло десятки часов,
экономические ограничения привели к установке на
трансконтинентальных линиях США и атлантическом кабеле так
называемой аппаратуры J2, каналы которой и вовсе имели полосу
0,3-1,7 кГц. Такая аппаратура некогда работала и на линии
Москва-Владивосток. Качество ее каналов едва достигало двух баллов
MOS, но решающим оказалось двукратное увеличение числа телефонных
соединений. Потребности пользователей в каналах сделали тогда
вопросы качества речи второстепенными. Для совместимости по полосе с
распространенными аналоговыми сетями в цифровой телефонии отсчеты
аналоговой речи приходится брать согласно теореме Котельникова с
частотой 8 кГц - не меньше двух отсчетов на 1 Гц полосы. Правда, в
цифровой телефонии существует принципиальная возможность
использовать спектр речи за пределами полосы 0,3-3,4 кГц и тем самым
повысить качество, но эти методы не реализуются, так как они
вычислительно пока еще очень сложны. Впрочем, кое-что появляется:
уже разработаны универсальные кодеки для компьютерной телефонии и
мультимедиа, способные пристойно передавать не только речь, но и
музыку. При полосе исходного сигнала до 6 кГц и тактовой частоте
отсчетов около 16 кГц сжатый цифровой сигнал требует для передачи
канал в 12 кбит/с. При этом оценка качества по критерию MOS может
быть выше 4,5 балла.
Озвученная речь, представляющая большую трудность для сжатия,
образуется с помощью звуковых связок человека. Скорость их
периодических колебаний задает так называемую частоту основного тона
(ОТ) - периодическую подпитку энергией голосового тракта человека,
который представляет собой объемный резонатор. Голосовой тракт
формирует спектральную окраску речи, или, другими словами, ее
формантную структуру. Другое название голосового тракта -
синтезирующий фильтр - нам более удобно, так как математическое
описание речеобразования обычно ведется в терминах линейной
фильтрации. Тогда, условно, речевой сигнал можно разделить на две
составляющие, отвечающие за 1 ый ОТ (возбуждение фильтра) и 2-ой
голосовой тракт (формантная структура сигнала). Соответственно,
большинство на сегодня используемых алгоритмов, так или иначе,
решают один вопрос - как наиболее эффективно выделить и сокращенно
описать обе составляющие. А отрезки глухой речи при моделировании
заменяют спектрально окрашенным шумом.
Рассмотрим методы цифрового представления речи, к которым
относятся: 1. прямое аналого- цифровое преобразование (или
импульсно-кодовая модуляция, ИКМ); 2. эффективное кодирование речи,
ЭКР (здесь можно выделить кодеры формы, вокодеры и кодеры,
реализующие алгоритмы анализа через синтез). Кроме указанных
существуют кодеры с многополосным кодированием, с ортогональным
преобразованием и с выявлением избыточности предсказания.
Назад
Импульсно-кодовая модуляция (PCM - Pulse-Code Modulation)
Назад
Прямое аналого-цифровое преобразование является низкоэффективным
(т. е. имеющим малую скорость кодирования при заданном качестве)
высококачественным методом кодирования. Кодеки, построенные на базе
данного метода, работают на скоростях не ниже 32 кбит/с. При этом
полоса входного аналогового сигнала ограничена диапазоном 0,3-3,4
кГц. Для повышения качества преобразования полоса может быть
расширена до 6 кГц, что соответствует скорости передачи 88 кбит/с
при частоте дискретизации 12 кГц (при дальнейшем расширении полосы
качество представления речи не повышается).
Еще в 60-х годах был принят алгоритм оцифровки голоса под
названием импульсно-кодовой модуляции (Pulse-Code Modulation - PCM).
Этот алгоритм (международный стандарт G.711) используется при
передаче голоса в коммерческих телефонных сетях. Оцифровка
голосового сигнала включает измерение уровня аналогового сигнала
через равные промежутки времени. В соответствии со стандартом G.711
принимается, что для узнаваемости голоса необходимо обеспечить
передачу его частотных составляющих в диапазоне от 200 до 3400 Гц.
Известно, что для правильной передачи всех частотных составляющих
необходимо измерять уровень сигнала с частотой 8 кГц. В стандарте
также принимается, что оцифровка аналогового сигнала производится с
восьмиразрядным разрешением. При этом обычно используется один из
двух способов установления соответствия между амплитудой звукового
сигнала и цифровым значением - либо A-кодирование (оно принято в
Европе и Азии), либо -кодирование (принятое в США, Канаде и
некоторых других странах). И то и другое - просто таблицы
соответствия между измеряемым значением напряжения и числом, при
помощи которого оно кодируется. Для передачи одного голосового
канала в цифровом виде требуется пропускная способность 64 кбит/с (8
кГц х 8 разрядов). Попутно заметим, что именно эта величина и
используется в качестве единицы измерения пропускной способности
каналов современных цифровых сетей (таких, например, как каналы
иерархии T-1/E-1, используемые, в частности, для построения
приобретающей все большую популярность сети ISDN). Назад
m-Law и A-Law кодирование
Назад
Когда звуковая карта получает звуковые данные, она преобразует
каждое значение дискретизации в соответствующее значение напряжения,
которое затем усиливается и подается на динамик или наушники. При
изменении значения оцифрованного звука меняется напряжение, а
динамик преобразует изменение напряжения в изменение звукового
давления, которое в виде звуковой волны распространяется в воздухе и
достигает вашего уха.
Какая же связь между значением оцифрованного звука и генерируемым
звуковой картой напряжением? Наиболее очевидный подход заключается в
использовании линейной связи (linear relation), при которой,
например, увеличение значения цифрового представления звука вдвое
будет приводить к увеличению напряжения также в два раза. Однако
этот подход не эффективен. Человеческое ухо воспринимает звук
нелинейно: разница между малыми цифровыми представлениями звукового
сигнала может быть слишком велика для слабых звуков, в то время как
разница между большими представлениями будет слишком мала, чтобы ухо
ее различило.
Принимая во внимание указанную природу человеческого слуха вводят
логарифмическую шкалу. Соотношения m-Law и A-Law соответствуют этой
шкале. Соотношение m-Law используется, прежде всего, в Северной
Америке и в Японии. Для преобразования значения линейной
дискретизации m в дискретизацию Ym используется следующее уравнение:
(1) 
где mp - максимальное входное значение
оцифрованного звука, а m - константа, обычно 100 или 255.
A-Law используется в Европе. Оно также используется для
преобразования значения линейной дискретизации в дискретизацию YA .
А - это константа 87.6:
(2) 
Соотношения m-Law и A-Law позволяют восьмиразрядные
измерения представлять в том же диапазоне, что и линейные
12-разрядные. Таким образом, можно получить более чем 30% сжатия.
Назад
Помехоустойчивость методов ИКМ
Назад Рисунок 2
Помехоустойчивость различных методов цифрового представления:
А-бласть нечувствительности к ошибкам; В - слабая чувствительность;
С - потеря работоспособности.

На рис. 2, где приведены обобщенные кривые, характеризующие
помехоустойчивость различных методов цифрового представления речи,
кривая 1 соответствует ИКМ-представлению. Здесь Рош - вероятность
ошибки на символ, а SNR - отношение сигнал/шум, рассчитанное через
среднеквадратическую ошибку восстановления. ИКМ-кодеки имеют
наихудшие показатели помехоустойчивости. На рисунке можно увидеть,
что изо всех кривых (характеристик разных способов цифрового
представления речи) самый короткий относительно других типов ЦПР
участок А (нечувствительность к ошибкам в канале) имеет кривая 1.
Кодеки могут потерять работоспособность, даже если вероятность
ошибки равна 10-5, что соответствует параметрам канала среднего
класса. Системы с ИКМ работают только в области нечувствительности к
ошибкам в канале, но даже в этом случае вводятся специальные меры
для устранения последствий возникновения одиночных ошибок. При
использовании алгоритма ИКМ со скоростью передачи 64 кбит/с кодек
имеет максимальную область нечувствительности к ошибкам в канале при
высоком качестве восстановления. Поэтому данный алгоритм
рекомендован для большинства систем цифровой передачи речи в
качестве метода предварительного аналого-цифрового преобразования.
Назад
Методы эффективного кодирования речи
Назад
После того как аналоговый сигнал преобразован в цифровую форму, к
нему можно применять различные способы обработки, которые невозможно
использовать при работе с чисто аналоговым сигналом. В частности,
оцифрованный сигнал перед передачей можно сжать, уменьшив таким
образом пропускную способность, необходимую для передачи одного
голосового соединения. Методы сжатия речи разрабатываются для
достижения определенных целей - нужных скоростей битового потока,
качества сигнала, задержки и сложности. Чтобы гарантировать взаимную
совместимость устройств кодирования и декодирования, организации по
стандартам, такие как ITU-Т, ISO и ETSI, определяют эти цели в
соответствии с предназначением каждого метода. Но при этом выигрывая
в одном, пользователь часто проигрывает в другом.
Во-первых, несмотря на то, что алгоритмы сжатия реализуются на
аппаратном уровне, с использованием специализированных процессоров
обработки цифрового сигнала (Digital Signal Processor - DSP),
все-таки эта операция может привести к задержкам в передаче голоса.
При разработке высококачественных методов сжатия речи для скоростей
цифровых потоков ниже 10 Кбит/с возникают особенные трудности. Для
простых алгоритмов задержка невелика - единицы миллисекунд, однако
для сложных алгоритмов, обеспечивающих значительное сжатие,
продолжительность задержки может составлять около сотни миллисекунд,
что вполне ощутимо при разговоре. К счастью, недавние достижения в
области обработки цифровых сигналов (digital signal processing -
DSP) и сверхбольших интегральных схем (very large scale integration
- VLSI) сделали реализацию таких кодирующих устройств возможной и
экономически эффективной.
Вторая важная проблема состоит в том, что сжатие речи, как
правило, снижает качество звука. Известно, что больших степеней
сжатия цифровой информации можно достичь только при использовании
алгоритмов, не допускающих полного восстановления сжимаемой
информации.
Наконец, в-третьих, чем выше степень сжатия информации, тем
сложнее (и соответственно дороже) оборудование требуется для
осуществления этой операции. По мере усовершенствования технической
базы сжатия речи это ограничение теряет свою жесткость, однако
появляются все новые, более сложные алгоритмы, потребляющие большие
вычислительные мощности.
Сжатие речи называют также эффективным кодированием. Раньше, чем
все остальные способы, для эффективного цифрового преобразования
речи были разработаны вокодеры. Основываясь на выбранной модели
речеобразования, вокодер с помощью алгоритма передачи анализирует
параметры речевого сигнала, который поступает по каналу связи в
приемник; приемный алгоритм позволяет проводить синтез сигнала.
Осциллограммы исходного и синтезированного сигнала не совпадают, и
речь может носить "искусственный" характер.
Значительные результаты в области эффективного кодирования речи
достигнуты на базе общего подхода "кодирования с предсказанием".
Большая часть стандартизированных Международным союзом электросвязи
алгоритмов кодирования относится именно к этому направлению. Среди
кодеров формы сигнала первыми появились методы дельта-модуляции
(ДМ). Аналитически они являются предельными случаями разностной ИКМ,
но по ряду причин могут быть выделены в отдельный класс. Скорость
передачи при дельта-модуляции соответствует частоте дискретизации
(одноразрядное квантование); при скоростях 40-30 кбит/с ДМ
обеспечивает более высокое качество восстановления, чем ИКМ. Кривая
2 на рис. 2 характеризует помехоустойчивость ДМ. Дельта-модуляция
обладает наилучшими параметрами помехоустойчивости среди всех
методов кодирования. Соответствующие системы не теряют
работоспособности при возникновении одиночных ошибок и их пакетов
(серий) малой длительности.
Еще один класс кодеров формы - методы дифференциальной
(разностной) ИКМ (ДИКМ). Их классификационными признаками считаются
наличие блока линейного предсказания авторегрессионных
последовательностей (предсказателя) и использование многоуровневого
(больше двух уровней) квантователя. Блок линейного предсказания
может состоять из двух частей - долговременного и кратковременного
предсказателей. В канал передается разность истинного и
предсказанного значений сигнала (сигнал-остаток, он же - погрешность
предсказания). Системы с ДИКМ обеспечивают такое качество
восстановления сигнала, которое сопоставимо с предоставляемым ИКМ, и
на порядок более высокую помехоустойчивость. Однако, в отличие от
систем с ДМ, они теряют работоспособность при вероятности одиночной
ошибки, составляющей около 5 ? 10-3, и передаче пакетов ошибок малой
длительности.
К достижениям в области ЭКР можно отнести кодеры, реализующие
алгоритмы анализа через синтез. Они сохраняют форму речевого сигнала
(во всяком случае, к ним применима среднеквадратическая мера оценки
восстановления, СКО). В этих кодерах используются алгоритмы сжатия,
основанные на оценке параметров модели речеобразования, которые
прежде применялись исключительно в вокодерах. Все описанные методы
предполагают передачу большого количества параметров речевого
сигнала и эквивалента сигнала-остатка (используемого разностной
ИКМ), которые квантуются с разной точностью. Прежде оценка признака
тон/шум считалась отличительной чертой вокодера, теперь же она
осуществляется и в кодерах анализа через синтез, что стирает границы
между кодерами формы и вокодерами (поэтому их иногда называют
полувокодерами).
Работа кодеков с многополосным кодированием (МПК, SubBand Coder)
основана на различной чувствительности слуха к звукам, принадлежащим
к разным частотным полосам. Это позволяет кодировать сигналы в
полосах с разной точностью. Число полос может колебаться от 3 до 16.
В кодерах с ортогональным преобразованием (ОПА) скорость передачи
снижается за счет грубого квантования спектральных составляющих,
полученных разложением в ряд в каком-либо базисе. Особенностью
помехоустойчивости систем, основанных на последних двух методах
(рис. 2, кривая 3), является то, что благодаря различной точности
кодирования в полосах отсутствует пороговый переход к области
неработоспособности.
Появление методов MPE, RELP и CELP (чаще используются именно
латинские аббревиатуры; русские эквиваленты названий приведены на
рис. 3) связано с совершенствованием кодеров формы, которое было
предпринято для сохранения качества восстановленного речевого
сигнала при менее высоких скоростях. В этих методах выявляется
избыточность погрешности предсказания. В кодерах с линейным
предсказанием и усеченным возбуждением (RELP - Residual Excited
Linear Prediction, ЛПУВ) сигнал погрешности ограничивается по
частоте и прореживается. Кодеры с многоимпульсным возбуждением (MPE
- MultiPulse Excitation, ЛПМВ) используют вместо сигнала-остатка
искусственную последовательность возбуждения речевого сигнала на
некотором временном интервале, параметры которой передаются в
декодер. Выбор фазы такой последовательности осуществляется с
помощью интерактивной процедуры по критерию близости формы исходного
и синтезированного сигналов. На основе этого метода разработан
алгоритм кодека стандарта GSM для подвижной связи, реализующий
скорость передачи 13,8 кбит/с.
В последнее время большую популярность приобрели кодеры CELP
(Сode Excited Linear Prediction), разновидностями которых являются
SELP, LD-CELP, V-CELP и A-CELP. Эти высокоэффективные кодеры
обеспечивают отличное качество звука при низких скоростях (2,4-8
кбит/с). Для кодирования погрешности предсказания в них используются
кодовые книги, состоящие из блоков с конечным числом символов.
Перечисленные разновидности кодеров различаются способами
формирования и хранения этих последовательностей. Чаще всего
последовательность хранится в сжатом виде. Дополнительные буквы в
названии кодера (LD, V и др.) указывают на способ реализации
предсказателя, синтеза квантователя или кодовой книги. Кривая 4 на
рис. 2 характеризует помехоустойчивость таких кодеров. Здесь явно
видны две основные области: А соответствует помехоустойчивой работе
(вероятность ошибки 10-3), В - резкому уменьшению
помехоустойчивости. Назад
Линейное предсказание
Назад
Вкратце очень красивая идея линейного предсказания (ЛП) такова:
сформировать из нескольких отсчетов речи линейную комбинацию,
наиболее точно аппроксимирующую следующий отсчет (формула 1). Для
этого сигнал речи сегментируют на блоки, обрабатывают окном и для
каждого блока вычисляют автокорреляционную функцию (АКФ), число
отсчетов которой обычно около 10.
Оказывается, что такая АКФ содержит исчерпывающую информацию о
формантном спектре речи на данном сегменте. На втором шаге находят
решение системы линейных уравнений относительно коэффициентов
предсказания - тех самых, что нужны для формирования синтезирующего
фильтра. Фактически найденные коэффициенты задают спектральную
модель голосового аппарата человека, и чем выше порядок ЛП (Р в
формуле 1), тем точнее модель.
| (1) |
 |
| (2) |
 |
Пропустив исходную речь через фильтр, обратный полученному, мы
получаем функцию, близкую к сигналу возбуждения. В ее спектре
формантные области сглажены, а спектральный характер напоминает
белый шум. Поэтому обратный фильтр также называют отбеливающим.
На третьем шаге параметры ЛП квантуются, после чего передаются на
приемную сторону. А ошибка предсказания (разностный сигнал),
обозначенный в формуле 2 через R(n), обрабатывается с целью
выделения существенных для человеческого восприятия параметров.
Например, в простейших кодеках ЛП передается период ОТ и мощность
возбуждающих импульсов. В кодеке RPE-LTP таких импульсов уже
несколько, а в кодеках CELP (code-excited linear prediction - ЛП с
кодовым возбуждением) вместо передачи самих импульсов подбирается
наиболее подходящая запись из набора хранящихся в заранее
сформированной кодовой книге. Тогда, вместо самой последовательности
можно на прием передать ее порядковый номер в кодовой книге. Однако
существуют и другие подходы.
В любом случае по каналу связи вместо самой речи передают так или
иначе выделенные и квантованные параметры предсказания, интервал и
усиление ОТ, параметры возбуждения. В декодере ЛП по принятым
параметрам восстанавливают сигнал возбуждения, пропускают его через
синтезирующий фильтр и так восстанавливают речь.
Рис.3Пояснения сказанному приведено на рис. 3, где
в верхнем ряду в осях время (в отсчетах) - амплитуда показаны
осциллограммы фрагмента звонкой речи (на графике слева - исходный
сигнал, справа - сигнал возбуждения ОТ, выделенный из речи). В
нижнем ряду соответствующие верхним графикам спектры показаны в осях
частота (в Гц) - амплитуда (в дБ).
На графиках речи и возбуждения отчетлива видна их
квазипериодичность, отраженная линейчатостью спектров. В спектре
звонкой речи на фоне общего спадания его к верхним частотам
просматриваются три резонансные области - в районе 300 Гц, 1700 Гц и
2600 Гц, - описанные выше форманты. Спектр же возбуждения, сохраняя
линейчатость (голосовые связки, вспомним, колеблются периодически),
выровнен по амплитуде, или, как еще говорят, отбелен. Это происходит
потому, что возбуждение носит случайный шумовой характер, хотя и
следующий с некоторой периодичностью. Обратите также внимание на то,
что энергия возбуждения много меньше энергии самой речи, то есть
синтезирующий фильтр помимо спектрального окрашивания еще и
усиливает входной сигнал. Говорят, что в ближней зоне сигнал
возбуждения декоррелирован (статистически независим), что, кстати,
усложняет его сжатие, и, напротив, в дальней зоне корреляция очень
высока, достигая максимума в точке, равной периоду ОТ. Последнее
свойство очень полезно, так как свидетельствует об избыточности, и в
этом заложен большой ресурс для сжатия. Из-за периодичности сигналов
присутствующий на показанном участке звонкой речи случайный
компонент визуально обнаружить довольно трудно. Но он есть, и именно
из-за него спектр речи в областях между гармониками частоты ОТ не
спадает до нуля. Опыт разработки кодеков показал, что этот случайный
компонент необходим для полноценного восприятия. Без него
синтезированная речь звучит неестественно (вспомним, как иной раз
разговаривает цифровой сотовый или Интернет-телефон).
Артикуляционные изменения характеристик синтезирующего фильтра,
формирующие звуки речи, происходят непрерывно, но медленно. Поэтому
при сжатии речь сегментируют на короткие блоки (длиной 5-30 мс), в
пределах которых параметры этого фильтра считают постоянными
(свойство локальной квазистационарности речи).
Известно, что значение ОТ для разных голосов может изменяться
почти в 10 раз - от 2 до 18 мс. Это обстоятельство создает немало
трудностей при оценке ОТ, так как слух очень чувствителен к его
искажениям. Методов измерения ОТ известно очень много, и ежегодно на
международных конференциях ICASSP (International Conference on
Acoustics, Speech and Signal Processing) предлагаются вс§ новые и
новые, так как до сих пор достаточно надежный и простой и, вместе с
тем, не требующий чрезмерной задержки метод пока не появился. Что
касается сокращенного описания сигнала возбуждения в целом, то с
этим дела обстоят еще хуже: эффективных "конструктивных" методов не
предложено, и значительная часть вычислительного ресурса
CELP-кодеков, к примеру, расходуется именно на кодирование
возбуждения.
Рис.4На рис. 4, организованном аналогично рис. 3,
но в другом масштабе, показана глухая речь. Видно, что она имеет
случайный, шумовой характер. Это же отражается на ее спектре.
Возбуждение, хотя и лишенное периодической составляющей, в голосовом
тракте получило какое-то спектральное усиление, что отражено на
спектре, а в целом, что речь, что возбуждение малокоррелированы.
После появления первых вокодеров случилась "пауза": развитие
техники связи и появление многоканальных высококачественных
телефонных линий, с одной стороны, и неразвитость цифровой техники,
с другой, на некоторое время ослабили интерес к сжатию речи.
Вокодеры уцелели только в системах засекреченной военной и
правительственной связи, в некоторых каналах спецрадиосвязи, вроде
аэродромной. А в нарождающейся цифровой связи господствовали два
алгоритма нелинейной ИКМ, обеспечивающие прекрасное телефонное
качество. Два - потому, что в Европе ("А-закон") и в США ("мю-
закон") были приняты разные реализации одного и того же стандарта!
Отсутствие единого стандарта с развитием международных связей стало
очень неудобным, так как требовало перекодировки речи при передаче
речевого сигнала из одной сети связи в другую, а с учетом того, что
трафик между США и Европой большой, то и перекодировок требовалось
немало... Кстати, вынужденная перекодировка вносит дополнительные
шумы и снижает оценку MOS.
Перекодировки, а говоря грамотнее: отсутствие единых стандартов -
вообще больная тема. В России, например, это вечный матч KOI-8 vs.
CP1251 с подсуживающими судьями-провайдерами и всегда проигрывающими
пользователями. Но если проблема перекодировок русских кодовых
таблиц более или менее поддается решению, хотя и не всегда без
потерь, то при передаче речи "перекодировки", возникая постоянно
(сегодня в разных сетях связи используют кодеки разных стандартов),
могут сильно ухудшать качество звучания и сдерживать развитие рынка.
Правда, для сетей IP-телефонии это не самая большая проблема.
Гораздо более важную сдерживающую роль играет несовместимость
протоколов и аппаратуры, используемой провайдерами IP-телефонии,
когда каждый из них строит чуть ли не выделенную сеть связи,
примерно также, как это было в эпоху зарождения традиционной
телефонии. В последнее время процесс сближения пошел веселее, о чем,
например, см. КТ #48 [276], стр. 7 ("Долго запрягают"), но сколько
их уже было, таких процессов, за последние пару-тройку лет! А сейчас
при передаче речи из одной сети в другую дополнительные искажения
просто неизбежны.
Логарифмическая ИКМ никак не использует взаимную корреляцию между
соседними отсчетами речи, поэтому первым примером сжимающей
обработки стоит считать дифференциальную ИКМ (ДИКМ), при которой
осуществляется предсказание речи первого порядка. Предыдущий отсчет
берется с определенным весом, формируя прогноз. Разница между
предсказанным и реальным отсчетом речи подвергается квантованию.
Позднее появилась более продвинутая технология - адаптивная
дифференциальная ИКМ (АДИКМ). При АДИКМ размеы шкалы квантования
подстраивают в соответствии с энергией речи так, чтобы слабые
сигналы квантовались малыми ступенями квантования, а сильные сигналы
- большими. Благодаря непрерывной подстройке шага квантования к
текущей мощности речи, разрядность шкалы квантования при АДИКМ
удалось снизить до четырех бит и получить кодек со скоростью
передачи 32 кбит/с и качеством, близким к ИКМ. Назад
Предыдущая
Содержание
Дальше