Miernik hałasu — wprowadzenie do tłumienia hałasu
Po zrozumieniu podstawowych różnic między tłumieniem hałasu (tłumieniem hałasu otoczenia głośnika, aby zdalni słuchacze mogli wyraźnie słyszeć) a aktywną redukcją szumu (równoważeniem hałasu otoczenia słuchacza), skupmy się na tym, jak osiągnąć tłumienie hałasu.
Jedną z metod jest użycie wielu mikrofonów w celu tłumienia danych. Gromadzenie danych z wielu lokalizacji spowoduje, że urządzenia otrzymają podobne (ale wciąż zróżnicowane) sygnały. Sygnał głosowy odbierany przez mikrofon w pobliżu mówiącej populacji jest znacznie silniejszy niż sygnał z mikrofonu dodatkowego. Dwa mikrofony będą odbierać dźwięk tła inny niż głos o podobnej sile sygnału. Odejmij informacje dźwiękowe zebrane przez mikrofon do silnego głosu i mikrofon pomocniczy, a pozostała większość to informacje głosowe. Im większa odległość między mikrofonami, tym większa różnica sygnału między mikrofonami znajdującymi się bliżej i dalej, co ułatwia użycie tego prostego algorytmu do tłumienia szumów. Jeśli jednak nie mówisz lub gdy spodziewasz się, że dane głosowe będą się zmieniać w miarę upływu czasu (na przykład podczas chodzenia lub biegania, a telefon ciągle się trzęsie), skuteczność tej metody będzie spadać. Tłumienie szumów za pomocą wielu mikrofonów jest z pewnością niezawodne, ale dodatkowy sprzęt i przetwarzanie mają wady.
A co by było, gdyby był tylko jeden mikrofon? Jeśli do weryfikacji/porównania nie zostaną użyte dodatkowe źródła dźwięku, rozwiązanie z jednym mikrofonem będzie polegać na zrozumieniu charakterystyki odbieranego szumu i jego odfiltrowaniu. Ma to związek z przytoczonymi wcześniej definicjami hałasu ustalonego i niestacjonarnego. Szum w stanie ustalonym można skutecznie odfiltrować za pomocą algorytmów DSP, podczas gdy szum niestacjonarny stanowi wyzwanie, głębokie sieci neuronowe (DNN) mogą pomóc w rozwiązaniu problemu.
Ta metoda wymaga zestawu danych do uczenia sieci. Ten zbiór danych składa się z różnych szumów (w stanie ustalonym i niestacjonarnym) oraz wyraźnej mowy, tworząc syntetyczny wzorzec mowy z szumem. Podaj zbiór danych jako dane wejściowe do DNN i wyślij go czystym głosem. Spowoduje to utworzenie modelu sieci neuronowej, który wyeliminuje szum i będzie generował wyłącznie wyraźną mowę.
Nawet w przypadku przeszkolonych DNN nadal istnieją pewne wyzwania i wskaźniki do rozważenia. Jeśli chcesz działać w czasie rzeczywistym z niskimi opóźnieniami, potrzebujesz dużej mocy obliczeniowej lub mniejszego DNN. Im więcej parametrów w DNN, tym mniejsza prędkość działania. Częstotliwość próbkowania dźwięku ma podobny wpływ na tłumienie dźwięku. Wyższa częstotliwość próbkowania oznacza, że DNN musi obsłużyć więcej parametrów, ale w rezultacie uzyska wyższą jakość wyników. Wąskopasmowa komunikacja głosowa to idealny wybór do tłumienia hałasu w czasie rzeczywistym.






