Geluidsmeter - Krijg een beter inzicht in ruisonderdrukking
Nadat we de basisverschillen hebben begrepen tussen ruisonderdrukking (het onderdrukken van omgevingsgeluid van de luidspreker zodat luisteraars op afstand duidelijk kunnen horen) en actieve ruisonderdrukking (het compenseren van het omgevingsgeluid van de luisteraar), gaan we ons concentreren op de manier waarop ruisonderdrukking kan worden bereikt.
Eén methode is om meerdere microfoons te gebruiken om gegevens te onderdrukken. Het verzamelen van gegevens van meerdere locaties zal ertoe leiden dat apparaten vergelijkbare (maar nog steeds gedifferentieerde) signalen ontvangen. Het stemsignaal dat door de microfoon wordt ontvangen nabij de sprekende bevolking is aanzienlijk sterker dan dat van de secundaire microfoon. Twee microfoons ontvangen niet-stemmig achtergrondgeluid met een vergelijkbare signaalsterkte. Trek de geluidsinformatie af die is verzameld door de sterke stemmicrofoon en de secundaire microfoon, en de resterende meerderheid is de steminformatie. Hoe groter de afstand tussen microfoons, hoe groter het signaalverschil tussen microfoons die dichterbij en verder weg zijn, waardoor het gemakkelijker wordt om dit eenvoudige algoritme te gebruiken om ruis te onderdrukken. Als u echter niet spreekt, of als u verwacht dat de spraakgegevens in de loop van de tijd veranderen (bijvoorbeeld wanneer u loopt of rent en uw telefoon blijft trillen), neemt de effectiviteit van deze methode af. Ruisonderdrukking bij meerdere microfoons is zeker betrouwbaar, maar er kleven nadelen aan extra hardware en verwerking.
Wat als er maar één microfoon was? Als er geen aanvullende geluidsbronnen worden gebruikt voor verificatie/vergelijking, zal een enkele microfoonoplossing afhankelijk zijn van het begrijpen van de ontvangen ruiskarakteristieken en het filteren ervan. Dit houdt verband met de eerder genoemde definities van stationaire en niet-stationaire ruis. Stabiele ruis kan effectief worden weggefilterd via DSP-algoritmen. Terwijl niet-stationaire ruis een uitdaging vormt, kunnen diepe neurale netwerken (DNN's) het probleem helpen oplossen.
Deze methode vereist een dataset voor het trainen van het netwerk. Deze dataset bestaat uit verschillende (stationaire en niet-stationaire) ruis en heldere spraak, waardoor een gesynthetiseerd luidruchtig spraakpatroon ontstaat. Voer de dataset in als invoer voor DNN en voer deze met duidelijke stem uit. Hierdoor ontstaat een neuraal netwerkmodel dat ruis elimineert en alleen heldere spraak produceert.
Zelfs met getrainde DNN’s zijn er nog steeds enkele uitdagingen en indicatoren waarmee rekening moet worden gehouden. Als je in realtime met een lage latentie wilt werken, heb je een sterke verwerkingskracht of een kleinere DNN nodig. Hoe meer parameters in DNN, hoe langzamer de loopsnelheid. De audiobemonsteringsfrequentie heeft een soortgelijk effect op de geluidsonderdrukking. Een hogere bemonsteringsfrequentie betekent dat DNN meer parameters moet verwerken, maar op zijn beurt zal het een hogere kwaliteit output opleveren. Smalbandspraakcommunicatie is een ideale keuze voor realtime ruisonderdrukking.
Dit soort verwerking zijn allemaal intensieve taken, en cloud computing is zeer bedreven in het voltooien van dergelijke taken, maar deze methode verhoogt de latentie aanzienlijk. Gezien het feit dat mensen op betrouwbare wijze vertragingen van ongeveer 108 milliseconden of meer kunnen onderscheiden, is de extra vertraging veroorzaakt door cloud computing-verwerking duidelijk geen ideaal resultaat. Het uitvoeren van DNN op de edge vereist echter enkele slimme aanpassingen. CEVA streeft er altijd naar om onze stem- en spraakverwerkingsmogelijkheden te verbeteren. Dit omvat gevalideerde algoritmen voor spraakhelderheid en commandoherkenning - deze algoritmen zorgen voor duidelijke communicatie en stemcontrole, zelfs aan de randen. Welkom om contact met ons op te nemen en persoonlijk te luisteren.






