{"id":11646,"date":"2024-04-10T08:32:23","date_gmt":"2024-04-10T08:32:23","guid":{"rendered":"https:\/\/lamarr-institute.org\/?post_type=blog&#038;p=11646"},"modified":"2025-11-12T14:51:12","modified_gmt":"2025-11-12T14:51:12","slug":"automatische-spracherkennung-entwicklung","status":"publish","type":"blog","link":"https:\/\/lamarr-institute.org\/de\/blog\/automatische-spracherkennung-entwicklung\/","title":{"rendered":"Deep Dive in die Evolution der automatischen Spracherkennung (ASR)"},"content":{"rendered":"\n<p>Die automatische Spracherkennung (ASR) ist eine sich rasch entwickelnde Technologie, die im heutigen digitalen Zeitalter von gro\u00dfer Bedeutung ist. Als sprachbasierte Technologie ist sie ein n\u00fctzlicher Weg, um die Interaktion zwischen Mensch und Computer zug\u00e4nglicher zu machen. Die inneren Abl\u00e4ufe von ASR k\u00f6nnen jedoch sehr komplex sein. Deshalb wollen wir das Konzept der ASR entmystifizieren und es auf einfache und verst\u00e4ndliche Weise darstellen, indem wir einen \u00dcberblick \u00fcber die verschiedenen Zeitr\u00e4ume und die \u00dcberg\u00e4nge zwischen ihnen geben.\u00a0\u00a0<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Die Entwicklung der automatischen Spracherkennung<\/h2>\n\n\n\n<p>In der sich st\u00e4ndig weiterentwickelnden Technologielandschaft ist die Entwicklung der automatischen Spracherkennung (ASR) nichts weniger als bemerkenswert. Im Laufe der Jahre wurden zahlreiche Ans\u00e4tze erforscht und verfeinert, die alle zur Weiterentwicklung dieser wichtigen Technologie beigetragen haben. In diesem Blogbeitrag gehen wir auf die faszinierende Entwicklung der ASR ein und beleuchten die wichtigsten Meilensteine und \u00dcberg\u00e4nge, die ihre Entwicklung gepr\u00e4gt haben.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Statistischer Ansatz\u00a0<\/h3>\n\n\n\n<p>Hidden Markov Models (HMMs) waren einer der ersten grundlegenden Ans\u00e4tze, die f\u00fcr die Spracherkennung eingef\u00fchrt wurden. Dieser Ansatz wurde in das HCLG-Framework (HMM &#8211; Context &#8211; Lexicon &#8211; Grammar) eingebettet, welches das Problem in verschiedene Komponenten aufteilt, die jeweils spezifische Aspekte behandeln. Mit den Fortschritten bei der Hardware und dem florierenden Bereich der Big Data ging der Bereich der ASR jedoch in die End-to-End-\u00c4ra \u00fcber, in der die einzelnen Komponenten zu einem einzigen Deep-Learning-Modell zusammengefasst wurden.\u00a0\u00a0\u00a0\u00a0<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">End-to-End-Ansatz\u00a0<\/h3>\n\n\n\n<p>Neuronale Netze haben die Spracherkennung revolutioniert und einen bedeutenden Meilenstein im technologischen Fortschritt gesetzt. Durch die Nutzung gro\u00dfer Datens\u00e4tze und leistungsstarker Rechenkapazit\u00e4ten (z. B. GPUs) haben sie Anwendungen wie Sprachassistenten oder Transkriptionsdienste erheblich beeinflusst. Die Systeme k\u00f6nnen nun eine Vielzahl von Sprachen, Akzenten und Sprachvariationen effektiver und genauer verarbeiten und erreichen oft eine Genauigkeit, die mit der von Menschen vergleichbar ist. Das Jahr 2017 l\u00e4utete mit der Einf\u00fchrung der <a href=\"https:\/\/arxiv.org\/pdf\/1706.03762.pdf\" target=\"_blank\" rel=\"noreferrer noopener\">Transformer-Architektur<\/a> eine neue \u00c4ra des Deep Learning ein, die schnell ihre Anwendung in der ASR fand. W\u00e4hrend wir durch die ASR-Landschaft navigieren, m\u00fcssen wir uns jedoch fragen: Sind Transformer die ultimative L\u00f6sung oder gibt es noch unerforschte Gebiete, die auf ihre Erkundung warten? In den folgenden Abschnitten dieses Blog-Beitrags werden wir uns auf eine Reise in die Feinheiten von ASR begeben, ihre innere Funktionsweise entwirren und die M\u00f6glichkeiten erkunden, die vor uns liegen.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Das Spektrum der automatischen Spracherkennung aufdecken: Von HMMs bis hin zu Whisper und Deep-Learning-Techniken<\/h2>\n\n\n\n<p>Die automatische Spracherkennung (ASR) umfasst eine Reihe komplexer Schritte, die es Maschinen erm\u00f6glichen, gesprochene Sprache in geschriebenen Text umzuwandeln. Um die grundlegenden Mechanismen der ASR zu verstehen, sollten wir uns mit den wichtigsten Komponenten befassen und uns dabei auf zwei Hauptans\u00e4tze konzentrieren: Hidden Markov Models (HMMs) und Deep Learning.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Hidden-Markov-Models (HMMs)<\/h3>\n\n\n\n<p>Spracherkennungssysteme bestehen aus zwei Hauptkomponenten: dem Akustikmodell (AM) und dem Sprachmodell (LM). Urspr\u00fcnglich wurde diese Aufteilung im HCLG-Framework (HMM &#8211; Context &#8211; Lexicon &#8211; Grammar) fein abgegrenzt. HCLG ist ein Graph, der aus einer Grammatik, einem Lexikon, einem Kontext und einem HMM Weighted Finite State Transducers (WFSTs) besteht. In diesem Graphen stellen die Eckpunkte Symbole dar, die zusammen einen Satz ergeben, sobald der Graph durchlaufen wurde. Die Kanten, die die Eckpunkte verbinden, sind mit penalties (dt. \u201eStrafen\u201c) oder costs (dt. \u201eKosten\u201c) verbunden, die entstehen, wenn man sich f\u00fcr einen Pfad entscheidet. Wenn der kosteng\u00fcnstigste Pfad gefunden wird, ist die Ausgabe die beste Transkription f\u00fcr das Input Audio.&nbsp;&nbsp;<\/p>\n\n\n\n<p>Das Akustikmodell (AM) des HCLG-Systems besteht aus HMM, Kontext und Lexikon-WFSTs, die gemeinsam die Sprache als eine Folge von Phonemen modellieren. Die Grammatik-WFST beherbergt das Sprachmodell (LM), das die Wahrscheinlichkeit von Wortfolgen abbildet. AM- und LM-Training k\u00f6nnen separat durchgef\u00fchrt und mit Hilfe von WFST-Mathematik kombiniert werden, was diesen Aufbau in ASR-Umgebungen mit geringen Ressourcen sehr praktisch und leistungsstark macht.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Deep Learning<\/h3>\n\n\n\n<p><a href=\"https:\/\/arxiv.org\/pdf\/1412.5567.pdf\" target=\"_blank\" rel=\"noreferrer noopener\">Deep Speech<\/a> hat sich zu einem bedeutenden Fortschritt im Bereich der End-to-End ASR entwickelt. Diese Architektur vereinfacht die Entwicklung von ASR-Systemen f\u00fcr verschiedene Anwendungsf\u00e4lle und umgeht die Komplexit\u00e4t, die mit herk\u00f6mmlichen Methoden verbunden ist. Die Deep Speech-Architektur erfordert keine von Hand entwickelten Features, um Hintergrundger\u00e4usche, Hall oder Sprechervariationen zu ber\u00fccksichtigen. Stattdessen wird direkt eine Funktion erlernt, die gegen solche Effekte resistent ist. Au\u00dferdem wird kein Phonemw\u00f6rterbuch ben\u00f6tigt, was den herk\u00f6mmlichen Ansatz der ASR revolutioniert. Das f\u00fchrt zu der Frage: Wie kann eine so &#8222;einfache&#8220; Architektur existieren und ASR durchf\u00fchren, ohne die Grundeinheiten der Sprache (Phoneme) zu ben\u00f6tigen?\u00a0 Bevor wir darauf eingehen, ist es jedoch wichtig zu erw\u00e4hnen, dass die Architektur allein nicht ausreicht, um mit den komplexen HCLG-Systemen zu konkurrieren, sondern dass wesentlich mehr Daten erforderlich sind, um ein konkurrenzf\u00e4higes Niveau zu erreichen.<\/p>\n\n\n\n<p>Der Connectionist Temporal Classification (CTC) loss ist die Zielfunktion, die optimiert werden muss, wenn es sich um einen Aufbau handelt, wie er bei Deep Speech vorliegt. Wie hilft uns CTC also, unsere Fragen einigerma\u00dfen zu beantworten? Bei ASR sind zwei Sequenzen im Spiel, und wenn das System lernt, eine Sequenz der anderen zuzuordnen, hat es gelernt, das ASR-Problem zu l\u00f6sen. Bei HCLG waren die Sequenzen die der Eingabesprache und die der Phoneme. Der CTC-Loss ist so konzipiert, dass die zweite Sequenz die von Zeichen\/W\u00f6rtern\/Teilw\u00f6rtern sein kann. Es wird ein Graph \u00e4hnlich wie bei HCLG konstruiert, jedoch mit Zeichenzust\u00e4nden und einigen speziellen Zust\u00e4nden, und da der CTC-Loss optimiert wird, ist das System in der Lage, den verschiedenen Abschnitten der Spracheingabe die richtigen Zust\u00e4nde zuzuordnen. Dies bedeutet, dass das Modell lernt, Sprache auf Zeichen\/W\u00f6rter\/Teilw\u00f6rter abzubilden. In einem HCLG-System wird die sequentielle Natur der Sprache durch die HCLG-Graphenstruktur modelliert, jedoch k\u00f6nnen rekurrente neuronale Netze (RNNs) dasselbe tun, jedoch viel kompetenter, da sie sich die Sequenz (theoretisch) unendlich \u201emerken\u201c k\u00f6nnen. Im Vergleich dazu \u201emerken\u201c sich HMMs die Informationen des vorherigen Zustands.\u00a0 Deep Speech verwendet diese Architektur in Kombination mit standardm\u00e4\u00dfigen Deep Feed-Forward-Bl\u00f6cken und f\u00fcttert sie mit einer Menge von Trainingsdaten, w\u00e4hrend die Ausrichtung dem CTC-Loss \u00fcberlassen wird.\u00a0<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Transformer und Whisper\u00a0<\/h3>\n\n\n\n<p>Wir haben bereits erw\u00e4hnt, dass RNNs theoretisch eine unendliche lange Sequenz modellieren k\u00f6nnen. In der Praxis ist dies bei weitem nicht der Fall. Probleme wie der \u201evanishing gradient\u201c f\u00fchren jedoch dazu, dass RNNs Teile vergessen, die in einer l\u00e4ngeren Sequenz fr\u00fcher erschienen sind. Dar\u00fcber hinaus stellt sich heraus, dass das Training von RNNs ein langsamer Prozess ist. Die Tatsache, dass RNNs Sequenzen ein Element nach dem anderen verarbeiten, f\u00fchrt zu einer erh\u00f6hten Komplexit\u00e4t und Trainingszeit. Transformers wurden eingef\u00fchrt, um diese beiden Probleme zu lindern. Sie k\u00f6nnen alle Sequenzen auf einmal verarbeiten, d. h. alle Elemente werden parallel verarbeitet. Da alle Elemente einer Sequenz jederzeit sichtbar sind, gibt es kein \u201eVergessen\u201c, und die parallele Verarbeitung bedeutet, dass das Lernen durch einfache Backpropagation erfolgt, anstatt durch Backpropagation \u00fcber die Zeit, wie es bei RNNs der Fall ist.&nbsp;&nbsp;<\/p>\n\n\n\n<p>Dieser Mechanismus ist in der Lage, Informationen aus einem Element zu extrahieren, indem es im Kontext der gesamten Sequenz betrachtet wird, und zwar durch die Berechnung von \u00c4hnlichkeiten (Beziehungen) mit anderen Elementen der Sequenz. Die \u201eself-attention\u201c ist daher in der Lage, sinnvolle Informationen \u00fcber die Sequenz als Ganzes zu extrahieren. Mit Hilfe von Tranformern k\u00f6nnen wir riesige Datenmengen entsprechend der Aufgabe, die das Modell erf\u00fcllen soll, einspeisen und dem Modell eine Vielzahl von Parametern zum Erlernen dieser Aufgabe geben. CTC ist auch im Zeitalter der Transformers noch relevant, aber CTC war nie die einzige M\u00f6glichkeit, zwei unterschiedlich lange Sequenzen aneinander anzupassen. Vor Transformers und nach Deep Speech wurde das Encoder-Decoder-Framework entwickelt. Der Encoder kann die Eingabesequenz entgegennehmen, ohne die Ausgabesequenz erzeugen zu m\u00fcssen. Diese Aufgabe wird an den Decoder ausgelagert, und die beiden Netzwerke sind \u00fcber einen Mechanismus verbunden, der der \u201eself-attention\u201c \u00e4hnelt und \u201ecross attention\u201c genannt wird. Mit Hilfe der cross attention kann das System \u00c4hnlichkeiten zwischen den Elementen der Ausgabesequenz und der Eingabesequenz berechnen und die erforderliche Ausrichtung lernen. Da sich Transformers gegen\u00fcber RNNs als \u00fcberlegen erwiesen haben, bestehen die heutigen Encoder-Decoder aus Transformers. Und damit kommen wir zum Spracherkennungssystem namens \u201eWhisper\u201c.<\/p>\n\n\n\n<p>Whisper ist der derzeitige state-of-the-art auf diesem Gebiet, und vereinfacht gesagt handelt es sich um ein Transformer-Encoder-Decoder-Modell, das mit 680.000 Stunden Trainingsdaten trainiert wurde. Im Vergleich dazu wurden f\u00fcr Deep Speech 5.000 Stunden an Trainingsdaten verwendet, w\u00e4hrend die Datenmenge zu Zeiten von HCLG nur bei einigen hundert Stunden lag. Nach Transformern ging der Trend dahin, die Anzahl der Parameter des Modells und die Menge der Trainingsdaten zu skalieren. Im n\u00e4chsten Abschnitt werden wir uns mit den Herausforderungen befassen, mit denen ASR-Systeme konfrontiert sind und die nicht durch Skalierung von Parametern und Daten gel\u00f6st werden konnten.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Die Herausforderungen der automatischen Spracherkennung (ASR) bew\u00e4ltigen\u00a0<\/h2>\n\n\n\n<p>Im Bereich der automatischen Spracherkennung (ASR) gibt es eine Vielzahl von Herausforderungen, die sich auf die Genauigkeit und Effektivit\u00e4t dieser Systeme auswirken. Dieses Kapitel befasst sich mit drei zentralen Herausforderungen: Robustheit, sogenannte \u201eOut-of-vocabulary-W\u00f6rter\u201c (OOV) und Halluzinationen. Diese Hindernisse werfen ein Licht auf die komplexen Aspekte der ASR-Technologie und zeigen auf, welche Fortschritte erforderlich sind, um die Leistung dieser Systeme weiter zu verbessern.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">1.\u00a0Robustheit<\/h3>\n\n\n\n<p>Robustheit in der automatischen Spracherkennung (ASR) bezieht sich auf die F\u00e4higkeit des Systems, Sprache unter verschiedenen Bedingungen, einschlie\u00dflich unterschiedlicher Akzente und Sprachvariationen, korrekt zu transkribieren. Akzente und Sprachvielfalt stellen aufgrund der unterschiedlichen Aussprache von W\u00f6rtern und S\u00e4tzen eine gro\u00dfe Herausforderung f\u00fcr ASR-Systeme dar.<\/p>\n\n\n\n<p>Unterschiedliche Akzente und Dialekte f\u00fchren zu Variationen in der Aussprache und den akustischen Merkmalen, wie Tonh\u00f6he, Rhythmus und Intonationsmuster. So k\u00f6nnen Sprecher mit regionalem Akzent beispielsweise W\u00f6rter anders aussprechen oder andere Sprachmuster verwenden als die Standardaussprache. Au\u00dferdem k\u00f6nnen Sprecher verschiedener Sprachen unterschiedliche phonetische Inventare oder Sprachlaute haben, was den Erkennungsprozess weiter erschwert. Diese Unterschiede stellen eine Herausforderung f\u00fcr ASR-Systeme dar, da sie darauf trainiert werden m\u00fcssen, Sprache von verschiedenen Sprechern und mit unterschiedlichem sprachlichen Hintergrund zu erkennen und zu interpretieren.<\/p>\n\n\n\n<p>Um dieser Herausforderung zu begegnen, entwickeln Forscher ASR-Systeme, die robuster sind und sich an verschiedene Sprachmuster und sprachliche Variationen anpassen k\u00f6nnen. Dazu kann es notwendig sein, Sprachdaten von einer Vielzahl von Sprechern und Sprachen zu sammeln und zu annotieren, um die Leistung des Systems in verschiedenen Akzenten und Dialekten zu verbessern. Insgesamt ist die Verbesserung der Robustheit von ASR-Systemen entscheidend, um ihre Leistung in realen Anwendungen zu steigern und eine genaue Transkription in verschiedenen sprachlichen und kulturellen Kontexten zu gew\u00e4hrleisten.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">2.\u00a0Out-of-vocabulary-W\u00f6rter (OOV)<\/h3>\n\n\n\n<p>Dar\u00fcber hinaus stellen die sogenannten \u201eOut-of-vocabulary-W\u00f6rter\u201c (OOV) eine gro\u00dfe Herausforderung f\u00fcr automatische Spracherkennungssysteme (ASR) dar, da es sich dabei um W\u00f6rter handelt, denen das System beim Training nicht begegnet ist. Dabei kann es sich um neue Begriffe, Namen oder Fachvokabular handeln, die im Lexikon des Systems oder in den Trainingsdaten nicht vorhanden sind.<\/p>\n\n\n\n<p>Wenn ASR-Systeme mit OOV-W\u00f6rtern konfrontiert werden, k\u00f6nnen sie Schwierigkeiten haben, diese genau zu erkennen und zu transkribieren, was zu Fehlern in der Transkriptionsausgabe f\u00fchrt. Dies liegt daran, dass dem System die notwendigen linguistischen Informationen oder der Kontext fehlen, um diese unbekannten W\u00f6rter korrekt zu identifizieren und zu interpretieren. Ein h\u00e4ufiges Szenario, in dem OOV-W\u00f6rter vorkommen, ist die informelle Unterhaltung oder dom\u00e4nenspezifische Inhalte, in denen die Sprecher Slang, Jargon oder Fachbegriffe verwenden, die nicht zum Vokabular des Systems geh\u00f6ren. In einem medizinischen Umfeld k\u00f6nnen \u00c4rzte beispielsweise eine spezielle Terminologie verwenden, die im allgemeinen Sprachgebrauch oder in schriftlichen Texten nicht \u00fcblich ist.<\/p>\n\n\n\n<p>Die Bew\u00e4ltigung der Herausforderung der OOV-W\u00f6rter erfordert Strategien zur Verbesserung der Robustheit und Anpassungsf\u00e4higkeit von ASR-Systemen. Ein Ansatz besteht darin, das Lexikon und die Trainingsdaten des Systems kontinuierlich zu aktualisieren und zu erweitern, um ein breiteres Spektrum an Vokabular, einschlie\u00dflich OOV-W\u00f6rtern, die im realen Sprachgebrauch vorkommen, aufzunehmen. Dies kann die Einbeziehung von dom\u00e4nenspezifischen W\u00f6rterb\u00fcchern oder Datens\u00e4tzen beinhalten, um Fachbegriffe und Jargon abzudecken. Ein weiterer Ansatz ist die Entwicklung von Techniken zur Behandlung von OOV-W\u00f6rtern w\u00e4hrend des Erkennungsprozesses. Dar\u00fcber hinaus untersuchen Forscher den Einsatz von Techniken wie phonetische \u00c4hnlichkeit oder Worteinbettungen, um OOV-W\u00f6rter \u00e4hnlichen W\u00f6rtern oder Konzepten im Wortschatz des Systems zuzuordnen.<\/p>\n\n\n\n<p>Generell ist die Bew\u00e4ltigung des Problems der OOV-W\u00f6rter von entscheidender Bedeutung f\u00fcr die Verbesserung der Genauigkeit und Leistung von ASR-Systemen, insbesondere in realen Szenarien, in denen Sprecher verschiedene Vokabeln und Sprachvariationen verwenden k\u00f6nnen. Durch die Entwicklung robuster Techniken f\u00fcr den Umgang mit OOV-W\u00f6rtern k\u00f6nnen sich ASR-Systeme besser an die dynamische Natur der gesprochenen Sprache anpassen und genauere und zuverl\u00e4ssigere Transkriptionsergebnisse liefern.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">3.\u00a0Halluzinationen<\/h3>\n\n\n\n<p>Halluzinationen in automatischen Spracherkennungssystemen (ASR) beziehen sich auf das Ph\u00e4nomen, dass das System Text transkribiert, der in der Audiodatei gar nicht vorhanden ist. Trotz der beeindruckenden Leistung aktueller state-of-the-art Architekturen wie bspw. Whisper bleiben Halluzinationen eine anhaltende Herausforderung in der ASR-Technologie.<\/p>\n\n\n\n<p>Halluzinationen k\u00f6nnen aufgrund verschiedener Faktoren auftreten, aber eine der Hauptursachen ist das Vorhandensein von qualitativ schlechten oder besch\u00e4digten Samples in den Trainingsdaten. Wenn ASR-Systeme auf Daten trainiert werden, die Ungenauigkeiten, Hintergrundger\u00e4usche oder einfach nur Verzerrungen (Bias) enthalten, k\u00f6nnen sie versehentlich lernen, nicht existierende W\u00f6rter oder S\u00e4tze zu transkribieren. Diese Halluzinationen k\u00f6nnen die Genauigkeit und Zuverl\u00e4ssigkeit des ASR-Systems erheblich beeintr\u00e4chtigen und zu fehlerhaften Transkriptionsergebnissen f\u00fchren. Das Vorhandensein von Halluzinationen unterstreicht die entscheidende Bedeutung von qualitativ hochwertigen Trainingsdaten f\u00fcr die ASR. Die Trainingsdaten sollten sorgf\u00e4ltig kuratiert und vorverarbeitet werden, um Ungenauigkeiten, Verzerrungen oder Artefakte zu entfernen, die m\u00f6glicherweise zu Halluzinationen f\u00fchren k\u00f6nnten. Dar\u00fcber hinaus sollten robuste Qualit\u00e4tskontrollma\u00dfnahmen implementiert werden, um sicherzustellen, dass die Trainingsdaten reale Sprachmuster und -merkmale genau widerspiegeln.<\/p>\n\n\n\n<p>Um die Auswirkungen von Halluzinationen abzuschw\u00e4chen, entwickeln Forscher Techniken zur Verbesserung der Robustheit und Widerstandsf\u00e4higkeit von ASR-Systemen. Dies kann die Einbeziehung fortschrittlicher Signalverarbeitungsalgorithmen zum Herausfiltern von Rauschen und Verzerrungen sowie die Erforschung neuer Modellarchitekturen umfassen, die gegen\u00fcber Schwankungen der Sprachqualit\u00e4t robuster sind. Dar\u00fcber hinaus konzentrieren sich die laufenden Forschungsarbeiten auf die Entwicklung neuartiger Bewertungsmetriken und Benchmarking-Verfahren, um die Leistung von ASR-Systemen im Hinblick auf die Erkennung und Abschw\u00e4chung von Halluzinationen zu beurteilen. Durch die systematische Bewertung und Behandlung des Problems der Halluzinationen wollen die Forscher die Gesamtgenauigkeit und Zuverl\u00e4ssigkeit von ASR-Systemen verbessern und letztlich ihren Nutzen und ihre Effektivit\u00e4t in realen Anwendungen steigern. Zusammenfassend l\u00e4sst sich sagen, dass die ASR-Technologie mit Herausforderungen im Zusammenhang mit Akzenten und Sprachvielfalt konfrontiert ist, aber Fortschritte im Bereich des Deep Learning, der Sprachmodellierung und gro\u00dfer Datens\u00e4tze haben die Genauigkeit und Leistung der ASR erheblich verbessert. Die oben genannten Probleme m\u00fcssen jedoch noch gel\u00f6st werden.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Schlussfolgerungen<\/h2>\n\n\n\n<p>Die Entwicklung der Technologie der automatischen Spracherkennung (ASR) von ihren Anf\u00e4ngen bis zur heutigen Zeit stellt eine bemerkenswerte Reise dar, die von transformativen Fortschritten gepr\u00e4gt ist. Von einfachen Systemen, die auf statistischen Ans\u00e4tzen beruhen, bis hin zu hochentwickelten neuronalen Netzen und Transformers hat die ASR einen tiefgreifenden Wandel erfahren, der durch das Streben nach einer nahtlosen Mensch-Computer-Interaktion vorangetrieben wurde.<\/p>\n\n\n\n<p>Diese Entwicklung unterstreicht das unerm\u00fcdliche Streben nach Innovation und Verbesserung der ASR-Technologie, wobei die aktuellen, auf Deep Learning basierenden Systeme ein Beleg f\u00fcr die bemerkenswerten Fortschritte sind. Diese fortschrittlichen ASR-Systeme zeichnen sich dadurch aus, dass sie sich an unterschiedliche Umgebungen und sprachliche Kontexte anpassen und so den Weg f\u00fcr eine verbesserte Zug\u00e4nglichkeit und Benutzerfreundlichkeit in verschiedenen Anwendungen ebnen.<\/p>\n\n\n\n<p>Wir vom <a href=\"https:\/\/www.iais.fraunhofer.de\/en.html\" target=\"_blank\" rel=\"noreferrer noopener\">Fraunhofer IAIS<\/a> und dem <a href=\"https:\/\/lamarr-institute.org\/de\/\" target=\"_blank\" rel=\"noreferrer noopener\">Lamarr-Institut<\/a> sind bestrebt, die mit der ASR-Technologie verbundenen Herausforderungen zu meistern und gleichzeitig die F\u00e4higkeiten der Modelle kontinuierlich zu verbessern. In unserer Forschungs- und Entwicklungsarbeit konzentrieren wir uns auf die \u00dcberwindung der Herausforderungen, wie Robustheit, Out-of-vocabulary-W\u00f6rter (OOV) und Halluzinationen, um die nahtlose Integration von ASR in den Alltag zu erm\u00f6glichen. Unser Ziel ist eine Zukunft in der Sprachtechnologien, ASR im Speziellen, f\u00fcr den Menschen ein allgegenw\u00e4rtiges und unverzichtbares Kommunikations- und Interaktionswerkzeug ist.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Wie hat sich die automatische Spracherkennung (ASR) entwickelt? Erfahre mehr \u00fcber die Hintergr\u00fcnde der Technologie und wie Herausforderungen, wie Robustheit, OOV-W\u00f6rter und Halluzinationen f\u00fcr eine nahtlose Mensch-Computer-Interaktion begegnet werden kann.<\/p>\n","protected":false},"author":14,"featured_media":11635,"template":"","meta":{"_acf_changed":true,"footnotes":""},"blog-category":[1416,390,1418],"blog-tag":[1448,1480,1551,1559,1598,1614],"class_list":["post-11646","blog","type-blog","status-publish","has-post-thumbnail","hentry","blog-category-alle-blogbeitraege","blog-category-grundlagen","blog-category-sprachtechnologien","blog-tag-automatische-spracherkennung-asr","blog-tag-deep-learning-de","blog-tag-large-language-models-llms-de","blog-tag-nlp-de","blog-tag-sprachmodelle","blog-tag-transformer-de"],"acf":[],"publishpress_future_workflow_manual_trigger":{"enabledWorkflows":[]},"_links":{"self":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/11646","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog"}],"about":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/types\/blog"}],"author":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/users\/14"}],"version-history":[{"count":0,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/11646\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media\/11635"}],"wp:attachment":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media?parent=11646"}],"wp:term":[{"taxonomy":"blog-category","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-category?post=11646"},{"taxonomy":"blog-tag","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-tag?post=11646"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}