{"id":12746,"date":"2024-06-19T07:22:21","date_gmt":"2024-06-19T07:22:21","guid":{"rendered":"https:\/\/lamarr-institute.org\/?post_type=blog&#038;p=12746"},"modified":"2025-11-12T14:51:11","modified_gmt":"2025-11-12T14:51:11","slug":"multimodale-llms","status":"publish","type":"blog","link":"https:\/\/lamarr-institute.org\/de\/blog\/multimodale-llms\/","title":{"rendered":"Multimodalit\u00e4t in gro\u00dfen Sprachmodellen \u2013 Wie KI immer menschlicher wird\u00a0\u00a0"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Gro\u00dfe Sprachmodelle (engl.: Large Language Models, kurz: LLMs) sind in den letzten Jahren immer leistungsf\u00e4higer, zuverl\u00e4ssiger und verf\u00fcgbarer geworden. Ein Beispiel ist ChatGPT, das weltweit \u00fcber eine einfache und vertraute Chat-Schnittstelle verf\u00fcgbar gemacht wurde. Innerhalb von nur f\u00fcnf Tagen erreichte ChatGPT eine Million Nutzer*innen \u2013 deutlich schneller als die meisten anderen Apps, wie die untenstehende Abbildung zeigt. \u00a0Neuere Versionen k\u00f6nnen nicht nur Text, sondern auch Bilder verarbeiten, und erm\u00f6glichen so eine vielf\u00e4ltigere Interaktion mit den Nutzer*innen. Die Verwendung verschiedener Modalit\u00e4ten steigert die Leistungsf\u00e4higkeit von LLMs erheblich und wird sie zu einem unverzichtbaren Werkzeug f\u00fcr die zuk\u00fcnftige Arbeit mit KI-Assistenten machen. \u00a0Diese Assistenten sind zwar noch nicht in der Lage, eigenst\u00e4ndig Aufgaben zu erledigen, k\u00f6nnen aber Menschen bei vielf\u00e4ltigen Aufgaben unterst\u00fctzen, indem sie erste Entw\u00fcrfe erstellen, die anschlie\u00dfend vom Menschen gefiltert, kuratiert und angepasst werden. In diesem Artikel betrachten wir die j\u00fcngsten Entwicklungen in der KI im Zusammenhang mit LLMs und erkunden m\u00f6gliche zuk\u00fcnftige Richtungen, einschlie\u00dflich der Multimodalit\u00e4t.\u00a0<\/p>\n\n\n\n<figure class=\"wp-block-image size-full\"><img loading=\"lazy\" decoding=\"async\" width=\"451\" height=\"601\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Statistica_Bild.jpg\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-12740\" title=\"\" srcset=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Statistica_Bild.jpg 451w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Statistica_Bild-225x300.jpg 225w\" sizes=\"auto, (max-width: 451px) 100vw, 451px\" \/><figcaption class=\"wp-element-caption\">Anzahl der Monate, die Apps ben\u00f6tigen, um 1 Millionen Nutzer zu erreichen\u00a0<br>Quelle: <a href=\"https:\/\/www.statista.com\/chart\/29174\/time-to-one-million-users\/\" target=\"_blank\" rel=\"noopener\">https:\/\/www.statista.com\/chart\/29174\/time-to-one-million-users\/<\/a><\/figcaption><\/figure>\n\n\n\n<h2 class=\"wp-block-heading\">Was ist ein gro\u00dfes Sprachmodell (LLM)?\u00a0<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Ein gro\u00dfes Sprachmodell (engl.: Large Language Model kurz: LLM) ist ein KI-System, das speziell darauf trainiert wurde, menschliche Sprache zu verstehen und zu erzeugen. Diese Modelle, wie beispielsweise ChatGPT und Gemini, haben sich in den letzten Jahren aufgrund ihrer Gr\u00f6\u00dfe und Leistungsf\u00e4higkeit stark weiterentwickelt. Sie fungieren im Wesentlichen als hochentwickelte Autovervollst\u00e4ndigungen, die auf Textanfragen sinnvolle und pr\u00e4zise Antworten liefern k\u00f6nnen. &nbsp; &nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">LLMs werden mit riesigen Mengen an Textdaten trainiert, was wochenlanges Training auf Hunderten von High-End-GPUs erfordert. &nbsp;Durch die Verarbeitung von Milliarden von Beispielen lernen gro\u00dfe Sprachmodelle, komplexe Sprachmuster zu erkennen und darauf zu reagieren. Traditionell bedeutet das Training mit mehr Daten und die Verwendung eines gr\u00f6\u00dferen Modells eine bessere Performance, weshalb moderne LLMs immer umfangreicher werden.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Text ist die am h\u00e4ufigsten verwendete Eingabeform f\u00fcr LLMs, da er im \u00dcberfluss vorhanden und leicht zu verarbeiten ist. W\u00e4hrend des Trainings werden die Modelle darauf trainiert, das n\u00e4chste Wort in einem Satz vorherzusagen, was zur Entwicklung leistungsstarker Systeme wie ChatGPT beigetragen hat.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Obwohl Text die prim\u00e4re Eingabemodalit\u00e4t bleibt, haben LLMs auch das Potenzial, andere Modalit\u00e4ten wie Audio zu verarbeiten. Dies w\u00fcrde jedoch zus\u00e4tzliche Verarbeitungsressourcen erfordern. Gro\u00dfe Sprachmodelle sind daher ein zentraler Bestandteil der aktuellen Forschung und Entwicklung im Bereich der K\u00fcnstlichen Intelligenz. &nbsp;<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Was ist eine Modalit\u00e4t?\u00a0\u00a0<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Eine Modalit\u00e4t bezeichnet die Art der Daten, die ein Modell empf\u00e4ngt. Typische Modalit\u00e4ten umfassen Audio, Text, Bilder und Video, welches nat\u00fcrlicherweise multimodal ist durch die Kombination von Audio und einer Bildsequenz. Fr\u00fchere KI-Modelle waren oft auf spezialisierte Aufgaben mit einer einzigen Datentyp-Art beschr\u00e4nkt. Ein Modell, das darauf trainiert ist, zwischen Bildern von Katzen und Hunden zu unterscheiden, verarbeitet ausschlie\u00dflich visuelle Eingaben und ist somit unimodal.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Im Gegensatz dazu integriert und verarbeitet ein multimodales Modell mehrere Arten von Daten gleichzeitig. Es nutzt beispielsweise ein Bild eines Tieres, Audioaufnahmen von Tierlauten und eine Textbeschreibung, um seine Leistung zu verbessern. Durch die Verwendung verschiedener Datentypen und -quellen k\u00f6nnen multimodale Modelle umfassendere und genauere Ergebnisse erzielen.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Die Entwicklung von multimodalen Modellen stellt einen bedeutenden Fortschritt in der KI-Forschung dar. Diese Modelle sind in der Lage, Antworten zu verstehen und zu generieren, die den Kontext aus verschiedenen Datenquellen ber\u00fccksichtigen und so die kognitiven F\u00e4higkeiten des Menschen besser nachahmen. Bei der Verarbeitung nat\u00fcrlicher Sprache (NLP) kann ein multimodales Modell beispielsweise nuanciertere und kontextsensitivere Antworten generieren, indem es visuelle oder auditive Informationen neben textlichen Inputs ber\u00fccksichtigt.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Dar\u00fcber hinaus bietet multimodale KI in verschiedenen Anwendungsbereichen praktische Vorteile In der Medizin k\u00f6nnen solche Systeme beispielsweise medizinische Bilder, Patientenakten und klinische Notizen kombinieren, um Diagnosen genauer zu stellen. Im Bereich des autonomen Fahrens erm\u00f6glichen sie Fahrzeugen die Verarbeitung visueller Daten von Kameras, akustischer Signale und textueller Informationen von Stra\u00dfenschildern zur Verbesserung der Sicherheit. Die Integration mehrerer Modalit\u00e4ten bringt jedoch Herausforderungen mit sich, wie erh\u00f6hte Rechenkomplexit\u00e4t und die Entwicklung fortschrittlicher Algorithmen zur effektiven Datensynthese. &nbsp;Trotzdem verspricht die Entwicklung intelligenter und kontextbewusster KI-Systeme in diesem Bereich spannende Fortschritte und Anwendungsm\u00f6glichkeiten.&nbsp;<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Die Vorteile der Multimodalit\u00e4t\u00a0<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Einer der Vorteile der Multimodalit\u00e4t bei gro\u00dfen Sprachmodellen ist, dass verschiedene Datenarten (Modalit\u00e4ten) wie Text, Audio und Bilder kombiniert werden, um die Leistung des KI-Modells zu verbessern. Beispielsweise k\u00f6nnen die Modalit\u00e4ten Text und Audio kombiniert werden, um ein besseres Ergebnis f\u00fcr eine \u00dcbersetzungsaufgabe zu erzielen. Der Mensch macht st\u00e4ndig Gebrauch von mehreren Modalit\u00e4ten (Sinnen), um komplexe Probleme zu l\u00f6sen und sich in der Welt zurecht zu finden. &nbsp;Dabei reagieren wir sehr empfindlich auf Unstimmigkeiten zwischen den von uns wahrgenommenen Modalit\u00e4ten wenn z. B. der Ton in einem Video eine Verz\u00f6gerung hat, lenkt uns das ab und beeintr\u00e4chtigt die Nutzererfahrung. Folglich m\u00fcssen die verschiedenen Modalit\u00e4ten (Bild, Ton, Text usw.) koh\u00e4rent und synchron sein, damit multimodale Systeme effektiv sind. &nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Moderne LLMs durchlaufen einen umfangreichen Trainingsprozess, der in erster Linie mit textbasiertem Vortraining (pre-training) beginnt, bevor zus\u00e4tzliche Modalit\u00e4ten einbezogen werden. Dieser stufenweise Ansatz erm\u00f6glicht es den Modellen, zun\u00e4chst einzelne Modalit\u00e4ten zu beherrschen und sie sp\u00e4ter zu komplexeren, multimodalen (zwei oder mehr Modalit\u00e4ten) Aufgaben zu kombinieren. Dies ist vergleichbar mit der Art und Weise, wie der Lernstoff mit fortschreitender Klassenstufe immer komplexer wird.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Eine derzeitige Einschr\u00e4nkung von Modellen wie ChatGPT ist die Verarbeitung multimodaler Informationen in rein textbasierten Formaten. Die Integration von Text, Audio und Bildern in einen einzigen Textprompt erfordert beispielsweise separate Modelle f\u00fcr die Transkription von Audio und Bildunterschriften, was zu Fehlern f\u00fchren und die Wirksamkeit der kombinierten Informationen einschr\u00e4nken kann. &nbsp;Die Forschung bevorzugt daher die Entwicklung echter multimodaler Modelle, die verschiedene Datenarten innerhalb eines Modells verarbeiten k\u00f6nnen, um genauere Ergebnisse zu erzielen, da die direkte Verarbeitung mehrerer Modalit\u00e4ten innerhalb eines einzigen Modells ein wesentlich robusterer Ansatz ist. &nbsp;<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Erforschung multimodaler Sprachmodelle: Gemini von Google DeepMind als Beispiel\u00a0<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Multimodale Sprachmodelle (LLMs) stellen ein spannendes Forschungsfeld der K\u00fcnstlichen Intelligenz dar. Sie integrieren nahtlos verschiedene Eingabemodi, um das Verst\u00e4ndnis und die Generierung von Antworten zu verbessern. Ein beispielhaftes Modell, das diese F\u00e4higkeit veranschaulicht, ist Gemini von Google DeepMind. Nutzer*innen k\u00f6nnen Bilder hochladen und deren Inhalt durch einen prompt abfragen (Hinweis: Aktuell werden Bilder mit Menschen nicht unterst\u00fctzt). \u00a0 Durch das Stellen mehrerer Fragen k\u00f6nnen Nutzer*innen die F\u00e4higkeiten des Modells erkunden und Schwachstellen in seinem Weltwissen aufdecken. Im Wesentlichen erm\u00f6glicht Gemini den Nutzer*innen eine Bildsuche, indem sie ein Bild bereitstellen und eine Frage stellen. Dar\u00fcber hinaus kann Gemini auch Audio und sogar mehrere Modalit\u00e4ten gleichzeitig verarbeiten.\u00a0<\/p>\n\n\n\n<figure class=\"wp-block-image size-full\"><img loading=\"lazy\" decoding=\"async\" width=\"514\" height=\"539\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Gemini_Bild.png\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-12742\" title=\"\" srcset=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Gemini_Bild.png 514w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Gemini_Bild-286x300.png 286w\" sizes=\"auto, (max-width: 514px) 100vw, 514px\" \/><figcaption class=\"wp-element-caption\">Das obige Bild zeigt einen Fall, in dem Gemini (<a href=\"https:\/\/gemini.google.com\/\" target=\"_blank\" rel=\"noreferrer noopener\">https:\/\/gemini.google.com\/<\/a>) auf eine bildbezogene Frage antwortet, wobei der hervorgehobene Text einen Querverweis mit Google Images anzeigt.\u00a0\u00a0<\/figcaption><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Moderne gro\u00dfe Sprachmodelle (LLMs) verstehen Sprache gut und verkn\u00fcpfen sie mit unserer Alltagswelt. Durch spezifische Strukturkomponenten k\u00f6nnen sie die bereitgestellten Informationen enkodieren und so klare und aussagekr\u00e4ftige Antworten generieren, nicht nur zuf\u00e4llige Wortfolgen.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Eine weitere interessante Anwendung ist &#8222;Be My Eyes&#8220;, eine mobile App f\u00fcr Menschen mit Sehproblemen, die mithilfe von KI-Technologie Bildbeschreibungen bietet und so die Selbstst\u00e4ndigkeit und den Zugang zu Informationen verbessert. Trends in der Forschung zu gro\u00dfen multimodalen Sprachmodellen und zuk\u00fcnftige Entwicklungen.&nbsp;<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Trends in der LLM-Forschung und m\u00f6gliche zuk\u00fcnftige Entwicklungen<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Die Forschung zu gro\u00dfen multimodalen Sprachmodellen LLMs zeigt vielversprechende Trends und spannende Zukunftsperspektiven. &nbsp;Ein Beispiel ist Gemini, das in der Lage ist, Bilder zu analysieren und auf Fragen textbasiert zu antworten. Doch was w\u00e4re, wenn ein Modell wie Gemini nicht nur Bilder analysieren, sondern auch bearbeiten und eine Audiobeschreibung der \u00c4nderungen erstellen k\u00f6nnte? Diese Funktionen sind zwar noch nicht vollst\u00e4ndig umgesetzt, aber sie sind keine ferne Zukunftsvision. &nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Vorstellbar ist eine verbesserte Version der bestehenden Modelle, die praktische Anwendungen erm\u00f6glicht. So k\u00f6nnte eine zuk\u00fcnftige KI sich nahtlos in menschliche Aufgaben einf\u00fcgen und auf Plattformen wie &#8222;<a href=\"https:\/\/de.fiverr.com\/\" target=\"_blank\" rel=\"noreferrer noopener\">fiverr.<\/a>&#8220; Dienstleistungen anbieten. Die fortschreitende Entwicklung dieser KI-Systeme n\u00e4hert sich immer mehr den menschlichen F\u00e4higkeiten an. Menschen nehmen st\u00e4ndig verschiedene Arten von Daten wahr \u2013 visuell, auditiv, olfaktorisch, gustatorisch und taktil. OpenAI hat beispielsweise Spracherkennung mit einem <a href=\"https:\/\/www.youtube.com\/watch?v=Sq1QZB5baNw\" target=\"_blank\" rel=\"noopener\">humanoiden Roboter<\/a> demonstriert, der seine Umgebung sehen, beschreiben und Objekte manipulieren kann. Solche Roboter sind letztlich auch multimodale LLMs.\u00a0<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Der Erfolg von ChatGPT liegt in seiner benutzerfreundlichen Chat-Oberfl\u00e4che, die eine breite Akzeptanz erm\u00f6glicht. K\u00fcnstliche Intelligenz muss intuitiv und leicht zug\u00e4nglich sein, um eine breite Akzeptanz zu erreichen. Denn wenn wir etwas nicht direkt ausprobieren k\u00f6nnen, warum sollten wir es dann benutzen? Aus diesem Grund sind LLMs ein beliebter Trend und bleiben relevant, da zuk\u00fcnftige KI-Systeme mit Menschen kommunizieren und mindestens eine unserer Sprachen beherrschen m\u00fcssen.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ein weiterer interessanter Entwicklungsschritt wird ein LLM sein, das als Agent agiert. Ein Agent empf\u00e4ngt nicht einfach eine Eingabe und produziert eine Ausgabe, sondern l\u00e4uft in einer Art iterativem Prozess und ist in der Lage, seine Handlungen und Gedanken anzupassen, um ein Problem zu l\u00f6sen. Ein Beispiel daf\u00fcr ist die <a href=\"https:\/\/www.cognition-labs.com\/introducing-devin\" target=\"_blank\" rel=\"noopener\">KI Devin<\/a>, die Programmierprobleme l\u00f6sen kann, indem sie die Fehler analysiert, die ihr Code produziert, nach L\u00f6sungen sucht und die Ergebnisse in ihren Code integriert.\u00a0<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Zusammengefasst zeigen die aktuellen Trends in der LLM-Forschung, dass die zuk\u00fcnftige Entwicklung von KI-Systemen noch tiefgreifender in unseren Alltag integriert wird, indem sie unsere Kommunikationsweisen und Probleml\u00f6sungsprozesse immer besser nachahmen und unterst\u00fctzen. Die zuk\u00fcnftige Rolle von LLMs in der K\u00fcnstlichen Intelligenz.\u00a0\u00a0<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Schlusssatz<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">LLMs sind ein zentraler Bestandteil der K\u00fcnstlichen Intelligenz, da sie erstmals eine nahtlose Interaktion mit KI in menschlicher Sprache erm\u00f6glichen. Durch die Integration verschiedener Modalit\u00e4ten in diese Modelle werden sie zunehmend in der Lage sein, komplexere Aufgaben zu bew\u00e4ltigen und menschlichen F\u00e4higkeiten immer n\u00e4her zu kommen. Diese Entwicklung wird die Art und Weise, wie wir mit KI interagieren, grundlegend ver\u00e4ndern und eine allgegenw\u00e4rtige Nutzung von KI f\u00f6rdern.\u00a0<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Gro\u00dfe Sprachmodelle haben in den letzten Jahren beeindruckende F\u00e4higkeiten gezeigt.  Kann Multimodalit\u00e4t sie leistungsf\u00e4higer und menschlicher machen? Erfahren Sie, wie KI immer mehr wie wir denkt.<\/p>\n","protected":false},"author":22,"featured_media":12745,"template":"","meta":{"_acf_changed":false,"footnotes":""},"blog-category":[1416,390,1418],"blog-tag":[1551,1559,1598],"class_list":["post-12746","blog","type-blog","status-publish","has-post-thumbnail","hentry","blog-category-alle-blogbeitraege","blog-category-grundlagen","blog-category-sprachtechnologien","blog-tag-large-language-models-llms-de","blog-tag-nlp-de","blog-tag-sprachmodelle"],"acf":[],"publishpress_future_workflow_manual_trigger":{"enabledWorkflows":[]},"_links":{"self":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/12746","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog"}],"about":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/types\/blog"}],"author":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/users\/22"}],"version-history":[{"count":0,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/12746\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media\/12745"}],"wp:attachment":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media?parent=12746"}],"wp:term":[{"taxonomy":"blog-category","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-category?post=12746"},{"taxonomy":"blog-tag","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-tag?post=12746"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}