{"id":4900,"date":"2023-12-06T09:29:05","date_gmt":"2023-12-06T09:29:05","guid":{"rendered":"https:\/\/lamarr-institute.org\/blog\/datensatz-leichte-sprache\/"},"modified":"2025-11-12T14:54:21","modified_gmt":"2025-11-12T14:54:21","slug":"datensatz-leichte-sprache","status":"publish","type":"blog","link":"https:\/\/lamarr-institute.org\/de\/blog\/datensatz-leichte-sprache\/","title":{"rendered":"Vereinfachte Sprache f\u00fcr alle: Wie man einen Datensatz in Leichter Sprache erstellt"},"content":{"rendered":"\n<p>Die Verwendung von einfacher Sprache macht unsere allt\u00e4gliche Schriftsprache verst\u00e4ndlicher und erm\u00f6glicht einem breiteren Publikum, darunter Kinder, Sprachsch\u00fcler*innen und Menschen mit kognitiven Beeintr\u00e4chtigungen, den Zugang zu ihr. In unserer <a href=\"https:\/\/lamarr-institute.org\/de\/blog\/textvereinfachung-und-ml\/\" target=\"_blank\" rel=\"noreferrer noopener\">Einf\u00fchrung in das Thema Textvereinfachung<\/a> haben wir die mangelnde Vielfalt unter den verf\u00fcgbaren Datens\u00e4tzen hervorgehoben. Um diese L\u00fccke zu schlie\u00dfen, haben wir einen Datensatz in Deutsch und Leichter Sprache erstellt, der 708 aneinander ausgerichtete Dokumente und \u00fcber 10.000 zusammengeh\u00f6rige S\u00e4tze umfasst. Begleiten Sie uns dabei, wie wir die Details des Erstellungsprozesses erl\u00e4utern und auf einige Feinheiten bei der Datensammlung und der Auswertung unserer Satzausrichtung hinweisen.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Ein neuer ausgerichteter Korpus in Leichter Sprache<\/h2>\n\n\n\n<p>In diesem Jahr haben wir den ersten \u00f6ffentlich zug\u00e4nglichen ausgerichteten Datensatz f\u00fcr Leichte Sprache in Deutsch ver\u00f6ffentlicht. Was bedeutet \u201eausgerichtet\u201c? Unser Datensatz ist in zweierlei Hinsicht ausgerichtet: zum einen werden in unserem Datensatz deutsche Artikel mit den entsprechenden Artikeln in Leichter oder Einfacher Sprache gepaart (der Unterschied zwischen diesen beiden Formen der Vereinfachung haben wir in unserem <a href=\"https:\/\/lamarr-institute.org\/de\/blog\/textvereinfachung-und-ml\/\" target=\"_blank\" rel=\"noreferrer noopener\">letzten Blogpost<\/a> beschrieben). Zum anderen pr\u00e4sentieren wir neben dieser Artikel-Ausrichtung auch die Analyse verschiedener Methoden f\u00fcr das automatisierte Finden von Satzpaaren \u2013 ein Bereich, in dem noch aktiv geforscht wird. Das bedeutet, dass wir f\u00fcr jeden Satz in einem deutschen Artikel alle S\u00e4tze in dem Artikel in Leichter Sprache finden wollen, die eine \u00dcbersetzung darstellen w\u00fcrden. Auf diese Weise wird unser Datensatz sowohl auf der Artikel- als auch auf der Satzebene ausgerichtet. In diesem Blogbeitrag werden wir die Methoden und unsere Auswertungsformen im Detail erl\u00e4utern.<\/p>\n\n\n\n<figure class=\"wp-block-image size-full\"><img decoding=\"async\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Fig1-Workflow-Simple-German-Corpus.jpg\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-32109\" title=\"\"><figcaption class=\"wp-element-caption\">Abbildung 1: Die f\u00fcnf Schritte, um zu unserem Datensatz zu gelangen. <br>\u00a9 Vanessa Toborek<\/figcaption><\/figure>\n\n\n\n<h2 class=\"wp-block-heading\">Den Daten auf der Spur: Die f\u00fcnf Schritte zur Erstellung unseres Datensatzes<\/h2>\n\n\n\n<p>Die Erstellung unseres Datensatzes erfolgte in einem f\u00fcnfstufigen Prozess, der in Abbildung 1 dargestellt ist. Schritt eins, die \u201eWebsuche\u201c, bestand darin, eine umfassende Websuche durchzuf\u00fchren und zweisprachige Internetressourcen zu verschiedenen Themen zu finden. In unserem Fall bezieht sich \u201ezweisprachig&#8220; auf Deutsch und eine Form von einfachem Deutsch. Mit Hilfe von Internet-Crawlern extrahierten wir automatisch die Textdaten von den Webseiten. Von allen zweisprachigen Ressourcen die wir gefunden haben, mussten wir einige aussortieren, die aufgrund einer sehr uneinheitlichen Webseiten-Struktur nicht gecrawlt werden konnten. So blieben acht Internetressourcen \u00fcbrig, die eine Reihe unterschiedlicher Themen abdecken, von allgemeinen Gesundheitsinformationen \u00fcber Informationen zu verschiedenen sozialen Diensten bis hin zu deutschen Nachrichtenartikeln. Um unseren Datensatz gegen die Schnelllebigkeit des Internets abzusichern, wurden in Schritt zwei \u201eArchivierung\u201c alle Artikel mit Hilfe der <a href=\"https:\/\/archive.org\/web\/\" target=\"_blank\" rel=\"noreferrer noopener\">WayBackMachine<\/a> vom Internetarchiv archiviert. In Schritt drei, dem \u201eCrawling\u201c, wurden die gesamten Webseiten gecrawlt und die Inhalte als html-Dateien gespeichert, die noch die urspr\u00fcngliche Formatierung der Artikel enthielten. Wir haben &nbsp;die HTML-Dateien f\u00fcr Schritt vier \u201eParsing\u201c verwendet, um aus den html-Dateien den Rohtext zu extrahieren. Dabei haben wir Bilder, html-Tags und entsprechende Metadaten wie z.B. Fettschrift und Absatzgrenzen ignoriert. Zus\u00e4tzlich haben wir Aufz\u00e4hlungen, die in einfacher Sprache h\u00e4ufig vorkommen, in kommagetrennten Text umgewandelt. Der so entstandene Datensatz von aneinander ausgerichteten Artikeln bildet die Grundlage f\u00fcr die anschlie\u00dfende Satzausrichtung in Schritt f\u00fcnf.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Pr\u00e4zision bei der Satzausrichtung: Schritt f\u00fcnf im Detail<\/h2>\n\n\n\n<p>Die automatische Ausrichtung von S\u00e4tzen kann als das Problem beschrieben werden, bei dem man einen deutschen und einen einfachen deutschen Artikel vor sich hat, der jeweils aus einer unterschiedlichen Anzahl von S\u00e4tzen bestehen. Das Ziel der Satzausrichtung ist es, eine Liste von Satzpaaren zu erstellen, wobei jedes Paar aus einem deutschen Satz und seiner (teilweisen) einfachen Version besteht. Die Satzausrichtung erfolgt in drei Schritten:<\/p>\n\n\n\n<ol class=\"wp-block-list\">\n<li>Umwandlung des Rohtextes in Satzlisten und Durchf\u00fchrung einiger leichter Vorverarbeitungen,<\/li>\n\n\n\n<li>Berechnung von \u00c4hnlichkeitswerten und schlie\u00dflich,<\/li>\n\n\n\n<li>die Anwendung eines Algorithmus zur Satzausrichtung.<\/li>\n<\/ol>\n\n\n\n<p>Wir haben die Python-Bibliothek <a href=\"https:\/\/spacy.io\/api\" target=\"_blank\" rel=\"noreferrer noopener\">spaCy<\/a> &nbsp;zur Satzidentifizierung verwendet und &nbsp;mit der Vorverarbeitung des Textes begonnen. Alle Satzzeichen, insbesondere die Bindestriche zwischen zusammengesetzten Substantiven in Leichter Sprache, wurden entfernt. Wir haben den Text nur f\u00fcr die \u00c4hnlichkeitswerte mit TF-IDF-Vektoren in Kleinbuchstaben konvertiert. Wir haben den Text nicht in Kleinbuchstaben umgewandelt, wenn wir die vorberechneten Wortvektoren verwendet haben, da sie sich bei W\u00f6rtern wie z.B. &#8222;essen&#8220; und &#8222;Essen&#8220; unterscheiden. Schlie\u00dflich haben wir alle geschlechtsspezifischen Suffixe aus den deutschen Artikeln entfernt. Damit beziehen wir uns auf Wortendungen, die in inklusiver Sprache verwendet werden, um sowohl weibliche als auch andere Geschlechter anzusprechen, und nicht auf Endungen, die m\u00e4nnliche Substantive in ihre weibliche Form umwandeln. Wir haben diese Endungen entfernt, da sie in einfachen deutschen Texten nicht verwendet werden. Diese Vorverarbeitung diente lediglich der Erleichterung der Satzausrichtung, hat aber keinen Einfluss auf unser endg\u00fcltiges Korpus. Der n\u00e4chste Schritt war die Berechnung von \u00c4hnlichkeitsma\u00dfen. Um die \u00c4hnlichkeit von S\u00e4tzen zu berechnen und zu vergleichen, ben\u00f6tigten wir eine numerische Darstellung der S\u00e4tze. Es gibt verschiedene Ans\u00e4tze f\u00fcr die Umwandlung von Text in Zahlen und die acht \u00c4hnlichkeitsma\u00dfe, die wir verglichen haben, decken drei verschiedene M\u00f6glichkeiten ab: tf-idf-Vektoren, Worteinbettungen und Satzeinbettungen. Nach der Umwandlung der S\u00e4tze in Vektoren verwendet jedes \u00c4hnlichkeitsma\u00df auf die eine oder andere Weise die Kosinus\u00e4hnlichkeit, um die \u00c4hnlichkeit zwischen ihnen zu berechnen. Die erste Gruppe von \u00c4hnlichkeitsma\u00dfen (&#8222;4-gram&#8220;, &#8222;bow&#8220;) wandelt die S\u00e4tze in TF-IDF-Vektoren um. Diese Vektoren werden berechnet, indem f\u00fcr jedes Wort in einem Satz berechnet wird, wie oft es in einem bestimmten Dokument vorkommt (Termfrequenz) und wie viele Artikel im gesamten Korpus dieses Wort enthalten (inverse Dokumentfrequenz). Die zweite Gruppe (&#8222;avg&#8220;, &#8222;cosine&#8220;, &#8222;bipartite&#8220;, &#8222;CWASA&#8220;, &#8222;max&#8220;) verwendet vortrainierte Sprachmodelle, die f\u00fcr jedes Wort eine Vektordarstellung durch die Berechnung von Worteinbettungen liefern. Der Unterschied zwischen den \u00c4hnlichkeitsma\u00dfen besteht darin, wie sie die Wortdarstellung zu einer einheitlichen Satzdarstellung kombinieren.<\/p>\n\n\n\n<figure class=\"wp-block-image size-full\"><img decoding=\"async\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Fig2-mst-lis-diagram.jpg\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-32111\" title=\"\"><figcaption class=\"wp-element-caption\">Abbildung 2: MST ordnet jedem einfachen deutschen Satz einen deutschen Satz zu, wobei immer nur die \u00dcbereinstimmung mit der h\u00f6chsten \u00c4hnlichkeit genommen wird. MST-LIS ist restriktiver und w\u00fcrde in diesem Fall die letzte \u00dcbereinstimmung nicht zulassen, da sie gegen die Reihenfolge der Informationen verst\u00f6\u00dft.<br> \u00a9 Vanessa Toborek<\/figcaption><\/figure>\n\n\n\n<p>Schlie\u00dflich gibt es eine \u00c4hnlichkeitsmethode in der dritten Gruppe, die das vortrainierte Sprachmodell Sentence-BERT (SBERT) verwendet, um direkt Satzeinbettungen zu berechnen. Zuletzt k\u00f6nnen wir die Liste der S\u00e4tze und ihre entsprechenden \u00c4hnlichkeitswerte verwenden, um die endg\u00fcltigen Zuordnungen der S\u00e4tze zu berechnen. Anhand der verschiedenen \u00c4hnlichkeitsma\u00dfe berechnen wir die \u00c4hnlichkeit zwischen jedem Satz im deutschen und dem einfachen deutschen Artikel. Anschlie\u00dfend vergleichen wir zwei verschiedene Algorithmen zum Satzabgleich: <a href=\"https:\/\/aclanthology.org\/L18-1615.pdf\" target=\"_blank\" rel=\"noreferrer noopener\">Most Similar Text (MST) und MST mit Longest Increasing Sequence (MST-LIS)<\/a>. Beide Algorithmen w\u00e4hlen f\u00fcr jeden deutschen Satz den \u00e4hnlichsten einfachen deutschen Satz aus. Doch w\u00e4hrend der eine Algorithmus (MST) dies auf naive Weise tut, ber\u00fccksichtigt der andere (MST-LIS) zus\u00e4tzlich die Reihenfolge der Informationen in jedem Artikel und ordnet zwei S\u00e4tze nur dann einander zu, wenn sie die Reihenfolge der zuvor \u00fcbereinstimmenden S\u00e4tze nicht verletzen. Ausgehend von den acht \u00c4hnlichkeitsma\u00dfen und zwei Matching-Algorithmen ergeben sich 16 verschiedene M\u00f6glichkeiten zur Berechnung der endg\u00fcltigen Satzanpassungen. Im Folgenden werden wir zeigen, wie wir die Qualit\u00e4t der einzelnen Ans\u00e4tze bewertet haben.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img decoding=\"async\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/\/results-1-1024x436.png\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-32090\" title=\"\"><figcaption class=\"wp-element-caption\">Abbildung 3: Das rechte Diagramm zeigt die F1-Scores f\u00fcr alle Methoden, die anhand der manuell erstellten Goldstandard-Alignments f\u00fcr 39 Artikel berechnet wurden. Auf der rechten Seite sehen wir die manuelle Alignment-Klassifizierungsgenauigkeit f\u00fcr alle Alignment-Methoden, die auf 4.500 potenziellen Satz\u00fcbereinstimmungen ausgewertet wurden. <br>\u00a9 Vanessa Toborek<\/figcaption><\/figure>\n\n\n\n<h2 class=\"wp-block-heading\">Qualit\u00e4t der Satzausrichtung: Ein zweifacher Bewertungsansatz<\/h2>\n\n\n\n<p>Wir verfolgen einen zweifachen Ansatz, um die verschiedenen Algorithmen zur Satzausrichtung auf unserem neu erstellten Datensatz zu bewerten. Zun\u00e4chst haben wir Goldstandard-Alignments f\u00fcr 39 Artikel erstellt und dann den F1-Score berechnet, um unsere Methoden auszuwerten. Der F1-Score ist das harmonische Mittel zwischen Genauigkeit und Trefferquote \u2013 eine Metrik, die nicht nur ber\u00fccksichtigt, wie viele Satzpaare richtig waren, sondern auch, wie viele potenzielle Satzpaare \u00fcbersehen wurden. Erg\u00e4nzend zu unserer ersten Evaluierung haben wir eine Stichprobe von \u00fcber 4.500 potenziellen Satzpaaren gezogen und eine Person gebeten, anhand von jeweils zwei S\u00e4tzen eine Ja\/Nein-Entscheidung zu treffen, ob die beiden pr\u00e4sentierten S\u00e4tze eine (teilweise) \u00dcbereinstimmung darstellen oder nicht. Diese Art der Auswertung l\u00e4sst zwar keine R\u00fcckschl\u00fcsse auf die Anzahl der verpassten \u00dcbereinstimmungen (d.h. Trefferquote) oder die Beziehung zu erkl\u00e4renden S\u00e4tzen zu, aber wir sind der Meinung, dass sie einen anderen Blickwinkel auf die Qualit\u00e4t der berechneten \u00dcbereinstimmungen erm\u00f6glicht. Eine ausf\u00fchrlichere Erl\u00e4uterung der beiden manuellen Auswertungsmethoden finden Sie in unserer Ver\u00f6ffentlichung &#8222;<a href=\"https:\/\/aclanthology.org\/2023.acl-long.638\/\" target=\"_blank\" rel=\"noopener\">A New Aligned Simple German Corpus<\/a>&#8220; . Abbildung 2 zeigt die Ergebnisse f\u00fcr beide Evaluierungsmethoden. Die Ergebnisse sind zwar \u00e4hnlich, aber wir sollten sie uns genauer ansehen. Im Allgemeinen ist zu erkennen, dass der restriktivere Matching-Algorithmus MST-LIS in beiden Auswertungen eine h\u00f6here Genauigkeit erzielt. Au\u00dferdem geh\u00f6ren die Methoden, die TF-IDF-Vektordarstellungen verwenden, zu den leistungsschwachen Methoden. Die \u00c4hnlichkeitsmethoden SBERT und max schneiden je nach Bewertungsmethode abwechselnd am besten ab. Unsere abschlie\u00dfende Empfehlung geht in Richtung der Verwendung des \u00c4hnlichkeitsma\u00dfes max in Kombination mit MST-LIS, wobei wir bei unseren Satzalignments der Genauigkeit den Vorrang vor der Trefferquote geben. Nichtsdestotrotz empfehlen wir, diese Satzpaare im Hinblick auf die F1-Gesamtpunktzahl mit Vorsicht zu verwenden, da wir viele falsch ausgerichtete Satzpaare erwarten. Abbildung 4 zeigt beispielhafte Satzausrichtungen aus unserem Korpus.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img decoding=\"async\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/\/Beispielsa\u2560etze-1-1024x576.jpg\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-32092\" title=\"\"><figcaption class=\"wp-element-caption\">Abbildung 4: Beispielhafte Satzpaare f\u00fcr Leichte Sprache [LS] und Deutsch [AS] sowie deren \u00dcbersetzungen. Die Beispiele zeigen erfolgreich, teilweise und falsch ausgerichtete S\u00e4tze mit max MST-LIS. <br>\u00a9 Vanessa Toborek<\/figcaption><\/figure>\n\n\n\n<h2 class=\"wp-block-heading\">Abschlie\u00dfende Hinweise: Der Weg zum endg\u00fcltigen Korpus<\/h2>\n\n\n\n<p>In diesem Blogbeitrag haben wir Sie auf unserer Reise zur Erstellung eines neuen Korpus in Deutsch und Leichter Sprache mitgenommen. Wir haben Ihnen gezeigt, wie Sie mit Hilfe von Online-Ressourcen einen Datensatz von Grund auf neu erstellen k\u00f6nnen. Die Modelle f\u00fcr Maschinelles Lernen, die wir trainieren, sind nur so gut wie die Datens\u00e4tze, auf denen sie trainiert werden. Aus diesem Grund m\u00fcssen wir uns stets der m\u00f6glichen Verzerrungen unserer Daten bewusst sein. Dies gilt insbesondere f\u00fcr Daten, die aus dem Internet stammen. Deshalb ver\u00f6ffentlichen wir den Datensatz mit einem begleitenden Datenblatt. Dieses Dokument ist ein strukturierter Ansatz, um m\u00f6gliche Verzerrungen zu dokumentieren, indem es Antworten auf Fragen zur Motivation, Details zur Datenerfassung und -pflege und vieles mehr enth\u00e4lt. Neben seiner prim\u00e4ren Verwendung f\u00fcr das Training von Maschinellen Lernmodellen zur Textvereinfachung ist der Datensatz ein vielseitiges, einsprachiges Korpus, das ebenfalls Anwendungen f\u00fcr Latent Space Disentanglement und das Finetuning bereits trainierter Modelle bietet.<\/p>\n\n\n\n<p>Wenn Sie tiefer ins Thema einsteigen wollen, dann klicken Sie hier f\u00fcr die Ver\u00f6ffentlichung: &#8222;<a href=\"https:\/\/aclanthology.org\/2023.acl-long.638\/\" target=\"_blank\" rel=\"noreferrer noopener\">A New Aligned Simple German Corpus<\/a>&#8222;.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>ML-Modelle sind nur so vielf\u00e4ltig wie die Datens\u00e4tze, auf denen sie trainiert wurden. Erfahren Sie mehr \u00fcber den ersten \u00f6ffentlich zug\u00e4nglichen Datensatz in Deutsch und Leichter Sprache, den wir bereitstellen.<\/p>\n","protected":false},"author":16,"featured_media":3878,"template":"","meta":{"_acf_changed":false,"footnotes":""},"blog-category":[1416,396,1418],"blog-tag":[1451,1452,1477,1478,1528,1559],"class_list":["post-4900","blog","type-blog","status-publish","has-post-thumbnail","hentry","blog-category-alle-blogbeitraege","blog-category-forschung","blog-category-sprachtechnologien","blog-tag-barrierefreiheit","blog-tag-bert-de","blog-tag-data-science-de","blog-tag-datensatz","blog-tag-ki-in-der-politik","blog-tag-nlp-de"],"acf":[],"publishpress_future_workflow_manual_trigger":{"enabledWorkflows":[]},"_links":{"self":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/4900","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog"}],"about":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/types\/blog"}],"author":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/users\/16"}],"version-history":[{"count":0,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/4900\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media\/3878"}],"wp:attachment":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media?parent=4900"}],"wp:term":[{"taxonomy":"blog-category","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-category?post=4900"},{"taxonomy":"blog-tag","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-tag?post=4900"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}