{"id":4746,"date":"2022-03-02T03:48:27","date_gmt":"2022-03-02T03:48:27","guid":{"rendered":"https:\/\/lamarr-institute.org\/blog\/bewertung-der-chatqualitaet\/"},"modified":"2025-11-12T14:54:46","modified_gmt":"2025-11-12T14:54:46","slug":"bewertung-der-chatqualitaet","status":"publish","type":"blog","link":"https:\/\/lamarr-institute.org\/de\/blog\/bewertung-der-chatqualitaet\/","title":{"rendered":"Bewertung der Chatqualit\u00e4t mit Standard-NLP-Benchmarks"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><span data-contrast=\"auto\">In unserem <\/span><a href=\"https:\/\/machinelearning-blog.de\/forschung\/evaluierung-von-smalltalk\" target=\"_blank\" rel=\"noopener\"><span data-contrast=\"none\">letzten<\/span><\/a><span data-contrast=\"none\"><a href=\"https:\/\/lamarr-institute.org\/de\/evaluierung-von-smalltalk\/\" target=\"_blank\" rel=\"noreferrer noopener\"> <\/a><\/span><a href=\"https:\/\/machinelearning-blog.de\/forschung\/evaluierung-von-smalltalk\" target=\"_blank\" rel=\"noopener\"><span data-contrast=\"none\">Artikel<\/span><\/a><span data-contrast=\"auto\"> wurden Chatbots und ihre automatische Bewertung mittels Sprachmodellen wie GPT2, BERT und XLNet kurz vorgestellt. Dort wurde \u00fcber die Wichtigkeit von Open-Domain-Dialog-Systemen gesprochen. Es wurde gezeigt, wie durch Sprachmodelle (LM) geschlussfolgerte Wahrscheinlichkeiten mit den menschlichen Bewertungsergebnissen korrelieren und daher f\u00fcr die Einsch\u00e4tzung der Dialogqualit\u00e4t geeignet sind.<\/span><\/p>\n\n\n\n<figure class=\"wp-block-image size-full\"><img decoding=\"async\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Bild_1.png\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-25153\" title=\"\"><figcaption class=\"wp-element-caption\">\u00a9 ML2R\n<\/figcaption><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Wie bereits er\u00f6rtert, gibt es verschiedene Kriterien anhand derer man eine Konversation bewerten k\u00f6nnte. Eine Antwort kann sich beispielsweise einer flie\u00dfenden Sprache bedienen, aber v\u00f6llig inkoh\u00e4rent sein, das bedeutet, ohne Bezug auf den vorangegangenen Kontext zu nehmen. Die LM-basierte Bewertung ist so lange praktisch wie sie <strong>keine \u00dcberwachung ben\u00f6tigt<\/strong>. Jedoch hat es auch einen gro\u00dfen Nachteil \u2013 es stellt nur einen einzigen Score \u00fcber die gesamte Qualit\u00e4t dar, ohne dass einzelne Kriterien wie Fl\u00fcssigkeit oder Zusammenhang des Textes ber\u00fccksichtigt werden.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Aber keine Angst, es gibt eine L\u00f6sung f\u00fcr diese Herausforderung! Bevor jedoch die Frage beantwortet werden kann, muss eine Grundlage geschaffen werden: Im Zusammenhang mit KI und ML st\u00f6\u00dft man fast immer auf <strong>Benchmarking<\/strong>, unabh\u00e4ngig von den Teilbereichen. Im Natural Language Processing hat ein Trend auch die Forschung und Entwicklung von Sprachmodellen wie BERT, XLNet und vielen anderen vorangetrieben. Das <strong>General Language Understanding Evaluation<\/strong> (GLUE) Benchmark stellt Ressourcen f\u00fcr die Schulung, Bewertung und Analyse von Natural Language Understanding Systemen bereit. Es enth\u00e4lt insgesamt elf Aufgaben, die darauf abzielen, die Sprachverst\u00e4ndnisf\u00e4higkeiten eines Systems zu bewerten. Das bekannteste Beispiel ist die Stimmungsanalyse (Sentimentanalyse): Hierbei kennzeichnen die Systeme S\u00e4tze als positiv oder negativ. Ein anderes Beispiel ist die Detektion von doppelten Fragen: Die Systeme m\u00fcssen entscheiden, ob zwei Fragen semantisch identisch oder \u00e4hnlich sind.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Wie kann GLUE uns dabei helfen die Dialogqualit\u00e4t zu bewerten? Inzwischen haben Sie vielleicht erraten, dass ein ML-Modell, das bei Corpus of Linguistic Acceptability gut abschneidet, auf die Fl\u00fcssigkeit eines Satzes schlie\u00dfen kann. In \u00e4hnlicher Weise werden paarweise Satzaufgaben wie das Erkennen von Textverkn\u00fcpfungen (engl.: Recognizing Textual Entailment) oder das semantische Text\u00e4hnlichkeits-Benchmark (engl.: Semantic Textual Similarity Benchmark &#8211; STSB) verwendet, um zu pr\u00fcfen, ob eine Antwort mit dem vorangehenden Dialogkontext koh\u00e4rent ist. Jede der paarweisen Satzaufgaben sucht nach verschiedenen semantischen Beziehungen, die auch Dialoge modellieren k\u00f6nnen. Da das Winograd-NLI (WNLI), eine Abwandlung des Winograd-Schemas, und das Multi-Genre Natural Language Inference (MNLI) nicht ohne weiteres auf das Problem der Dialogevaluation abgestimmt werden k\u00f6nnen, werden sie an dieser Stelle nicht verwendet.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Als erstes braucht man Modelle, die auf die GLUE-Aufgaben trainiert sind. Es wurde eine Abk\u00fcrzung genommen, indem man fine-getunte BERT-Instanzen wiederverwendet, welche Teile des <a href=\"https:\/\/github.com\/QData\/TextAttack\" target=\"_blank\" rel=\"noreferrer noopener\">TextAttack-Frameworks<\/a> und auf dem <a href=\"https:\/\/huggingface.co\/models?sort=downloads&amp;search=textattack\" target=\"_blank\" rel=\"noreferrer noopener\">HuggingFace ModelHub<\/a> verf\u00fcgbar sind. BERT wird genutzt, da es eine bew\u00e4hrte Herangehensweise darstellt. Jedoch ist es denkbar, dass man jede neuronale Architektur verwenden k\u00f6nnen sollte. Um die Idee zu validieren, hat man Experimente mit Daten durchgef\u00fchrt, die wissensbasierte, von Menschen bewertete Gespr\u00e4che beinhalten. Die Bewertung erfolgte \u00fcber sechs Kriterien, die zeigen sollten, wie (1) verst\u00e4ndlich, (2) nat\u00fcrlich, (3) kontextbezogen, (4) interessant und (5) wissensbasiert der Text war. Ebenfalls wurde die (6) Gesamtqualit\u00e4t des Dialogs als Kriterium aufgenommen. Anschlie\u00dfend wurden die Wahrscheinlichkeiten mit den menschlichen Annotationen abgeglichen.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Wie erwartet sind hier Pearson und Spearman Korrelationskoeffizienten von bis zu <strong>0,7<\/strong>. Au\u00dferdem haben zum Beispiel die Kriterien wissensbasiert und STSB Korrelationsraten von <strong>0,7329<\/strong> bzw. <strong>0,7173<\/strong>. Auch bei der Verwendung von STSB erh\u00e4lt man Korrelationen von <strong>0,3620<\/strong> und <strong>0,3463<\/strong> mit dem Kriterium kontextbezogen. Aber das ist noch nicht alles!&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Jetzt hat man Qualit\u00e4tsindikatoren f\u00fcr jedes der Kriterien. Es w\u00e4re auch gut, eine Mischung aus diesen Indikatoren zu haben, die die Gesamtqualit\u00e4t anzeigt, da die einzelnen Indikatoren nicht so gut korrelieren. Dazu wurde eine lineare Regression durchgef\u00fchrt und dabei die einzelnen GLUE-Aufgaben als abh\u00e4ngige Variablen und die Gesamtqualit\u00e4tskriterien als Zielgr\u00f6\u00dfe verwendet. Der zusammengesetzte Indikator weist Korrelationskoeffizienten von fast <strong>0,5<\/strong> auf. Im Gegensatz dazu erreicht die beste einzelne GLUE-Aufgabe nur <strong>0,4<\/strong>.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Alle diese Korrelationskoeffizienten implizieren eine Beziehung zwischen den Variablen. Im letzten Beispiel bedeutet ein Wert von <strong>0,5<\/strong>, dass die lineare Regression f\u00fcr jede Einheit der Erh\u00f6hung des Gesamtkriteriums um die H\u00e4lfte reagiert. Mit anderen Worten: Wenn der Bewerter die Punktzahl um <strong>0,1<\/strong> erh\u00f6ht, sollte das Modell dies um <strong>0,05<\/strong> tun.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">In der folgenden Abbildung sind die gelernten Gewichte der linearen Regression dargestellt:<\/p>\n\n\n\n<figure class=\"wp-block-image size-full\"><img loading=\"lazy\" decoding=\"async\" width=\"584\" height=\"255\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Bild_3-1.jpg\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-13391\" title=\"\" srcset=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Bild_3-1.jpg 584w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Bild_3-1-300x131.jpg 300w\" sizes=\"auto, (max-width: 584px) 100vw, 584px\" \/><figcaption class=\"wp-element-caption\">\u00a9 Uni Bonn\/ Fraunhofer IAIS\n<\/figcaption><\/figure>\n\n\n\n<h2 class=\"wp-block-heading\">Fazit<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Man sieht, dass viele dieser Aufgaben einen Einfluss haben &#8211; Manche sind sogar sehr stark. Die Gewichte mit einem \u201eFakten\u201c-Pr\u00e4fix berechnet die Werte zwischen der Wissensbasis des Gespr\u00e4chs und der angestrebten Reaktion. Es ist zu sehen, dass die Aufgaben zur semantischen \u00dcberschneidung, wie der Microsoft Research Paraphrase Corpus und STSB die st\u00e4rkste Rolle haben. Die Beobachtung gilt sowohl f\u00fcr die Messung der Aufgaben am Dialogkontext als auch an der Wissensbasis.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Zusammenfassend l\u00e4sst sich sagen: Die Korrelationskoeffizienten sind zwar gut, aber es gibt noch Raum f\u00fcr Verbesserungen. In Zukunft wird man sich mit anderen derartigen Benchmarks befassen, die m\u00f6glicherweise zus\u00e4tzliche Verbesserungen bringen k\u00f6nnten.&nbsp;&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Mehr in der zugeh\u00f6rigen Publikation:&nbsp;&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Proxy Indicators for the Quality of Open-domain Dialogues<\/strong><br>Rostislav Nedelchev, Jens Lehmann, Ricardo Usbeck, Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing, 2021, <a href=\"https:\/\/jens-lehmann.org\/files\/2021\/emnlp_dialogue_quality.pdf\" target=\"_blank\" rel=\"noreferrer noopener\">PDF<\/a>&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Link zum Code: <a href=\"https:\/\/github.com\/SmartDataAnalytics\/proxy_indicators\" target=\"_blank\" rel=\"noreferrer noopener\">https:\/\/github.com\/SmartDataAnalytics\/proxy_indicators<\/a>&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Dies war ein Gastbeitrag des <a href=\"https:\/\/sda-research.medium.com\/\" target=\"_blank\" rel=\"noreferrer noopener\">SDA Blogs<\/a>. Hier geht es zur englischen Version des Blogbeitrags: <a href=\"https:\/\/sda-research.medium.com\/how-to-evaluate-chat-quality-using-standard-nlp-benchmarks-f12b329e678c\" target=\"_blank\" rel=\"noreferrer noopener\">Link<\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Bisher erstellen Sprachmodell-basierte Bewertungen von Chatbots nur einen Score \u00fcber die Gesamtqualit\u00e4t, ohne beispielsweise den Zusammenhang des Dialogs zu beachten. Mit Modellen, die auf GLUE-Aufgaben trainiert sind, hat das ein Ende.<\/p>\n","protected":false},"author":9,"featured_media":4026,"template":"","meta":{"_acf_changed":false,"footnotes":""},"blog-category":[1416,396,437,1418],"blog-tag":[1452,1516,1559,1598],"class_list":["post-4746","blog","type-blog","status-publish","has-post-thumbnail","hentry","blog-category-alle-blogbeitraege","blog-category-forschung","blog-category-gastbeitrag","blog-category-sprachtechnologien","blog-tag-bert-de","blog-tag-gpt-de","blog-tag-nlp-de","blog-tag-sprachmodelle"],"acf":[],"publishpress_future_workflow_manual_trigger":{"enabledWorkflows":[]},"_links":{"self":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/4746","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog"}],"about":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/types\/blog"}],"author":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/users\/9"}],"version-history":[{"count":0,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/4746\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media\/4026"}],"wp:attachment":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media?parent=4746"}],"wp:term":[{"taxonomy":"blog-category","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-category?post=4746"},{"taxonomy":"blog-tag","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-tag?post=4746"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}