{"id":12910,"date":"2024-07-03T08:16:16","date_gmt":"2024-07-03T08:16:16","guid":{"rendered":"https:\/\/lamarr-institute.org\/?post_type=blog&#038;p=12910"},"modified":"2025-11-12T14:51:11","modified_gmt":"2025-11-12T14:51:11","slug":"ki-trainingsdaten-bias","status":"publish","type":"blog","link":"https:\/\/lamarr-institute.org\/de\/blog\/ki-trainingsdaten-bias\/","title":{"rendered":"Ethischer Umgang mit Trainingsdaten: F\u00fcr Fairness und Datenschutz in KI-Systemen"},"content":{"rendered":"\n<p>Die rasanten Entwicklungen im Bereich der K\u00fcnstlichen Intelligenz (KI) seit Anfang der 2010er Jahre haben in der Welt ihre Spuren hinterlassen. Unz\u00e4hlige neue Anwendungen sind entstanden, deren H\u00f6hepunkt in der Ver\u00f6ffentlichung von ChatGPT m\u00fcndete. Die Auswirkungen auf die Gesellschaft sind immens: Modelle des Maschinellen Lernens helfen bei kritischen Prozessen wie der <a href=\"https:\/\/publica.fraunhofer.de\/entities\/publication\/2cebb89f-2d33-4134-87b6-67bdc95b3fbc\/details\" target=\"_blank\" rel=\"noreferrer noopener\">Krebsdiagnose<\/a>, <a href=\"https:\/\/www.iais.fraunhofer.de\/de\/geschaeftsfelder\/big-data-analytics-and-intelligence\/fraunhofer-fraud-detection.html\" target=\"_blank\" rel=\"noreferrer noopener\">Betrugserkennung<\/a> oder <a href=\"https:\/\/deepmind.google\/technologies\/alphafold\/\" target=\"_blank\" rel=\"noreferrer noopener\">Vorhersage von Proteinstrukturen<\/a>.<\/p>\n\n\n\n<p>Die Modelle, die den KI-Anwendungen zugrunde liegen, werden verwendet, um in realen Situationen Entscheidungen zu treffen und Empfehlungen zu geben. In dem Bem\u00fchen, diese Situationen so genau wie m\u00f6glich abzubilden, werden die Modelle mit riesigen Datenmengen trainiert, die in der realen Welt gesammelt wurden. Die Menge der Daten h\u00e4ngt von vielen Faktoren ab und variiert stark je nach Anwendungsfall. Ein prominentes Beispiel ist das LLM LLama3 von Meta, das auf 15 Billionen Token trainiert wurde und derzeit eines der besten Open-Source-LLMs ist.<\/p>\n\n\n\n<p>Obwohl dieser Ansatz zur L\u00f6sung vieler Probleme gut geeignet ist, ist er mit mehreren ethischen Bedenken verbunden.<\/p>\n\n\n\n<p>Ein Mangel an sorgf\u00e4ltiger Datenaufbereitung kann zu unerw\u00fcnschten Ergebnissen f\u00fchren. Bias in Datens\u00e4tzen f\u00fchrt zu Fairness-Problemen, zur Aufrechterhaltung gesellschaftlicher Ungleichheiten und zur Diskriminierung von Minderheiten. Schlimmer noch, es besteht die Gefahr, dass private und vertrauliche Informationen durch Modellausgaben offengelegt werden und in die falschen H\u00e4nde geraten. Dar\u00fcber hinaus ist es aufgrund der Komplexit\u00e4t und Undurchsichtigkeit von Deep Learning Modellen oft schwierig, die Ursachen dieser Probleme zu ermitteln. All diese Probleme erfordern Ma\u00dfnahmen von politischen Entscheidungstr\u00e4ger*innen und Entwickler*innen, um die ethische Nutzung von Daten zu gew\u00e4hrleisten.<\/p>\n\n\n\n<p>In den folgenden Abschnitten beleuchten wir die oben genannten Probleme und zeigen auf, wie sie \u00fcberwunden werden k\u00f6nnen. Au\u00dferdem gehen wir auf den rechtlichen Rahmen ein, der einen fairen und transparenten Handlungsspielraum f\u00fcr alle Beteiligten schaffen soll.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Bias und Fairness in KI-Trainingsdaten: Ethische Herausforderungen bew\u00e4ltigen<\/h2>\n\n\n\n<p>KI-Modelle st\u00fctzen sich bei ihren Entscheidungen auf Daten aus der realen Welt. Diese Daten spiegeln jedoch h\u00e4ufig gesellschaftliche Vorurteile wider, was zu impliziten und expliziten Vorurteilen in Datens\u00e4tzen f\u00fchrt. Diese Voreingenommenheit kann bestimmte Gruppen benachteiligen und zu unfairen Modellergebnissen f\u00fchren, wenn bei der Datenauswahl und -bereinigung nicht auf die Vermeidung von Bias geachtet wird. Folglich k\u00f6nnen solche verzerrten Modelle f\u00fcr eine ethische Verwendung ungeeignet sein. Im Folgenden werden einige Beispiele f\u00fcr verschiedene Formen von Bias erl\u00e4utert.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Was ist Bias in Trainingsdaten?<\/h3>\n\n\n\n<p>Bias in Trainingsdaten bezieht sich auf die systematische Bevorzugung bestimmter Entit\u00e4ten oder Gruppen, w\u00e4hrend andere benachteiligt werden. Beim Maschinellen Lernen kann Bias durch verschiedene Faktoren entstehen, steht aber in der Regel in Zusammenhang mit Trainingsdaten. Es gibt mehrere Quellen von Verzerrungen (Bias):<\/p>\n\n\n\n<ol class=\"wp-block-list\">\n<li><strong>Systemischer Bias:<\/strong> Entsteht durch gesellschaftliche Bedingungen, in denen bestimmte Vorurteile in den Daten inh\u00e4rent sind.<\/li>\n\n\n\n<li><strong>Datenerfassung und -annotation:<\/strong> Bias kann w\u00e4hrend des Prozesses der Datenerfassung oder -Annotation entstehen.<\/li>\n\n\n\n<li><strong>Algorithmus- oder Systemdesign:<\/strong> Manchmal entsteht Bias durch die Wahl des Algorithmus oder des Systemdesigns.<\/li>\n<\/ol>\n\n\n\n<p>Das folgende Video bietet eine kurze Einf\u00fchrung in Bias und einige Faktoren, die dazu beitragen:<\/p>\n\n\n\n<figure class=\"wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio\"><div class=\"wp-block-embed__wrapper\">\n <div class=\"brlbs-cmpnt-container brlbs-cmpnt-content-blocker brlbs-cmpnt-with-individual-styles\" data-borlabs-cookie-content-blocker-id=\"youtube-content-blocker\" data-borlabs-cookie-content=\"PGlmcmFtZSB0aXRsZT0iQUk6IFRyYWluaW5nIERhdGEgJmFtcDsgQmlhcyIgd2lkdGg9IjY0MCIgaGVpZ2h0PSIzNjAiIHNyYz0iaHR0cHM6Ly93d3cueW91dHViZS1ub2Nvb2tpZS5jb20vZW1iZWQveDJtUm9GTm0yMmc\/ZmVhdHVyZT1vZW1iZWQiIGZyYW1lYm9yZGVyPSIwIiBhbGxvdz0iYWNjZWxlcm9tZXRlcjsgYXV0b3BsYXk7IGNsaXBib2FyZC13cml0ZTsgZW5jcnlwdGVkLW1lZGlhOyBneXJvc2NvcGU7IHBpY3R1cmUtaW4tcGljdHVyZTsgd2ViLXNoYXJlIiByZWZlcnJlcnBvbGljeT0ic3RyaWN0LW9yaWdpbi13aGVuLWNyb3NzLW9yaWdpbiIgYWxsb3dmdWxsc2NyZWVuPjwvaWZyYW1lPg==\"><div class=\"brlbs-cmpnt-cb-preset-c brlbs-cmpnt-cb-youtube\"> <div class=\"brlbs-cmpnt-cb-thumbnail\" style=\"background-image: url('https:\/\/lamarr-institute.org\/wp-content\/uploads\/borlabs-cookie\/1\/yt_x2mRoFNm22g_hqdefault.jpg')\"><\/div> <div class=\"brlbs-cmpnt-cb-main\"> <div class=\"brlbs-cmpnt-cb-play-button\"><\/div> <div class=\"brlbs-cmpnt-cb-content\"> <p class=\"brlbs-cmpnt-cb-description\">Sie sehen gerade einen Platzhalterinhalt von <strong>YouTube<\/strong>. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfl\u00e4che unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.<\/p> <a class=\"brlbs-cmpnt-cb-provider-toggle\" href=\"#\" data-borlabs-cookie-show-provider-information role=\"button\">Mehr Informationen<\/a> <\/div> <div class=\"brlbs-cmpnt-cb-buttons\"> <a class=\"brlbs-cmpnt-cb-btn\" href=\"#\" data-borlabs-cookie-unblock role=\"button\">Inhalt entsperren<\/a> <a class=\"brlbs-cmpnt-cb-btn\" href=\"#\" data-borlabs-cookie-accept-service role=\"button\" style=\"display: inherit\">Erforderlichen Service akzeptieren und Inhalte entsperren<\/a> <\/div> <\/div> <\/div><\/div>\n<\/div><\/figure>\n\n\n\n<p>In der Vergangenheit gab es mehrere F\u00e4lle von Bias in KI-Anwendungen, die zu ethischen Problemen f\u00fchrten. Die n\u00e4chsten Abschnitte zeigen zwei Beispiele, um verschiedene Arten von Bias zu veranschaulichen.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">COMPAS-Algorithmus und rassistischer Bias<\/h3>\n\n\n\n<p>Einer der am h\u00e4ufigsten zitierten F\u00e4lle von Bias in der KI ist der COMPAS-Algorithmus, der verwendet wird, um die R\u00fcckfallwahrscheinlichkeit unter straff\u00e4lligen Angeklagten in den Vereinigten Staaten zu messen. Der Algorithmus stuft schwarze Angeklagte im Vergleich zu wei\u00dfen Angeklagten als \u00fcberproportional r\u00fcckfallgef\u00e4hrdet ein.<\/p>\n\n\n\n<p>Das folgende Video enth\u00e4lt eine umfassende Kritik am COMPAS-Algorithmus, die dessen rassistische Ausrichtung hervorhebt und auf die urspr\u00fcngliche <a href=\"https:\/\/www.propublica.org\/article\/how-we-analyzed-the-compas-recidivism-algorithm\" target=\"_blank\" rel=\"noreferrer noopener\">ProPublica-Studie<\/a> verweist.<\/p>\n\n\n\n<figure class=\"wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio\"><div class=\"wp-block-embed__wrapper\">\n <div class=\"brlbs-cmpnt-container brlbs-cmpnt-content-blocker brlbs-cmpnt-with-individual-styles\" data-borlabs-cookie-content-blocker-id=\"youtube-content-blocker\" data-borlabs-cookie-content=\"PGlmcmFtZSB0aXRsZT0iVGhlIERhbmdlcm91cyBNYXRoIFVzZWQgVG8gUHJlZGljdCBDcmltaW5hbHMiIHdpZHRoPSI2NDAiIGhlaWdodD0iMzYwIiBzcmM9Imh0dHBzOi8vd3d3LnlvdXR1YmUtbm9jb29raWUuY29tL2VtYmVkL1RxbllmMmg2QS1rP2ZlYXR1cmU9b2VtYmVkIiBmcmFtZWJvcmRlcj0iMCIgYWxsb3c9ImFjY2VsZXJvbWV0ZXI7IGF1dG9wbGF5OyBjbGlwYm9hcmQtd3JpdGU7IGVuY3J5cHRlZC1tZWRpYTsgZ3lyb3Njb3BlOyBwaWN0dXJlLWluLXBpY3R1cmU7IHdlYi1zaGFyZSIgcmVmZXJyZXJwb2xpY3k9InN0cmljdC1vcmlnaW4td2hlbi1jcm9zcy1vcmlnaW4iIGFsbG93ZnVsbHNjcmVlbj48L2lmcmFtZT4=\"><div class=\"brlbs-cmpnt-cb-preset-c brlbs-cmpnt-cb-youtube\"> <div class=\"brlbs-cmpnt-cb-thumbnail\" style=\"background-image: url('https:\/\/lamarr-institute.org\/wp-content\/uploads\/borlabs-cookie\/1\/yt_TqnYf2h6A-k_hqdefault.jpg')\"><\/div> <div class=\"brlbs-cmpnt-cb-main\"> <div class=\"brlbs-cmpnt-cb-play-button\"><\/div> <div class=\"brlbs-cmpnt-cb-content\"> <p class=\"brlbs-cmpnt-cb-description\">Sie sehen gerade einen Platzhalterinhalt von <strong>YouTube<\/strong>. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfl\u00e4che unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.<\/p> <a class=\"brlbs-cmpnt-cb-provider-toggle\" href=\"#\" data-borlabs-cookie-show-provider-information role=\"button\">Mehr Informationen<\/a> <\/div> <div class=\"brlbs-cmpnt-cb-buttons\"> <a class=\"brlbs-cmpnt-cb-btn\" href=\"#\" data-borlabs-cookie-unblock role=\"button\">Inhalt entsperren<\/a> <a class=\"brlbs-cmpnt-cb-btn\" href=\"#\" data-borlabs-cookie-accept-service role=\"button\" style=\"display: inherit\">Erforderlichen Service akzeptieren und Inhalte entsperren<\/a> <\/div> <\/div> <\/div><\/div>\n<\/div><\/figure>\n\n\n\n<p>Der COMPAS-Fall ist besonders bemerkenswert, weil die Datenerhebung in einem kontrollierten Rahmen erfolgte. Wie in dem Video erw\u00e4hnt, basieren die Vorhersagen auf einer Reihe von Fragen, die die Angeklagten beantworten m\u00fcssen. Obwohl diese Fragen nicht offen diskriminierend zu sein scheinen, werden implizit Eigenschaften abgefragt und verurteilt, die eher mit schwarzen Personen in Verbindung gebracht werden. Dieser Designfehler des Algorithmus und des Fragebogens f\u00fchrte zu erheblichen <strong>algorithmischen<\/strong> und <strong>messtechnischen<\/strong> <strong>Verzerrungen (Bias)<\/strong>. Zwar sollte das KI-Tool die Wahrscheinlichkeit einer Wiederholungstat vorhersagen, jedoch wurden die Fragen durch die Zuordnung zu einer ethnischen Gruppe verzerrt, anstatt das beabsichtigte Ph\u00e4nomen genau zu messen.<\/p>\n\n\n\n<p>COMPAS ist nur eines von vielen KI-Tools, bei denen rassistischer Bias festgestellt wurde. Andere Beispiele sind ein <a href=\"https:\/\/www.bbc.com\/news\/technology-58462511\" target=\"_blank\" rel=\"noreferrer noopener\">Facebook-Bilderkennungstool<\/a>, das schwarze M\u00e4nner f\u00e4lschlicherweise als &#8222;Primaten&#8220; einstufte, und ein <a href=\"https:\/\/www.hsph.harvard.edu\/news\/hsph-in-the-news\/study-widely-used-health-care-algorithm-has-racial-bias\/\" target=\"_blank\" rel=\"noreferrer noopener\">Optum-System<\/a>, das die Gesundheitsbed\u00fcrfnisse schwarzer Patienten aufgrund systematischer Ungleichheiten beim Zugang zu Pflege und Behandlung untersch\u00e4tzte.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Amazon-Rekrutierungstool und Gender-Bias<\/h3>\n\n\n\n<p>Amazons Einsatz eines KI-Rekrutierungstools zur Unterst\u00fctzung interner Einstellungsentscheidungen ist ein weiteres auff\u00e4lliges Beispiel f\u00fcr Bias in der Technologie. Das Modell wurde mit Lebensl\u00e4ufen aus dem vergangenen Jahrzehnt trainiert, die \u00fcberwiegend von m\u00e4nnlichen Bewerbern verfasst wurden. Folglich stufte das KI-Modell Lebensl\u00e4ufe herab, die das Wort &#8222;Frauen&#8220; enthielten oder reine Frauenhochschulen erw\u00e4hnten.<\/p>\n\n\n\n<p>Das folgende Video bietet einen Bericht \u00fcber das Amazon-Tool:<\/p>\n\n\n\n<figure class=\"wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio\"><div class=\"wp-block-embed__wrapper\">\n <div class=\"brlbs-cmpnt-container brlbs-cmpnt-content-blocker brlbs-cmpnt-with-individual-styles\" data-borlabs-cookie-content-blocker-id=\"youtube-content-blocker\" data-borlabs-cookie-content=\"PGlmcmFtZSB0aXRsZT0iQW1hem9uIHNjcmFwcyBBSSByZWNydWl0aW5nIHRvb2wgc2hvd2luZyBiaWFzIGFnYWluc3Qgd29tZW4iIHdpZHRoPSI2NDAiIGhlaWdodD0iMzYwIiBzcmM9Imh0dHBzOi8vd3d3LnlvdXR1YmUtbm9jb29raWUuY29tL2VtYmVkL1F2Ulp1SFFCVHBzP2ZlYXR1cmU9b2VtYmVkIiBmcmFtZWJvcmRlcj0iMCIgYWxsb3c9ImFjY2VsZXJvbWV0ZXI7IGF1dG9wbGF5OyBjbGlwYm9hcmQtd3JpdGU7IGVuY3J5cHRlZC1tZWRpYTsgZ3lyb3Njb3BlOyBwaWN0dXJlLWluLXBpY3R1cmU7IHdlYi1zaGFyZSIgcmVmZXJyZXJwb2xpY3k9InN0cmljdC1vcmlnaW4td2hlbi1jcm9zcy1vcmlnaW4iIGFsbG93ZnVsbHNjcmVlbj48L2lmcmFtZT4=\"><div class=\"brlbs-cmpnt-cb-preset-c brlbs-cmpnt-cb-youtube\"> <div class=\"brlbs-cmpnt-cb-thumbnail\" style=\"background-image: url('https:\/\/lamarr-institute.org\/wp-content\/uploads\/borlabs-cookie\/1\/yt_QvRZuHQBTps_hqdefault.jpg')\"><\/div> <div class=\"brlbs-cmpnt-cb-main\"> <div class=\"brlbs-cmpnt-cb-play-button\"><\/div> <div class=\"brlbs-cmpnt-cb-content\"> <p class=\"brlbs-cmpnt-cb-description\">Sie sehen gerade einen Platzhalterinhalt von <strong>YouTube<\/strong>. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfl\u00e4che unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.<\/p> <a class=\"brlbs-cmpnt-cb-provider-toggle\" href=\"#\" data-borlabs-cookie-show-provider-information role=\"button\">Mehr Informationen<\/a> <\/div> <div class=\"brlbs-cmpnt-cb-buttons\"> <a class=\"brlbs-cmpnt-cb-btn\" href=\"#\" data-borlabs-cookie-unblock role=\"button\">Inhalt entsperren<\/a> <a class=\"brlbs-cmpnt-cb-btn\" href=\"#\" data-borlabs-cookie-accept-service role=\"button\" style=\"display: inherit\">Erforderlichen Service akzeptieren und Inhalte entsperren<\/a> <\/div> <\/div> <\/div><\/div>\n<\/div><\/figure>\n\n\n\n<p>Dieser Fall zeigt <strong>systemischen Bias<\/strong>, der aus der historischen Dominanz von M\u00e4nnern in der Technologiebranche resultiert. Er demonstriert auch, dass eine schlechte Kuratierung der Trainingsdaten zu <strong>Selektionsverzerrungen<\/strong> <strong>(Selection Bias)<\/strong> f\u00fchrt. Dies bedeutet, dass die Trainingsdaten aufgrund der Unterrepr\u00e4sentation einer bestimmten Gruppe nicht repr\u00e4sentativ f\u00fcr die gesamte Bev\u00f6lkerung sind. In extremen F\u00e4llen kann sich dies als <strong>Ausschlussverzerrung (Exclusion Bias)<\/strong> manifestieren, was bedeutet, dass eine Gruppe vollst\u00e4ndig ausgelassen wird.<\/p>\n\n\n\n<p>Um solche Verzerrungen zu vermeiden, m\u00fcssen Entwickler*innen bei der Datenerfassung auf ein ausgewogenes Geschlechterverh\u00e4ltnis achten. Dieser Ansatz k\u00f6nnte jedoch eine weitere Herausforderung darstellen: Die Ausgewogenheit der Lebensl\u00e4ufe beider Geschlechter h\u00e4tte die Gesamtzahl der f\u00fcr das Training verf\u00fcgbaren Lebensl\u00e4ufe (Daten) verringern k\u00f6nnen, was die Zuverl\u00e4ssigkeit des Modells beeintr\u00e4chtigen k\u00f6nnte. Dieses Szenario veranschaulicht die Schwierigkeit, Verzerrungen aufgrund von Ressourcenbeschr\u00e4nkungen vollst\u00e4ndig zu eliminieren. <\/p>\n\n\n\n<p>Der Artikel \u201c<a href=\"https:\/\/www.technologyreview.com\/2018\/10\/10\/139858\/amazon-ditched-ai-recruitment-software-because-it-was-biased-against-women\" target=\"_blank\" rel=\"noreferrer noopener\">Amazon ditched AI recruitment software because it was biased against women<\/a>\u201d  im MIT Technology Review bietet weitere Einblicke.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Erkennung und Reduktion von Bias<\/h3>\n\n\n\n<p>Bias in Modellen des Maschinellen Lernens kann in verschiedenen Formen auftreten und bleibt oft unbemerkt, bis die Modelle eingesetzt werden. Um solche Biases zu verhindern und unvoreingenommene Modelle zu trainieren, sind sorgf\u00e4ltige \u00dcberlegungen und systematische Ans\u00e4tze erforderlich. Nachfolgend die wichtigsten Schritte, um diese Aufgabe zu bew\u00e4ltigen:<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">\u00dcberlegungen vor dem Training:<\/h3>\n\n\n\n<ol class=\"wp-block-list\">\n<li><strong>Bewertung der Auswirkungen:<\/strong> Pr\u00fcfen Sie, wie stark Ihr System das Leben der davon Betroffenen beeinflussen wird.<\/li>\n\n\n\n<li><strong>Ethische Implikationen:<\/strong> Bestimmen Sie, ob es ethisch vertretbar ist, ein KI-System f\u00fcr die jeweilige Aufgabe Entscheidungen treffen zu lassen.<\/li>\n\n\n\n<li><strong>Eignung der Daten:<\/strong> Stellen Sie sicher, dass Sie gen\u00fcgend und repr\u00e4sentative Daten f\u00fcr alle betroffenen Gruppen haben.<\/li>\n<\/ol>\n\n\n\n<h3 class=\"wp-block-heading\">Best Practices zur Erkennung und Vermeidung von Bias in KI-Systemen:<\/h3>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Problemverst\u00e4ndnis:<\/strong> Verstehen Sie das Problem, das Sie l\u00f6sen wollen, vollst\u00e4ndig.<\/li>\n\n\n\n<li><strong>\u00dcberpr\u00fcfung der Datenerhebung:<\/strong> Analysieren Sie Ihre Datenerhebungsmethode, um potenzielle Biases zu identifizieren und abzuschw\u00e4chen<\/li>\n\n\n\n<li><strong>Daten\u00fcberpr\u00fcfung:<\/strong> Pr\u00fcfen Sie die Daten sorgf\u00e4ltig, um latente Variablen wie Herkunft oder Geschlecht zu identifizieren, die m\u00f6glicherweise nicht explizit angegeben werden.<\/li>\n\n\n\n<li><strong>Vielf\u00e4ltige Testgruppen:<\/strong> Verwenden Sie Testgruppen, die die gesamte Datenpopulation genau repr\u00e4sentieren und auch Ausnahmen abdecken.<\/li>\n\n\n\n<li><strong>Ausgewogenheit der Gruppen: <\/strong>Versuchen Sie, Ungleichgewichte zwischen Gruppen so weit wie m\u00f6glich zu vermeiden.<\/li>\n\n\n\n<li><strong>Kreuz-Validierung:<\/strong> Verwenden Sie Techniken der Kreuz-Validierung, um das Modell auf verschiedenen Datens\u00e4tzen zu testen.<\/li>\n\n\n\n<li><strong>Overfitting vermeiden:<\/strong> Stellen Sie sicher, dass Ihr Modell gut generalisiert, indem Sie Overfitting verhindern.<\/li>\n\n\n\n<li><strong>Kontinuierliches Monitoring:<\/strong> \u00dcberwachen Sie Modelle im Einsatz und sammeln Sie Feedback, um sie kontinuierlich zu verbessern und Bias zu minimieren.<\/li>\n<\/ul>\n\n\n\n<p>Durch die Einhaltung dieser Vorgehensweisen k\u00f6nnen Sie das Risiko von Bias in Ihren KI-Systemen erheblich reduzieren und fairere und ethischere Modelle entwickeln.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Datenschutz und Sicherheit<\/h2>\n\n\n\n<p>Gesetze zum Datenschutz und zum Schutz der Privatsph\u00e4re sind von entscheidender Bedeutung, um sicherzustellen, dass personenbezogene Daten ethisch korrekt und sicher behandelt werden. Einer der wichtigsten rechtlichen Rahmen ist die <a href=\"https:\/\/www.bmwk.de\/Redaktion\/DE\/Artikel\/Digitale-Welt\/europaeische-datenschutzgrundverordnung.html\" target=\"_blank\" rel=\"noreferrer noopener\">Datenschutz-Grundverordnung (DSGVO)<\/a>, die 2018 von der Europ\u00e4ischen Union erlassen wurde. Die DSGVO legt strenge Richtlinien f\u00fcr die Erhebung, Verarbeitung, Speicherung und Weitergabe personenbezogener Daten fest.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><strong>Die Kernprinzipien der DSGVO:<\/strong><\/h3>\n\n\n\n<ol class=\"wp-block-list\">\n<li><strong><u>Rechtm\u00e4\u00dfigkeit, Fairness und Transparenz:<\/u><\/strong> Entsprechend der Rechtsgrundlage m\u00fcssen Sie klar darlegen, welche Daten erhoben werden und warum, um eine faire Nutzung der Daten ohne Benachteiligung einer Gruppe zu gew\u00e4hrleisten.<\/li>\n\n\n\n<li><strong><u>Zweckbindung:<\/u><\/strong> Sammeln Sie Daten f\u00fcr festgelegte, eindeutige und legitime Zwecke und verarbeiten Sie sie nicht weiter auf eine mit diesen Zwecken unvereinbare Weise.<\/li>\n\n\n\n<li><strong><u>Datenminimierung:<\/u><\/strong> Sammeln und verarbeiten Sie nur die Daten, die f\u00fcr den beabsichtigten Zweck notwendig sind.<\/li>\n\n\n\n<li><strong><u>Richtigkeit:<\/u><\/strong> Halten Sie personenbezogene Daten genau und auf dem neuesten Stand.<\/li>\n\n\n\n<li><strong><u>Speicherbegrenzung:<\/u><\/strong> Speichern Sie Daten nur so lange, wie es f\u00fcr den beabsichtigten Zweck notwendig ist.<\/li>\n\n\n\n<li><strong><u>Integrit\u00e4t und Vertraulichkeit<\/u><\/strong>: Verarbeiten Sie Daten auf sichere Weise, um sie vor unbefugter oder unrechtm\u00e4\u00dfiger Verarbeitung und versehentlichem Verlust zu sch\u00fctzen.<\/li>\n\n\n\n<li><strong><u>Rechenschaftspflicht:<\/u><\/strong> Organisationen m\u00fcssen die Einhaltung dieser Datenschutzgrunds\u00e4tze nachweisen k\u00f6nnen.<\/li>\n<\/ol>\n\n\n\n<p>Das k\u00fcrzlich erlassene <a href=\"https:\/\/www.willkie.com\/-\/media\/files\/publications\/2024\/03\/the_eu_ai_act_is_here_what_you_can_do_to_prepare.pdf\" target=\"_blank\" rel=\"noreferrer noopener\">EU-KI-Gesetz<\/a> baut auf der DSGVO auf und klassifiziert KI-Systeme auf der Grundlage ihrer Risikostufen. Zu den &#8222;verbotenen KI-Systemen&#8220; geh\u00f6ren zum Beispiel solche, die Personen auf der Grundlage biometrischer Daten kategorisieren, um bestimmte Arten sensibler Daten abzuleiten. Zusammen bieten die DSGVO und das EU-KI-Gesetz robuste Leitplanken f\u00fcr den Schutz der Privatsph\u00e4re und der Daten des Einzelnen.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"579\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/\/Holz_Spiekermann_Bias-1024x579.png\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-12906\" title=\"\" srcset=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Holz_Spiekermann_Bias-1024x579.png 1024w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Holz_Spiekermann_Bias-300x170.png 300w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Holz_Spiekermann_Bias-768x434.png 768w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Holz_Spiekermann_Bias.png 1379w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\" \/><figcaption class=\"wp-element-caption\">Abb.1 Beispiele f\u00fcr pers\u00f6nliche Identifikatoren. Quelle: <a href=\"https:\/\/www.duocircle.com\/email-security\/data-anonymization-overview-techniques-plus-pros-and-cons\" target=\"_blank\" rel=\"noopener\">https:\/\/www.duocircle.com\/email-security\/data-anonymization-overview-techniques-plus-pros-and-cons<\/a><\/figcaption><\/figure>\n\n\n\n<p>Um diese gesetzlichen Vorschriften einzuhalten und personenbezogene Daten zu sch\u00fctzen, k\u00f6nnen verschiedene technische Ma\u00dfnahmen ergriffen werden:<\/p>\n\n\n\n<ol class=\"wp-block-list\">\n<li><strong>Anonymisierung:<\/strong> Daten so \u00e4ndern, dass pers\u00f6nliche Identifikatoren entfernt oder verschleiert werden, sodass sie nicht mehr auf eine Person zur\u00fcckgef\u00fchrt werden k\u00f6nnen.<\/li>\n\n\n\n<li><strong>Federated Learning:<\/strong> Jede teilnehmende Einheit beh\u00e4lt ihren Datensatz lokal, um ein maschinelles Lernmodell zu trainieren. Die Modellparameter werden geteilt und aggregiert, um sicherzustellen, dass die Daten dezentral und privat bleiben.<\/li>\n\n\n\n<li><strong>Aktive Datenbesitzer-Beteiligung:<\/strong> Einbeziehung der Datenbesitzer in die Vorverarbeitung, das Training und die Bereitstellung. Die Vorverarbeitung und das anf\u00e4ngliche Training k\u00f6nnen lokal durchgef\u00fchrt werden, um sicherzustellen, dass Rohdaten nie exponiert werden. Bei Bedarf kann das Training auf Servern erfolgen, mit lokalem Feintuning. Das endg\u00fcltige Modell kann lokal bereitgestellt werden, um sensible Daten sicher zu halten.<\/li>\n<\/ol>\n\n\n\n<p>Durch die Einhaltung dieser Praktiken und rechtlichen Rahmenbedingungen k\u00f6nnen wir personenbezogene Daten besser sch\u00fctzen und die Privatsph\u00e4re in der \u00c4ra der KI und des maschinellen Lernens wahren.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Potenzieller Missbrauch von personenbezogenen Daten: Ein anschauliches Beispiel<\/h3>\n\n\n\n<p>Ein potenzieller Datenschutzversto\u00df trat nach der Enth\u00fcllung des neuesten Flaggschiffmodells GPT-4o von OpenAI auf. W\u00e4hrend der Pr\u00e4sentation demonstrierte das Modell eine Interaktion mit einer Stimme, die der von Schauspielerin Scarlett Johansson sehr \u00e4hnlich war. Trotz der Ablehnung von OpenAIs Angebot, f\u00fcr die Demo zu kooperieren, <a href=\"https:\/\/www.nature.com\/articles\/d41586-024-01578-4\" target=\"_blank\" rel=\"noreferrer noopener\">glaubt Johansson, dass ihre Stimme f\u00fcr GPT-4o geklont wurde<\/a>. Obwohl der Nachweis, dass ihre Stimme im Training des Modells verwendet wurde, schwierig ist, ist die \u00c4hnlichkeit auffallend.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Transparenz und R\u00fcckverfolgbarkeit<\/h2>\n\n\n\n<p>\u00dcber Fairness, Sicherheit und Vertraulichkeit hinaus fehlt es KI-Anwendungen oft an Transparenz. Moderne Deep Learning-Modelle sind komplex und auf gro\u00dfen Datenmengen trainiert, was ihre Entscheidungsprozesse schwer nachvollziehbar macht. In der Branche spricht man manchmal sogar von maschinellen Lernmodellen als &#8222;Black Boxes&#8220;, was problematisch ist, weil Benutzer und Kunden oft verstehen wollen, wie Systeme zu bestimmten Schlussfolgerungen gelangen, um ihnen zu vertrauen oder sie zu lenken.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Verbesserung der Datentransparenz und R\u00fcckverfolgbarkeit<\/h3>\n\n\n\n<p>Um Transparenzprobleme zu mindern, werden Strategien unter dem Begriff &#8222;Erkl\u00e4rbare KI&#8220; eingesetzt. Ein Ansatz zur Erkl\u00e4rbarkeit besteht darin, Modellarchitekturen zu analysieren, um zu verstehen, wie Komponenten sich auf relevante Konzepte beziehen. Ein Beispiel daf\u00fcr ist die Arbeit von Anthropic im Bereich der Erkl\u00e4rbarkeit von gro\u00dfen Sprachmodellen (LLMs): <a href=\"https:\/\/www.anthropic.com\/news\/mapping-mind-language-model\" target=\"_blank\" rel=\"noreferrer noopener\">https:\/\/www.anthropic.com\/news\/mapping-mind-language-model<\/a>.<\/p>\n\n\n\n<p>Da die Daten in modernen Deep-Learning-Anwendungen oft einen gr\u00f6\u00dferen Einfluss auf die Ergebnisse haben als die Modellarchitektur, ist der interessantere Ansatz f\u00fcr diesen Blogbeitrag, wie man Trainingsdaten besser r\u00fcckverfolgbar und transparent machen kann.<\/p>\n\n\n\n<p>Ein wichtiger Schritt ist die Registrierung der <strong>Datenherkunft<\/strong>, was die Dokumentation bestimmter Arten von Informationen \u00fcber die Daten bedeutet. <br>Es beantwortet die folgenden und verwandten Fragen:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Woher stammen die Daten?<\/li>\n\n\n\n<li>Wo wurden die Daten gesammelt?<\/li>\n\n\n\n<li>Wie wurden die Daten gesammelt?<\/li>\n\n\n\n<li>Wer hat die Daten gesammelt?<\/li>\n\n\n\n<li>Zu welchem Zweck wurden die Daten gesammelt?<\/li>\n\n\n\n<li>Wie wurden die Daten vorverarbeitet?<\/li>\n\n\n\n<li>Welche spezifischen Eigenschaften haben die Daten?<\/li>\n\n\n\n<li>Welche m\u00f6glichen Einschr\u00e4nkungen haben die Daten?<\/li>\n<\/ul>\n\n\n\n<p>Zus\u00e4tzlich ist es hilfreich, die Data Lineage (Entstehung und Ver\u00e4nderung der Daten) zu verfolgen, d. h. \u00c4nderungen in den Datens\u00e4tzen aufgrund Datenerfassung oder Entfernung sch\u00e4dlicher Proben zu \u00fcberwachen. Das genaue Wissen dar\u00fcber, auf welche Daten ein Modell trainiert wurde, ist entscheidend f\u00fcr die R\u00fcckverfolgung der Ergebnisse.<\/p>\n\n\n\n<p>Um eine pr\u00e4zisere Kontrolle zu erhalten, ist es sinnvoll, einzelne Datenpunkte \u00fcberpr\u00fcfbar und schnell durchsuchbar zu machen. Um noch einen Schritt weiterzugehen, empfiehlt es sich auch, detaillierte Informationen \u00fcber falsch klassifizierte Daten w\u00e4hrend eines Trainingslaufs bereitzustellen. Beides hilft bei der Identifizierung problematischer Datenpunkte, die entfernt oder ge\u00e4ndert werden k\u00f6nnen.<\/p>\n\n\n\n<p>Durch die Einhaltung dieser Praktiken kann die Transparenz von KI-Systemen erh\u00f6ht werden, was dazu beitr\u00e4gt, Bias zu bek\u00e4mpfen, Informationslecks nachzuverfolgen und Sicherheitsverletzungen zu erkennen. Wenngleich diese Schritte die Transparenz verbessern, bleibt es eine Herausforderung, die Ergebnisse von Machine-Learning-Modellen nachzuvollziehen und zu verfolgen. Entwickler sollten sich dieser Einschr\u00e4nkungen bewusst sein, wenn sie neue Modelle trainieren.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Fazit: Ethische Datenverarbeitung bei der Entwicklung von KI sicherstellen<\/h2>\n\n\n\n<p>Wie gezeigt, ist der ethische Umgang mit Daten in KI-Systemen entscheidend, um Fairness, Sicherheit und Transparenz zu gew\u00e4hrleisten. Indem wir diese Aspekte angehen, k\u00f6nnen wir Bias minimieren und personenbezogene Daten sch\u00fctzen, w\u00e4hrend wir Vertrauen aufrechterhalten. Dieser Beitrag soll das Bewusstsein f\u00fcr den ethischen Umgang mit Daten sch\u00e4rfen und Gespr\u00e4che zwischen Benutzern, Entwicklern, Forschern und politischen Entscheidungstr\u00e4gern anregen. Die behandelten Probleme sind weit davon entfernt, gel\u00f6st zu sein, und bleiben aktive Forschungsfelder. Wir hoffen, dass dieser Blogbeitrag Jeder und Jedem eine Orientierung bietet, um ethisch fundierte Modelle zu trainieren.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Erfahre, wie der ethische Umgang mit Trainingsdaten Bias minimiert, Datenschutz gew\u00e4hrleistet und Vertrauen in K\u00fcnstliche Intelligenz f\u00f6rdert.<\/p>\n","protected":false},"author":22,"featured_media":12909,"template":"","meta":{"_acf_changed":false,"footnotes":""},"blog-category":[1416,390],"blog-tag":[1654,1442,1531,1532,1551,1593,1598,1613,1454],"class_list":["post-12910","blog","type-blog","status-publish","has-post-thumbnail","hentry","blog-category-alle-blogbeitraege","blog-category-grundlagen","blog-tag-black-box","blog-tag-eu-ai-act-de","blog-tag-ki-ethik","blog-tag-ki-regulierung","blog-tag-large-language-models-llms-de","blog-tag-sichere-ki","blog-tag-sprachmodelle","blog-tag-trainingsdaten","blog-tag-verzerrung-bias"],"acf":[],"publishpress_future_workflow_manual_trigger":{"enabledWorkflows":[]},"_links":{"self":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/12910","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog"}],"about":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/types\/blog"}],"author":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/users\/22"}],"version-history":[{"count":0,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/12910\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media\/12909"}],"wp:attachment":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media?parent=12910"}],"wp:term":[{"taxonomy":"blog-category","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-category?post=12910"},{"taxonomy":"blog-tag","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-tag?post=12910"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}