{"id":18502,"date":"2025-03-19T09:42:54","date_gmt":"2025-03-19T09:42:54","guid":{"rendered":"https:\/\/lamarr-institute.org\/?post_type=blog&#038;p=18502"},"modified":"2025-11-12T14:54:19","modified_gmt":"2025-11-12T14:54:19","slug":"splitting-stump-forests","status":"publish","type":"blog","link":"https:\/\/lamarr-institute.org\/de\/blog\/splitting-stump-forests\/","title":{"rendered":"Splitting Stump Forests: Ein Modell zur genauen \u201eKomprimierung\u201c?"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Edge AI bezeichnet die Bereitstellung von KI-Algorithmen und KI-Modellen direkt auf lokalen Edge-Ger\u00e4ten. Da die Anzahl der Internet of Things (IoT)-Ger\u00e4te weiterhin zunimmt, w\u00e4chst die Nachfrage nach effizienter Datenverarbeitung. Die Optimierung dieser Modelle f\u00fcr ressourcenbeschr\u00e4nkte Umgebungen bleibt jedoch eine Herausforderung. In diesem Blogbeitrag untersuchen wir <strong>Splitting Stump Forests (SSF)<\/strong>, eine leistungsstarke Kompressionstechnik f\u00fcr Baum-Ensemble-Modelle, die eine effiziente Bereitstellung von Edge AI erm\u00f6glicht.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wie IoT das t\u00e4gliche Leben ver\u00e4ndert<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Haben Sie sich jemals gefragt, wie ein intelligentes Thermostat die Temperatur in Ihrem Haus anpasst? Oder wie Ihre Smartwatch Ihre k\u00f6rperliche Aktivit\u00e4t \u00fcberwacht und sogar Ihre Schlafmuster analysiert? Oder wie eine Sicherheitskamera Ihr Gesicht erkennt?<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Diese Errungenschaften sind alle durch die Innovationen des <em>Internet of Things (IoT)<\/em> m\u00f6glich. Diese Technologie basiert auf Sensoren, die Daten sammeln, die dann an Cloud-Server gesendet werden, um Algorithmen zur Vorhersage und Reaktion auf Ihre Bed\u00fcrfnisse auszuf\u00fchren. Da unsere Umgebung zunehmend \u201eintelligent\u201c wird, wird die weltweite Anzahl von (IoT)-Ger\u00e4ten bis 2030 auf \u00fcber 40 Milliarden gesch\u00e4tzt. Mit diesem Wachstum steigt auch der Bedarf an schnellerer, effizienterer Datenverarbeitung. Hier kommt Edge AI ins Spiel.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Was ist Edge AI?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Edge AI ist die Bereitstellung von KI-Algorithmen und -Modellen direkt auf lokalen Edge-Ger\u00e4ten.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Viele Anwendungen erfordern Echtzeitentscheidungen, wie z. B. intelligente Kameras zur sofortigen Bedrohungserkennung, autonome Fahrsysteme zur Anpassung ihres Weges und industrielle Sensoren zur sofortigen Anomalieerkennung.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Diese Herausforderung treibt die Einf\u00fchrung von Edge AI voran. Durch die lokale Verarbeitung von Daten reduziert oder eliminiert Edge AI die Notwendigkeit der Daten\u00fcbertragung und adressiert Bedenken wie Konnektivit\u00e4t, Kommunikationskosten, Netzwerklatenz und Datenschutz. W\u00e4hrend die Edge-Bereitstellung die Reaktionsf\u00e4higkeit verbessert, erfordert das Erreichen einer h\u00f6heren Vorhersagegenauigkeit oft die Verwendung von Ensemble-Modellen.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Ensemble Models auf IoT-Ger\u00e4ten: Was ist die Herausforderung?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Ensemble-Modelle \u00fcbertreffen oft einzelne Klassifikatoren bei verschiedenen maschinellen Lernaufgaben. Ein <a href=\"https:\/\/de.wikipedia.org\/wiki\/Random_Forest\" target=\"_blank\" rel=\"noopener\">Random Forest<\/a> beispielsweise reduziert die Varianz der Vorhersagen im Vergleich zu einem einzelnen Entscheidungsbaum und verbessert so die Gesamtleistung des Modells. Allerdings sind die Kosten f\u00fcr die Verwendung von Random Forests f\u00fcr ressourcenbeschr\u00e4nkte Ger\u00e4te erheblich h\u00f6her. Die Verwendung nur weniger kleiner B\u00e4ume in einem Random Forest kann die Vorhersageleistung begrenzen, w\u00e4hrend gr\u00f6\u00dfere, leistungsf\u00e4higere Modelle oft schwierig auf Ger\u00e4ten mit begrenztem Flash-Speicher bereitzustellen sind. Dies f\u00fchrt zur folgenden Frage:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>K\u00f6nnen wir die Modellgr\u00f6\u00dfe reduzieren, ohne die Vorhersageleistung zu beeintr\u00e4chtigen?<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Um dies zu adressieren, pr\u00e4sentieren wir <em>Splitting Stump Forests (SSF)<\/em>, ein Kompressionsschema, das speziell f\u00fcr Baum-Ensemble-Modelle, insbesondere Random Forests, entwickelt wurde. Im folgenden Abschnitt erkl\u00e4ren wir die Methode im Detail.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Splitting Stump Forests (SSF)<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Um eine effiziente Komprimierung zu erreichen, extrahiert unser Ansatz (1) eine Teilmenge von Testknoten aus einem trainierten Random Forest, um ein leichtgewichtiges Ensemble von Splitting Stumps zu erstellen, das nur wenige Kilobyte Speicher ben\u00f6tigt. Danach (2) werden Eingabedaten in eine Multi-Hot-Codierung transformiert und (3) ein linearer Klassifikator wird verwendet, um die transformierten Daten in die Ziel-Dom\u00e4ne abzubilden.<\/p>\n\n\n\n<figure class=\"wp-block-image size-full\"><img loading=\"lazy\" decoding=\"async\" width=\"1090\" height=\"454\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Figure_1_diagram.gif\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-18497\" title=\"\"><figcaption class=\"wp-element-caption\">\u00a9 Fouad Alkhoury &amp; Pascal Welke<br>Abbildung 1 zeigt die Vorgehensweise in den drei oben beschriebenen Hauptschritten.<\/figcaption><\/figure>\n\n\n\n<h2 class=\"wp-block-heading\">Erster Schritt: Auswahl informativer Split-Knoten<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Der erste Schritt von Splitting Stump Forest w\u00e4hlt eine Teilmenge informativer Splits aus einem trainierten Random Forest aus.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Um dies zu erreichen, schlagen wir ein Auswahlkriterium vor, das Split-Bedingungen bevorzugt, die zu ausgewogenen Unterb\u00e4umen f\u00fchren. Insbesondere bewerten wir jeden Knoten im Entscheidungsbaum basierend auf dem Gleichgewicht der Trainingsstichproben zwischen seinen linken und rechten \u00c4sten.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Um zu verstehen, warum wir ausgewogene Knoten ausw\u00e4hlen, werfen wir einen genaueren Blick auf Abbildung 2. Sie zeigt die Entscheidungsgrenzen sowohl von Random Forests als auch von Splitting Stump Forests auf zweidimensionalen Projektionen der Statlog- und Rice-Datens\u00e4tze. Im Falle von Random Forests k\u00f6nnten Ihnen kleine, diskontinuierliche Regionen auffallen. Sie treten auf, wenn das Split-Kriterium einen relativ kleinen Teil der Trainingsdaten mit reinen Labels abschneidet. Dies k\u00f6nnte sich nachteilig auf die Generalisierung auswirken, da es zu Overfitting f\u00fchrt und das Modell empfindlicher gegen\u00fcber Rauschen und Ausrei\u00dfern macht.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"214\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/\/Figure_2_decision_boundaries-1024x214.png\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-18499\" title=\"\" srcset=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Figure_2_decision_boundaries-1024x214.png 1024w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Figure_2_decision_boundaries-300x63.png 300w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Figure_2_decision_boundaries-768x161.png 768w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Figure_2_decision_boundaries-1536x321.png 1536w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Figure_2_decision_boundaries.png 1540w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\" \/><figcaption class=\"wp-element-caption\">\u00a9 Fouad Alkhoury &amp; Pascal Welke<br>Abbildung 2: Beispiel f\u00fcr Entscheidungsgrenzen bei der Datenklassifizierung zwischen Random Forests (RF) und Splitting Stump Forests (SSF) auf zweidimensionalen Projektionen von zwei Datens\u00e4tzen.<\/figcaption><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Aber hier ist der \u00fcberraschende Teil: Die Methode der Splitting Stump Forests erreicht fast das gleiche Ma\u00df an Genauigkeit, obwohl sie nur 0,2 % der gesamten Knoten verwendet, die vom Random Forest eingesetzt werden.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Beeindruckend, oder? Sehen wir uns nun an, was nach der Auswahl dieser ausgewogenen Knoten passiert.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Zweiter Schritt: Umwandlung von Knoten in Stumps<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Das Ergebnis des vorherigen Schritts ist eine Menge isolierter Knoten, die jeweils ein Merkmal und einen Split-Wert repr\u00e4sentieren, aber noch kein strukturiertes Modell bilden. Um dies zu l\u00f6sen, f\u00fcgen wir jedem Knoten zwei Bl\u00e4tter hinzu und verwandeln ihn so in die Wurzel eines einfachen Entscheidungsbaums mit nur einer Ebene. Jetzt kann man die Eingabedaten in einen neuen Merkmalsvektor abbilden, wobei der Wert &#8218;1&#8216; im Merkmalsvektor anzeigt, dass die Split-Bedingung seines Wurzelknotens erf\u00fcllt ist.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Dritter Schritt: Leichtgewichtige Trainierung von Splitting Stump Forests<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Um die Bereitstellung auf Ger\u00e4ten mit begrenzten Ressourcen zu erm\u00f6glichen, verwenden wir ein <a href=\"https:\/\/lamarr-institute.org\/de\/blog\/was-ist-eine-lineare-regression\/\">lineares Modell<\/a>, um die individuellen Vorhersagen der Entscheidungsb\u00e4ume zu kombinieren. Durch die Anwendung von logistischer Regression modellieren wir die Beziehung zwischen den transformierten Merkmalsvektoren und der Zielvariablen. Das Ergebnis ist ein Modell, das nicht nur ressourcenschonend, sondern auch leicht interpretierbar ist.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Erforschung der Leistung von Splitting Stump Forests<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Um die Leistung von Splitting Stump Forests (SSF) zu testen, haben wir es auf 13 Benchmark-Klassifikationsdatens\u00e4tzen, haupts\u00e4chlich aus dem UCI-Repository, mit unterschiedlichen Eigenschaften bewertet. Diese vielf\u00e4ltige Auswahl erm\u00f6glichte eine Bewertung \u00fcber verschiedene Komplexit\u00e4ten hinweg. Wir haben Random Forests mit der Gini-Index-Reduktion f\u00fcr das Splitting trainiert, indem wir die maximale Tiefe einzelner Entscheidungsb\u00e4ume und die Gesamtzahl der Entscheidungsb\u00e4ume variiert haben.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Wenn es um die Vorhersageleistung geht, \u00fcbertraf SSF in den meisten L\u00e4ufen die urspr\u00fcnglichen Random Forests und modernste Methoden. Noch beeindruckender ist, dass SSF die Modellgr\u00f6\u00dfe im Vergleich zu anderen Methoden um zwei bis drei Gr\u00f6\u00dfenordnungen erheblich reduzierte und seine Inferenzzeit schneller war als die der leistungsst\u00e4rksten Modelle konkurrierender Methoden. Dar\u00fcber hinaus best\u00e4tigen die Ergebnisse, dass die ausgew\u00e4hlten Testknoten informativ und nicht zuf\u00e4llig sind.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Analyse der Vorhersageleistung unter Speicherbeschr\u00e4nkungen<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Aufgrund von Speicherbeschr\u00e4nkungen bei kleinen Smart Devices analysieren wir die Leistung von Splitting Stump Forest innerhalb eines strikten Speicherbudgets. Um Ger\u00e4te mit begrenzter Speicherkapazit\u00e4t zu ber\u00fccksichtigen, haben wir die besten Modelle ausgew\u00e4hlt, die in nur 32 KB oder 16 KB Speicher passen. Solche Modelle eignen sich f\u00fcr den Einsatz auf Mikrocontroller-Einheiten wie Arduino Uno und ATmega169P. Wie in Abbildung 3 gezeigt, \u00fcbertrafen die Splitting Stump Forest-Modelle die Random-Forest (RF)-Modelle in allen Datens\u00e4tzen, mit einer bemerkenswerten Verbesserung von \u00fcber 3 % in f\u00fcnf Datens\u00e4tzen. Dies zeigt, dass man f\u00fcr Effizienz nicht auf Leistung verzichten muss!<\/p>\n\n\n\n<figure class=\"wp-block-image size-full\"><img loading=\"lazy\" decoding=\"async\" width=\"775\" height=\"407\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Figure_3_32kb.png\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-18495\" title=\"\" srcset=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Figure_3_32kb.png 775w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Figure_3_32kb-300x158.png 300w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Figure_3_32kb-768x403.png 768w\" sizes=\"auto, (max-width: 775px) 100vw, 775px\" \/><figcaption class=\"wp-element-caption\">\u00a9 Fouad Alkhoury &amp; Pascal Welke <br>Abbildung 3: Das Diagramm zeigt das beste Modell, das von RF und SSF mit einer endg\u00fcltigen Modellgr\u00f6\u00dfe von weniger als 32 KB erreicht wurde.<\/figcaption><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Als erg\u00e4nzendes Experiment haben wir die Grenzen der Kompression weiter ausgelotet, indem wir einen leichten Genauigkeitsverlust in Kauf nahmen. Unser Ziel war es, das kleinste SSF-Modell zu identifizieren, das innerhalb einer Genauigkeitsmarge von 2 % im Vergleich zum Random-Forest-Modell liegt. Die Ergebnisse waren beeindruckend: Die Splitting Stump Forest-Methode erreichte bemerkenswerte Kompressionswerte von 0,012, 0,02, 0,017, 0,025, 0,037 und 0,005 f\u00fcr die Spambase-, Shoppers-, Adult-, Room-, Rice- und Bank-Datens\u00e4tze.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Sind die ausgew\u00e4hlten Knoten wirklich informativ?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Um die Informationsdichte der ausgew\u00e4hlten Knoten zu validieren, verglichen wir ihre Vorhersageleistung mit der einer zuf\u00e4llig ausgew\u00e4hlten Stichprobe derselben Gr\u00f6\u00dfe. F\u00fcr einen gegebenen Datensatz berichteten wir sowohl die Genauigkeit als auch die Anzahl der hoch bewerteten Knoten $n$. Anschlie\u00dfend w\u00e4hlten wir zuf\u00e4llig $n$ Knoten aus der gesamten Knotenmengen aus, wandelten sie in Splitting Stumps um und trainierten ein lineares Modell unter Verwendung ihrer Datenrepr\u00e4sentation.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Wir stellten fest, dass stichprobenbasierte Stumps ihre zuf\u00e4llig gew\u00e4hlten Gegenst\u00fccke in den meisten Datens\u00e4tzen durchgehend \u00fcbertrafen. Dar\u00fcber hinaus \u00fcbertrafen diese hoch bewerteten Stumps auch eine \u00e4quivalente Menge an niedriger bewerteten Knoten, was best\u00e4tigt, dass Knoten mit h\u00f6herer Trennsch\u00e4rfe erheblich n\u00fctzlichere Informationen liefern.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Fazit<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Zusammenfassend komprimieren Splitting Stump Forests (SSF) einen gro\u00dfen Random Forest in ein kompaktes Modell, ohne an Genauigkeit zu verlieren. Die komprimierten Modelle sind f\u00fcr ressourcenbeschr\u00e4nkte Edge-Ger\u00e4te geeignet.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Diese Ergebnisse werfen interessante Fragen f\u00fcr zuk\u00fcnftige Forschungen auf, insbesondere zur Entwicklung praktischer Bereitstellungsstrategien f\u00fcr Edge-Ger\u00e4te. Dies ist entscheidend, um sicherzustellen, dass die Vorteile der Modellkomprimierung in realen Anwendungen voll genutzt werden k\u00f6nnen, insbesondere im Zuge der fortschreitenden Integration von machinellem Lernen Modellen in Edge-Ger\u00e4te.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">M\u00f6chten Sie die vollst\u00e4ndige Studie lesen? Sie k\u00f6nnen das Paper hier finden:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Alkhoury, F., Welke, P. (2025). Splitting Stump Forests: Tree Ensemble Compression for Edge Devices. In: Pedreschi, D., Monreale, A., Guidotti, R., Pellungrini, R., Naretto, F. (eds) Discovery Science. DS 2024. Lecture Notes in Computer Science (LNAI), vol 15244. Springer, Cham. <a href=\"https:\/\/doi.org\/10.1007\/978-3-031-78980-9_1\" target=\"_blank\" rel=\"noopener\">https:\/\/doi.org\/10.1007\/978-3-031-78980-9_1<\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Edge AI erm\u00f6glicht die lokale Bereitstellung von KI-Modellen f\u00fcr effiziente Datenverarbeitung, aber die Optimierung ist eine Herausforderung. Dieser Beitrag untersucht Splitting Stump Forests (SSF), eine leistungsstarke Kompressionstechnik f\u00fcr eine effiziente Edge-AI-Bereitstellung.<\/p>\n","protected":false},"author":22,"featured_media":20383,"template":"","meta":{"_acf_changed":false,"footnotes":""},"blog-category":[1416,396],"blog-tag":[1483,1518,1521,1557],"class_list":["post-18502","blog","type-blog","status-publish","has-post-thumbnail","hentry","blog-category-alle-blogbeitraege","blog-category-forschung","blog-tag-entscheidungsbaum","blog-tag-hybrides-maschinelles-lernen","blog-tag-internet-of-things-iot-de","blog-tag-nachhaltige-ki"],"acf":[],"publishpress_future_workflow_manual_trigger":{"enabledWorkflows":[]},"_links":{"self":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/18502","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog"}],"about":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/types\/blog"}],"author":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/users\/22"}],"version-history":[{"count":0,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/18502\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media\/20383"}],"wp:attachment":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media?parent=18502"}],"wp:term":[{"taxonomy":"blog-category","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-category?post=18502"},{"taxonomy":"blog-tag","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-tag?post=18502"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}