{"id":4376,"date":"2023-05-31T05:00:26","date_gmt":"2023-05-31T05:00:26","guid":{"rendered":"https:\/\/lamarr-institute.org\/blog\/object-detection\/"},"modified":"2025-11-12T14:51:13","modified_gmt":"2025-11-12T14:51:13","slug":"object-detection","status":"publish","type":"blog","link":"https:\/\/lamarr-institute.org\/de\/blog\/object-detection\/","title":{"rendered":"Object Detection: Wie Maschinen Objekte erkennen"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Viele allt\u00e4gliche Szenarien erfordern das gleichzeitige Erkennen und Verorten verschiedener Objekte. Als Menschen haben wir die inh\u00e4rente F\u00e4higkeit, mehrere Objekte im Sichtfeld zu erkennen und zu kategorisieren. In einem Supermarkt erkennen wir beispielsweise sowohl Einkaufswagen, andere Personen als auch verschiedenste Lebensmittel. So k\u00f6nnen wir dann bestimmte Produkte finden, auf sie zuzugehen und in den Wagen legen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Aber auch im wirtschaftlichen Kontext sind diese F\u00e4higkeiten besonders f\u00fcr die Bereiche Prozesskontrolle, Automatisierung und Autonomisierung wichtig. Eine maschinelle Nachbildung der Schritte Erkennung und Lokalisierung von Objekten ist daher von hoher Relevanz und ein viel beachtetes Forschungs- und Anwendungsfeld. Die entsprechenden Methoden und Technologien werden unter dem Themenbereich Object Detection zusammengefasst, einem Spezialgebiet der Computer Vision.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Grunds\u00e4tzlich kann zwischen klassischen Verfahren und Methoden des Machine Learning unterschieden werden. In diesem Artikel behandeln wir nur Object Detection Ans\u00e4tze, die auf Machine Learning beruhen, da sie die klassischen Ans\u00e4tze insbesondere im Bereich Genauigkeit weit \u00fcbertreffen [Zou et al, 2023].<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Das Grundger\u00fcst der Object Detection<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Die Herausforderung bei der Object Detection besteht darin, mehrere Objekte gleichzeitig zu klassifizieren und in einem Bild zu verorten. &nbsp;Dazu werden heutzutage \u00fcblicherweise neuronale Netze eingesetzt, die durch <a href=\"https:\/\/lamarr-institute.org\/de\/welche-arten-von-maschinellem-lernen-gibt-es\/\" target=\"_blank\" rel=\"noreferrer noopener\">\u00fcberwachtes Lernen<\/a> trainiert werden. Neben Bildern m\u00fcssen hier zudem auch Annotationen bereitgestellt werden. Diese enthalten Metadaten \u00fcber ein Bild, die ein neuronales Netz ben\u00f6tigt, um zu lernen, wie und wo bestimmte im Bild enthaltenen Objekte zu klassifizieren und lokalisieren sind. Im Fall der Object Detection handelt es sich um rechteckige Rahmen, sogenannte \u201cBounding Boxen\u201d, zur Angabe der Position von Objekten, sowie deren Objektbezeichner.<\/p>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-full\"><img decoding=\"async\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Bus_Object_Detection-1.jpg\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-28418\" title=\"\"><figcaption class=\"wp-element-caption\">\u00a9 Nature Communications\/ CCBY\nF\u00fcr Object Detection enth\u00e4lt die Annotation Informationen dar\u00fcber, wo sich Objekte welcher Klassen befinden.\n\n<\/figcaption><\/figure>\n<\/div>\n\n\n<p class=\"wp-block-paragraph\">Object-Detection-Verfahren basieren auf einer Merkmalsextraktion aus den Eingabebildern. Visuelle Features (Merkmale) sind Eigenschaften in einem Bild, die Aufschluss \u00fcber Bildinhalte geben, beispielsweise Unterschiede in der Helligkeit oder der Farbe. Wie Merkmalsextraktion genau funktioniert und wie aus den gefundenen Informationen eine Klassifikation durchgef\u00fchrt werden kann, wird im bereits erschienen Artikel zur <a href=\"https:\/\/machinelearning-blog.de\/grundlagen\/computer-vision\/\" target=\"_blank\" rel=\"noreferrer noopener\">Computer Vision<\/a> beschrieben. Geeignete Features f\u00fcr einen Datensatz k\u00f6nnen mittels Convolutional Neural Networks (CNN) gelernt werden. Dabei gibt es allgemeine Features, die erst in der Kombination mit anderen Features auf eine bestimmte Klasse hinweisen. Zur Erkennung dieser Basismerkmale werden CNNs h\u00e4ufig auf allgemeinen Datens\u00e4tzen wie <a href=\"https:\/\/paperswithcode.com\/dataset\/imagenet\" target=\"_blank\" rel=\"noreferrer noopener\">ImageNet<\/a> oder <a href=\"https:\/\/cocodataset.org\/#home\" target=\"_blank\" rel=\"noreferrer noopener\">COCO<\/a> vortrainiert. Die trainierten CNNs bilden somit das R\u00fcckgrat der Object-Detection-Netze, weswegen sie auch als Backbone-Architektur beschrieben werden. Die Qualit\u00e4t der auf diese Weise bereitgestellten visuellen Features ist entscheidend f\u00fcr die Leistung der Object-Detection-Algorithmen.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Zentrale Ans\u00e4tze der Object Detection<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Es gibt zwei verschiedene Ans\u00e4tze, um Object Detection auf Basis der Backbone-Architektur umsetzen. Die <strong>Two-Stage-Detektoren<\/strong> erkennen zun\u00e4chst interessante Regionen in einem Bild und f\u00fchren anschlie\u00dfend die Klassifikation und Lokalisierung in diesen Regionen durch. <strong>One-Stage-Detektoren<\/strong> l\u00f6sen beide Schritte in einem, indem sie das Problem so umformulieren, dass beide Teilschritte im Ganzen betrachtet und gemeinsam in einem Schritt optimiert werden.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Betrachten wir die beiden Verfahrenstypen etwas genauer:<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Two-Stage-Verfahren<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">In Two-Stage-Verfahren werden zun\u00e4chst f\u00fcr die Lokalisierung interessante Regionen eines Bildes ermittelt, die f\u00fcr die Object Detection relevante Features enthalten (Region-Proposal-Schritt) [Zou et al, 2023]. Diese interessanten Regionen beschreiben also Bereiche, in denen potenziell Objekte liegen, daher werden sie f\u00fcr die weitere Verarbeitung als \u201cKandidaten-Boxen\u201d gehandhabt. Es gibt verschiedene Methoden, um diese Boxen zu finden. Das 2015 vorgestellte Faster R-CNN nutzte etwa ein speziell f\u00fcr diese Aufgabe entwickeltes Region-Proposal-Netz (RPN) [Ren et al, 2015]. Anschlie\u00dfend werden aus den ermittelten Boxen durch ein weiteres neuronales Netzwerk Box-spezifische Merkmale abgeleitet, die in zweifacher Weise ausgewertet werden. Zum einen f\u00fchrt ein Klassifikator f\u00fcr jede Box eine Klassifikation durch, um festzulegen, um welche Klasse es sich handelt. Zum anderen werden die Kandidaten-Boxen an einen sogenannten \u201cBounding Box Regressor\u201d \u00fcbergeben, der die Boxen an die enthaltenen Objekte anpasst.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">In nachfolgenden Verfahren wurden die Features als Eingaben des RPN oder aber die Art der Weiterverarbeitung der Kandidaten-Boxen ver\u00e4ndert, um die Klassifikationsg\u00fcte oder die Laufzeit zu verbessern.<\/p>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-full\"><img loading=\"lazy\" decoding=\"async\" width=\"15535\" height=\"3780\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-Two-Stage-Detektoren_EN.png\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-17260\" title=\"\" srcset=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-Two-Stage-Detektoren_EN.png 15535w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-Two-Stage-Detektoren_EN-300x73.png 300w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-Two-Stage-Detektoren_EN-1024x249.png 1024w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-Two-Stage-Detektoren_EN-768x187.png 768w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-Two-Stage-Detektoren_EN-1536x374.png 1536w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-Two-Stage-Detektoren_EN-2048x498.png 2048w\" sizes=\"auto, (max-width: 15535px) 100vw, 15535px\" \/><figcaption class=\"wp-element-caption\">\u00a9 Nature Communications\/ CCBY <br>Schematische Architektur von Two-Stage Detektoren.<\/figcaption><\/figure>\n<\/div>\n\n\n<h2 class=\"wp-block-heading\">One-Stage-Verfahren<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Seit 2016 gibt es Netze, die anstelle der bisherigen zweistufigen Verfahren die Schritte Lokalisierung und Klassifikation gleichzeitig betrachten. Diese Verfahren bilden somit die Gruppe der One-Stage-Detektoren. Motivation hinter der Entwicklung war die hohe Komplexit\u00e4t der Two-Stage-Detektoren sowie die damit einhergehende hohe Laufzeit [Zou et al, 2023]. Vorreiter in diesem Gebiet sind der You-Only-Look-Once (YOLO) und der Single-Shot Detektor (SSD). Anstatt beliebige Stellen im Bild zu betrachten, untersuchen beide Verfahren das Eingabebild an festen Positionen auf Objekte unterschiedlicher Gr\u00f6\u00dfe und Ausrichtung. Dadurch ben\u00f6tigen sie kein separates Modul f\u00fcr die Vorfilterung interessanter Regionen und k\u00f6nnen die Zusammenh\u00e4nge von Klassifikation und Verortung bei der Optimierung und Anwendung ber\u00fccksichtigen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Damit waren diese Ans\u00e4tze bereits zum Zeitpunkt ihrer Entwicklung deutlich schneller als Two-Stage-Verfahren. Zudem konnte SSD in der Genauigkeit von Two-Stage Object-Detection-Verfahren mithalten. Seitdem entstanden viele weitere One-Stage-Architekturen unter anderem auch Nachfolger von YOLO, die sich durch verbesserte Laufzeit und Genauigkeit auszeichnen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Durch die ganzheitliche Betrachtung der Aufgaben Klassifikation und Verortung in einstufigen Detektornetzen, k\u00f6nnen auch Konzepte aus anderen Anwendungsfeldern eingesetzt werden, wie beispielsweise <a href=\"https:\/\/deepai.org\/machine-learning-glossary-and-terms\/transformer-neural-network\" target=\"_blank\" rel=\"noreferrer noopener\">Transformer-Netze<\/a> aus dem Bereich Sprachverarbeitung. Forschende sehen darin das Potenzial f\u00fcr einen Paradigmenwechsel in der Herangehensweise an diese Probleme [Zaidi et al, 2022].<\/p>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-full\"><img loading=\"lazy\" decoding=\"async\" width=\"5065\" height=\"1043\" src=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-One-Stage-Detektoren_EN.png\" alt=\"- Lamarr Institute for Machine Learning (ML) and Artificial Intelligence (AI)\" class=\"wp-image-17258\" title=\"\" srcset=\"https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-One-Stage-Detektoren_EN.png 5065w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-One-Stage-Detektoren_EN-300x62.png 300w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-One-Stage-Detektoren_EN-1024x211.png 1024w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-One-Stage-Detektoren_EN-768x158.png 768w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-One-Stage-Detektoren_EN-1536x316.png 1536w, https:\/\/lamarr-institute.org\/wp-content\/uploads\/Architektur-One-Stage-Detektoren_EN-2048x422.png 2048w\" sizes=\"auto, (max-width: 5065px) 100vw, 5065px\" \/><figcaption class=\"wp-element-caption\">\u00a9 Nature Communications\/ CCBY <br>Schematische Architektur von One-Stage Detektoren.<\/figcaption><\/figure>\n<\/div>\n\n\n<h2 class=\"wp-block-heading\">Welches Object-Detection-Verfahren passt f\u00fcr welchen Anwendungsfall?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Generell werden Object-Detection-Architekturen in verschiedenen Varianten entwickelt, um sie vielseitig einsetzbar zu machen. Die Varianten orientieren sich dabei an Anwendungsf\u00e4llen und Endger\u00e4ten. Die Abw\u00e4gung bei der Entwicklung und Anwendung von Object-Detection-Algorithmen findet im Spannungsfeld von Geschwindigkeit, Genauigkeit und Speicherplatz statt [Huang et al, 2017]. Dadurch ergibt sich eine gro\u00dfe Bandbreite an Modellen mit spezifischen Vorteilen f\u00fcr die jeweiligen Anforderungen. Beispielsweise erfordert die Verwendung in Smartphones oder Kameras kleine Modelle mit weniger Modellparametern. Diese liefern zwar schnelle Ergebnisse, jedoch h\u00e4ufig zulasten der Genauigkeit der Bounding-Boxen oder Klassifikationen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Je komplexer die Architektur ist, desto aufw\u00e4ndiger ist auch das Training. Je nach Anwendungsfall ist dann zus\u00e4tzlich abzuw\u00e4gen, ob es \u00fcberhaupt genug Daten gibt, um ein passendes Modell mit einer angestrebten Genauigkeit zu trainieren.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Wir k\u00f6nnen also festhalten: Es gibt nicht das eine Allzweck-Modell f\u00fcr Object-Detection-Fragestellungen. Stattdessen muss f\u00fcr jeden Anwendungsfall neu abgewogen werden, welches Modell unter Ber\u00fccksichtigung der spezifischen Anforderungen die besten Ergebnisse liefert. Die Unterscheidung zwischen One-Stage und Two-Stage Architekturen kann dabei als Orientierung genutzt werden, um verschiedene Modelle vorab zu kategorisieren. Dar\u00fcber hinaus ist die konkrete Architektur des jeweiligen Ansatzes, sowie das gew\u00e4hlte Backbone-Netz zu ber\u00fccksichtigen. F\u00fcr einen \u00dcberblick \u00fcber die verschiedenen Object-Detection-Modelle und ihre Vor- und Nachteile k\u00f6nnen die Arbeiten von Huang et al. und Zaidi et al. herangezogen werden. Sie liefern einen Anhaltspunkt f\u00fcr die Auswahl einer passenden Architektur f\u00fcr den eigenen Anwendungsfall. Dar\u00fcber hinaus bietet die Webseite <a href=\"https:\/\/paperswithcode.com\/\" target=\"_blank\" rel=\"noreferrer noopener\"><em>PapersWithCode<\/em><\/a> einen \u00dcberblick \u00fcber die State-of-the-Art Machine Learning Verfahren in verschiedenen Forschungsfeldern, sowie Datens\u00e4tze und Code zu wissenschaftlichen Ver\u00f6ffentlichungen.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Quellen<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Speed\/accuracy trade-offs for modern convolutional object detectors<\/strong><br>J. Huang et al, <em>Proceedings of the IEEE conference on computer vision and pattern recognition,<\/em> Pages 3296-3297, 2017, <a href=\"https:\/\/ieeexplore.ieee.org\/document\/8099834\" target=\"_blank\" rel=\"noopener\">pdf<\/a><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>A Survey of Deep Learning-Based Object Detection<\/strong><br>L. Jiao et al., <em>IEEE Access<\/em>, vol. 7, Pages 128837-128868, 2019, <a href=\"https:\/\/ieeexplore.ieee.org\/document\/8825470\" target=\"_blank\" rel=\"noopener\">pdf<\/a><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>A survey of modern deep learning based object detection models.<\/strong><br>S.S.A. Zaidi, et al., <em>Digital Signal Processing<\/em>, vol. 126, 2022 <a href=\"https:\/\/www.sciencedirect.com\/science\/article\/pii\/S1051200422001312\" target=\"_blank\" rel=\"noopener\">pdf<\/a><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Object detection in 20 years: A survey<\/strong><br>Z. Zou, et al., <em>Proceedings of the IEEE<\/em>, 2023, <a href=\"https:\/\/ieeexplore.ieee.org\/document\/10028728\" target=\"_blank\" rel=\"noopener\">link<\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Mithilfe von Object-Detection-Verfahren k\u00f6nnen Maschinen darauf trainiert werden, Objekte zu erkennen und zu verorten. In diesem Beitrag geben wir einen \u00dcberblick \u00fcber dieses Teilgebiet der Computer Vision.<\/p>\n","protected":false},"author":16,"featured_media":4383,"template":"","meta":{"_acf_changed":false,"footnotes":""},"blog-category":[1416,390],"blog-tag":[1449,1457,1458,1519,1533,1615],"class_list":["post-4376","blog","type-blog","status-publish","has-post-thumbnail","hentry","blog-category-alle-blogbeitraege","blog-category-grundlagen","blog-tag-autonomes-fahren","blog-tag-computer-vision-de","blog-tag-convolutionale-neuronale-netze","blog-tag-industrie-4-0","blog-tag-klassifikation","blog-tag-ueberwachtes-lernen"],"acf":[],"publishpress_future_workflow_manual_trigger":{"enabledWorkflows":[]},"_links":{"self":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/4376","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog"}],"about":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/types\/blog"}],"author":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/users\/16"}],"version-history":[{"count":0,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog\/4376\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media\/4383"}],"wp:attachment":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media?parent=4376"}],"wp:term":[{"taxonomy":"blog-category","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-category?post=4376"},{"taxonomy":"blog-tag","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/blog-tag?post=4376"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}